Les modèles de vision acceptent des images en même temps que du texte, ce qui leur permet de décrire, classer et répondre à des questions sur ce qu'ils voient.
Démarrage rapide
shell
ollama run gemma4 ./image.png whats in this image?Utilisation avec l'API d'Ollama
Fournissez un tableau images. Les SDK acceptent des chemins de fichiers, des URL ou des données brutes, tandis que l'API REST attend des données d'image encodées en base64.
cURL
```shell
# 1. Télécharger une image d'exemple
curl -L -o test.jpg "https://upload.wikimedia.org/wikipedia/commons/3/3a/Cat03.jpg"
# 2. Encoder l'image
IMG=$(base64 < test.jpg | tr -d '\n')
# 3. Envoyer à Ollama
curl -X POST http://localhost:11434/api/chat \
-H "Content-Type: application/json" \
-d '{
"model": "gemma4",
"messages": [{
"role": "user",
"content": "What is in this image?",
"images": ["'"$IMG"'"]
}],
"stream": false
}'
```
Python
```python
from ollama import chat
# from pathlib import Path
# Passer le chemin de l'image
path = input('Please enter the path to the image: ')
# Vous pouvez également passer des données d'image encodées en base64
# img = base64.b64encode(Path(path).read_bytes()).decode()
# ou les données brutes
# img = Path(path).read_bytes()
response = chat(
model='gemma4',
messages=[
{
'role': 'user',
'content': 'What is in this image? Be concise.',
'images': [path],
}
],
)
print(response.message.content)
```
JavaScript
```javascript
import ollama from 'ollama'
const imagePath = '/absolute/path/to/image.jpg'
const response = await ollama.chat({
model: 'gemma4',
messages: [
{ role: 'user', content: 'What is in this image?', images: [imagePath] }
],
stream: false,
})
console.log(response.message.content)
```