Essayez Gemini 3.6 Flash API pour Image-to-Text, les Q&R visuelles, l’OCR, l’analyse et les réponses multimodales en streaming via l’accès stable de Flaq AI à l’API Google.
Modèles Gemini 3.6 Flash associés
Exemples d'API
Exemple d'envoi
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Exemple d'envoi
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Exemple d'envoi
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Tarifs de Gemini 3.6 Flash Image to Text
| Paramètres | Prix | Prix d’origine | Remise |
|---|
README
API image vers texte Gemini 3.6 Flash rapide et efficace
L'API image vers texte Gemini 3.6 Flash offre aux applications Flaq AI un parcours ciblé de l'entrée visuelle au texte utile. Basée sur le modèle multimodal Gemini 3.6 Flash de Google, la route associe une image à une instruction afin que les équipes puissent poser des questions, extraire des observations, expliquer des captures d'écran et préparer du contenu visuel pour les flux de travail en aval. L'intégration reste délibérément restreinte : une demande visuelle ciblée produit du texte plutôt qu'un média généré.
Fonctionnalités clés de l'API image vers texte Gemini 3.6 Flash
-
Compréhension visuelle multimodale : Associez une image et une instruction en langage naturel pour créer des descriptions visuelles, des réponses et des analyses fondées.
-
Réponses efficaces aux questions sur les images : Utilisez la famille de modèles Flash pour des tâches visuelles réactives telles que l'explication de captures d'écran, l'extraction de détails de produits et la comparaison d'images.
-
Flux de travail visuel ciblé : Maintenez chaque requête centrée sur une entrée d'image précise, ce qui rend la route simple à utiliser dans les fonctionnalités de produit et les files de révision.
-
Envoi d'images documenté : Envoyez des images via le modèle de requête Flaq AI configuré qui convient au flux de téléversement et de stockage de votre application.
-
Contexte basé sur les messages : Ajoutez des consignes système, l'intention de l'utilisateur et le contexte de la conversation autour des questions visuelles lorsque la tâche nécessite des contraintes plus claires.
-
Intégration centrée sur le texte : Recevez du texte adapté à l'affichage, la révision, l'acheminement et l'automatisation sans considérer l'endpoint comme un service de génération d'images.
Comment utiliser l'API image vers texte Gemini 3.6 Flash sur Flaq AI
-
Entrée : Une image prise en charge accompagnée d'un prompt qui précise la tâche de question, de description, d'extraction ou de comparaison à effectuer.
-
Sortie : Réponses textuelles fondées sur l'image fournie et le contexte de la requête.
-
Envoi de l'image : Fournissez une image conformément au format de requête Flaq AI configuré.
-
Capacités : Réponse aux questions visuelles, explication de captures d'écran, résumé d'images, extraction de détails et rédaction de contenu fondée sur les images.
Meilleurs cas d'usage pour l'intégration de l'API image vers texte Gemini 3.6 Flash
-
Révision d'interfaces et de produits : Transformez des captures d'écran en descriptions d'interface, brouillons de rapports de bogue, notes visuelles de QA ou commentaires de conception exploitables.
-
Enrichissement de catalogues : Extrayez les attributs visibles et rédigez des descriptions de produits pour les flux commerciaux et d'inventaire soumis à une révision humaine.
-
Triage de l'assistance client : Interprétez les captures d'écran et les images envoyées par les utilisateurs pour suggérer des questions, des réponses et des décisions d'acheminement aux équipes d'assistance.
-
Aide à l'accessibilité : Produisez des brouillons de descriptions d'images et de résumés visuels que les éditeurs peuvent réviser et affiner avant publication.
-
Explication de documents et de diagrammes : Aidez les utilisateurs à comprendre les graphiques, diagrammes, diapositives et références visuelles grâce à un texte généré clair.
Remarque Cette route est configurée pour une entrée d'image ciblée et une sortie textuelle. Vérifiez les résultats dérivés des images avant de les utiliser pour des décisions critiques liées à la sécurité, juridiques, médicales, financières ou de conformité.
API image vers texte Gemini 3.6 Flash face à la concurrence : analyse comparative
-
Gemini 3.6 Flash Image-to-Text et Gemini 3.5 Flash Image-to-Text
Gemini 3.5 Flash offre une option reconnue pour les tâches image vers texte. Gemini 3.6 Flash est la nouvelle génération de modèle destinée aux équipes qui souhaitent une API multimodale efficace avec un raisonnement et une prise en charge de la planification liée à la programmation renforcés. -
Gemini 3.6 Flash Image-to-Text et Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash est le modèle Flash le plus récent pour les flux de travail agentiques et multimodaux complexes. Gemini 3.6 Flash offre une route équilibrée de compréhension visuelle lorsqu'un flux image vers texte ciblé est prioritaire. -
Gemini 3.6 Flash Image-to-Text et Grok 4.6 Image-to-Text
Grok 4.6 est une alternative xAI utile pour le raisonnement technique fondé sur les images. Gemini 3.6 Flash offre la famille de modèles multimodaux de Google avec une intégration Flaq AI ciblée pour les questions visuelles et les opérations de contenu. -
Gemini 3.6 Flash Image-to-Text et GPT 5.6 Terra Image-to-Text
Les modèles visuels GPT 5.6 Terra prennent en charge de nombreux scénarios d'applications multimodales. Gemini 3.6 Flash est un excellent choix à évaluer lorsque les équipes ont besoin d'une route efficace basée sur Gemini pour les captures d'écran, les produits et les sorties textuelles fondées sur les images. -
Gemini 3.6 Flash Image-to-Text et Claude Vision
Les modèles de vision Claude peuvent être adaptés aux documents et aux tâches explicatives. Gemini 3.6 Flash offre une autre option d'API prête pour la production pour l'analyse visuelle avec une délimitation claire entre image et texte.