Essayez Gemini 3.7 Flash API pour Image-to-Text, les Q&R visuelles, l’OCR, l’analyse et les réponses multimodales en streaming via l’accès stable de Flaq AI à l’API Google.
Modèles Gemini 3.7 Flash associés
Exemples d'API
Exemple d'envoi
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.7-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Exemple d'envoi
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.7-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Exemple d'envoi
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Tarifs de Gemini 3.7 Flash Image to Text
| Paramètres | Prix | Prix d’origine | Remise |
|---|
README
API Gemini 3.7 Flash Image-to-Text rapide et économique
L'API Gemini 3.7 Flash Image-to-Text connecte les applications Flaq AI au dernier modèle Flash de Google pour une compréhension visuelle rapide et performante. Envoyez une image ciblée accompagnée d'une instruction claire afin de produire un texte qui décrit, explique, extrait ou analyse le contenu visuel. Cette voie associe les atouts multimodaux et de raisonnement de Gemini 3.7 Flash à une délimitation d'entrée Flaq AI volontairement ciblée, ce qui la rend parfaitement adaptée aux fonctionnalités produit réactives et aux workflows de revue.
Fonctionnalités clés de l'API Gemini 3.7 Flash Image-to-Text
-
Raisonnement visuel avancé : Transformez les questions fondées sur une image en réponses textuelles claires qui reflètent le contexte visuel fourni et les instructions de la tâche.
-
Workflow multimodal économique : Utilisez une configuration Flash très abordable pour les fonctionnalités d'analyse visuelle qui nécessitent une sortie textuelle performante à grande échelle.
-
Requête d'image ciblée : Centrez chaque interaction sur une entrée visuelle et un objectif précis, ce qui aide les applications à produire des résultats plus clairs et plus faciles à vérifier.
-
Transmission d'image documentée : Envoyez l'image au moyen du modèle de requête d'API Flaq AI configuré.
-
Prise en charge du contexte des messages : Associez la requête visuelle à des messages système, utilisateur et assistant structurés lorsque la tâche nécessite des instructions, des critères ou un contexte de suivi.
-
Intégration d'API réactive : Choisissez le streaming ou la livraison d'une réponse complète selon les assistants interactifs, les tâches de revue asynchrones et les outils internes.
Comment utiliser l'API Gemini 3.7 Flash Image-to-Text sur Flaq AI
-
Entrée : Une image prise en charge avec un prompt en langage naturel définissant la description, la question, l'extraction ou l'analyse demandée.
-
Sortie : Réponses textuelles pour les expériences utilisateur, la vérification humaine, les workflows de contenu et l'automatisation en aval.
-
Transmission de l'image : Utilisez le format de requête Flaq AI configuré pour l'image d'entrée.
-
Capacités : Réponse aux questions fondées sur une image, interprétation de captures d'écran, extraction de détails visuels, résumé d'image et rédaction de contenu.
Meilleurs cas d'usage pour l'intégration de l'API Gemini 3.7 Flash Image-to-Text
-
Expériences produit visuelles : Ajoutez des questions sur les images, une assistance à la recherche visuelle et des explications contextuelles aux applications destinées aux utilisateurs.
-
Revue de conception et d'assurance qualité : Générez des notes préliminaires à partir de captures d'écran d'interface, d'images produit, de diagrammes et de retours visuels, en vue d'une vérification humaine.
-
Workflows de support : Aidez les agents à interpréter les images et captures d'écran des clients, à identifier les détails utiles et à préparer des brouillons de réponse ou d'escalade.
-
Opérations commerciales et de catalogue : Extrayez les attributs visibles, rédigez des descriptions et facilitez la revue éditoriale des images produit.
-
Workflows d'accessibilité et de contenu : Créez des descriptions provisoires vérifiables et des résumés visuels afin d'aider les équipes éditoriales à préparer du contenu accessible.
Remarque La voie Flaq AI actuelle est conçue pour une entrée d'image ciblée et une sortie textuelle. N'utilisez pas l'analyse générée comme unique fondement de décisions importantes ; conservez une vérification humaine et une validation des sources appropriées.
API Gemini 3.7 Flash Image-to-Text face à la concurrence : analyse comparative
-
Gemini 3.7 Flash Image-to-Text vs Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash offre une voie multimodale équilibrée pour les questions et opérations sur les images. Gemini 3.7 Flash est le nouveau modèle Flash à évaluer lorsque la tâche visuelle bénéficie également d'un raisonnement en plusieurs étapes plus avancé. -
Gemini 3.7 Flash Image-to-Text vs Grok 4.6 Image-to-Text
Grok 4.6 est une option xAI pour le raisonnement technique fondé sur les images. Gemini 3.7 Flash fournit une voie très économique vers un modèle Google pour les questions visuelles, les captures d'écran et les fonctionnalités produit axées sur le texte. -
Gemini 3.7 Flash Image-to-Text vs GPT 5.6 Terra Image-to-Text
Les modèles visuels GPT 5.6 Terra prennent en charge de nombreuses applications multimodales. Gemini 3.7 Flash est une alternative convaincante pour les équipes souhaitant un modèle Flash efficace destiné à l'analyse d'image ciblée et au texte généré. -
Gemini 3.7 Flash Image-to-Text vs Claude Vision
Les modèles de vision Claude peuvent constituer un excellent choix pour les tâches explicatives et orientées documents. Gemini 3.7 Flash offre une API réactive de compréhension visuelle aux équipes qui évaluent des workflows multimodaux économiques. -
Gemini 3.7 Flash Image-to-Text vs Gemini 3.7 Flash Text-to-Text
Text-to-Text est optimisé pour les prompts sans entrée visuelle. Image-to-Text est la voie la plus adaptée lorsque la réponse doit être fondée sur une image fournie ainsi que sur des instructions écrites.