API Gemini 3.5 Flash pour les questions-réponses visuelles, l'OCR, l'analyse d'images et le raisonnement multimodal. Accès stable pour les applications d'IA en production.
Modèles Gemini 3.5 Flash associés
Exemples d'API
Exemple d'envoi
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.5-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Exemple d'envoi
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.5-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Exemple d'envoi
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Tarifs de Gemini 3.5 Flash Image to Text
| Paramètres | Prix | Prix d’origine | Remise |
|---|
README
API Gemini 3.5 Flash Image-to-Text rapide et abordable (modèle efficace de compréhension visuelle de Google)
L'API Gemini 3.5 Flash Image-to-Text sur Flaq AI donne accès au modèle Google pour la compréhension visuelle rapide, l'analyse d'images et les workflows de raisonnement multimodal. Cette intégration efficace de l'API Gemini aide les développeurs à transformer des images importées en descriptions, détails extraits, réponses et synthèses structurées via une route gérée stable. Elle est conçue pour les équipes qui ont besoin d'une capacité image-to-text réactive sans construire d'infrastructure propre au fournisseur.
Fonctionnalités clés de l'API Gemini 3.5 Flash Image-to-Text
- Compréhension visuelle rapide : Analysez images, captures d'écran, objets, mises en page et détails visuels avec le comportement réactif du modèle Gemini.
- Réponses ancrées dans l'image : Posez des questions en langage naturel sur les images importées et recevez des réponses textuelles ciblées.
- Accès API économique : Créez des workflows d'analyse visuelle à fort volume via une route Gemini gérée et abordable.
- Sortie tenant compte de la conversation : Prenez en charge les questions de suivi et la revue d'image itérative avec un contexte flexible.
- Contrôles adaptés aux développeurs : Orientez la longueur de réponse, le niveau de détail et la direction de la tâche grâce à une configuration pratique sur Flaq AI.
- Intégration prête pour la production : Ajoutez la capacité image-to-text aux applications, outils et workflows internes sans gérer l'infrastructure de modèles.
Comment utiliser l'API Gemini 3.5 Flash Image-to-Text pour l'analyse visuelle sur Flaq AI
- Entrée : Contenu d'image importé plus instructions en langage naturel décrivant la tâche d'analyse, d'extraction ou de raisonnement.
- Sortie : Descriptions textuelles, détails extraits, raisonnement visuel ou synthèses structurées à partir des images importées.
- Configuration de route : Conçue pour des workflows ciblés de compréhension d'images avec prise en charge d'entrée image propre à la route.
- Configuration : Prend en charge des contrôles de sortie pratiques pour la longueur de réponse, le niveau de détail et la direction de la tâche.
- Capacités : Compréhension d'images, extraction de type OCR, QA visuelle, revue de captures d'écran, inspection de produits et raisonnement multimodal via une intégration Gemini API abordable.
Meilleurs cas d'utilisation pour l'intégration de l'API Gemini 3.5 Flash Image-to-Text
- Revue de captures d'écran et d'UI : Extrayez les détails clés de captures d'interface, tableaux de bord et captures de produit.
- Analyse de produits et catalogues : Générez des descriptions de produits, identifiez des attributs et résumez les différences visuelles.
- Compréhension d'images documentaires : Lisez des mises en page visuelles, formulaires, reçus et supports de référence basés sur image.
- QA d'actifs créatifs : Examinez publicités, visuels sociaux, maquettes et exports de design pour les détails de contenu.
- Workflows d'accessibilité : Produisez des descriptions d'images et des synthèses visuelles qui rendent les médias plus faciles à comprendre et à réutiliser.
Remarque Veuillez vous assurer que les prompts, les images importées et les workflows applicatifs respectent les consignes de sécurité de Google. En cas d'erreur, vérifiez l'entrée pour détecter du contenu restreint, simplifiez la demande, puis réessayez.
Gemini 3.5 Flash Image-to-Text face aux concurrents : analyse comparative
-
Gemini 3.5 Flash vs GPT Image-to-Text
Les routes GPT image-to-text offrent un comportement multimodal natif OpenAI. Gemini 3.5 Flash fournit une route rapide de modèle Google pour une compréhension visuelle économique sur Flaq AI. -
Gemini 3.5 Flash vs Claude File Analysis
Claude file analysis est solide pour le raisonnement attentif sur documents et pièces jointes. Gemini 3.5 Flash Image-to-Text se concentre sur la compréhension d'image réactive et la QA visuelle. -
Gemini 3.5 Flash vs Grok Image-to-Text
Grok Image-to-Text offre le comportement du modèle xAI pour l'analyse visuelle. Gemini 3.5 Flash fournit une alternative Google avec un accès API géré efficace. -
Gemini 3.5 Flash vs Qwen Vision Workflows
Les workflows de vision Qwen sont attractifs pour les utilisateurs de modèles Alibaba. Gemini 3.5 Flash convient bien aux équipes qui veulent une intégration Google image-to-text rapide. -
Gemini 3.5 Flash vs modèles Llama Vision
Les modèles Llama vision offrent une flexibilité de déploiement de modèles ouverts. Gemini 3.5 Flash supprime le travail d'hébergement et donne aux développeurs une route gérée stable.