Prova Gemini 3.6 Flash API per Image-to-Text, Q&A visivo, OCR, analisi e risposte multimodali in streaming tramite l’accesso stabile di Flaq AI all’API Google.
Modelli Gemini 3.6 Flash correlati
Esempi API
Esempio di invio
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Esempio di invio
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Esempio di invio
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Prezzi di Gemini 3.6 Flash Image to Text
| Parametri | Prezzo | Prezzo originale | Sconto |
|---|
README
API image-to-text Gemini 3.6 Flash veloce ed efficiente
L'API image-to-text Gemini 3.6 Flash offre alle applicazioni Flaq AI un percorso mirato dall'input visivo a un testo utile. Basata sul modello multimodale Gemini 3.6 Flash di Google, la route combina un'immagine con un'istruzione per consentire ai team di porre domande, estrarre osservazioni, spiegare screenshot e preparare contenuti visivi per i flussi di lavoro successivi. L'integrazione rimane volutamente circoscritta: una richiesta visiva mirata produce testo anziché contenuti multimediali generati.
Funzionalità principali dell'API image-to-text Gemini 3.6 Flash
-
Comprensione visiva multimodale: Combina un'immagine e un'istruzione in linguaggio naturale per creare descrizioni visive, risposte e analisi fondate.
-
Risposte efficienti a domande sulle immagini: Usa la famiglia di modelli Flash per attività visive reattive come la spiegazione di screenshot, l'estrazione dei dettagli dei prodotti e il confronto tra immagini.
-
Flusso di lavoro visivo mirato: Mantieni ogni richiesta incentrata su un input di immagine specifico, rendendo la route semplice da usare nelle funzionalità dei prodotti e nelle code di revisione.
-
Invio documentato delle immagini: Invia le immagini tramite il modello di richiesta Flaq AI configurato più adatto al flusso di caricamento e archiviazione della tua applicazione.
-
Contesto basato sui messaggi: Aggiungi indicazioni di sistema, intento dell'utente e contesto della conversazione alle domande visive quando l'attività richiede vincoli più chiari.
-
Integrazione incentrata sul testo: Ricevi testo adatto alla visualizzazione, revisione, instradamento e automazione senza considerare l'endpoint un servizio di generazione di immagini.
Come usare l'API image-to-text Gemini 3.6 Flash su Flaq AI
-
Ingresso: Un'immagine supportata abbinata a un prompt che specifichi la domanda, la descrizione, l'estrazione o il confronto richiesto.
-
Uscita: Risposte testuali basate sull'immagine fornita e sul contesto della richiesta.
-
Invio dell'immagine: Fornisci un'immagine secondo il formato di richiesta Flaq AI configurato.
-
Funzionalità: Risposte a domande visive, spiegazione di screenshot, sintesi di immagini, estrazione di dettagli e stesura di contenuti basati sulle immagini.
Migliori casi d'uso per integrare l'API image-to-text Gemini 3.6 Flash
-
Revisione di interfacce e prodotti: Trasforma gli screenshot in descrizioni dell'interfaccia, bozze di segnalazioni di bug, note visive di QA o feedback di progettazione utilizzabili.
-
Arricchimento dei cataloghi: Estrai gli attributi visibili e prepara descrizioni dei prodotti per flussi commerciali e di inventario sottoposti a revisione umana.
-
Valutazione dell'assistenza clienti: Interpreta screenshot e immagini inviate dagli utenti per suggerire domande, risposte e decisioni di smistamento ai team di supporto.
-
Assistenza all'accessibilità: Produci bozze di descrizioni delle immagini e sintesi visive che gli editor possano esaminare e perfezionare prima della pubblicazione.
-
Spiegazione di documenti e diagrammi: Aiuta gli utenti a comprendere grafici, diagrammi, slide e riferimenti visivi tramite un testo generato chiaro.
Nota Questa route è configurata per un input mirato di immagini e un output testuale. Esamina i risultati derivati dalle immagini prima di usarli per decisioni critiche in materia di sicurezza, legali, mediche, finanziarie o di conformità.
API image-to-text Gemini 3.6 Flash e concorrenti: analisi comparativa
-
Gemini 3.6 Flash Image-to-Text e Gemini 3.5 Flash Image-to-Text a confronto
Gemini 3.5 Flash offre un'opzione consolidata per le attività image-to-text. Gemini 3.6 Flash è la generazione di modello più recente per i team che desiderano un'API multimodale efficiente con un ragionamento e un supporto alla pianificazione legata alla programmazione più avanzati. -
Gemini 3.6 Flash Image-to-Text e Gemini 3.7 Flash Image-to-Text a confronto
Gemini 3.7 Flash è il modello Flash più recente per flussi di lavoro complessi, agentici e multimodali. Gemini 3.6 Flash offre una route equilibrata di comprensione visiva quando la priorità è un flusso image-to-text mirato. -
Gemini 3.6 Flash Image-to-Text e Grok 4.6 Image-to-Text a confronto
Grok 4.6 è una valida alternativa di xAI per il ragionamento tecnico basato sulle immagini. Gemini 3.6 Flash offre la famiglia di modelli multimodali di Google con un'integrazione Flaq AI mirata per le domande visive e le operazioni sui contenuti. -
Gemini 3.6 Flash Image-to-Text e GPT 5.6 Terra Image-to-Text a confronto
I modelli visivi GPT 5.6 Terra supportano un'ampia gamma di scenari applicativi multimodali. Gemini 3.6 Flash è una valida scelta da valutare quando i team richiedono una route efficiente basata su Gemini per screenshot, prodotti e output testuali fondati sulle immagini. -
Gemini 3.6 Flash Image-to-Text e Claude Vision a confronto
I modelli visivi Claude possono essere adatti ai documenti e alle attività esplicative. Gemini 3.6 Flash offre un'altra opzione API pronta per la produzione per l'analisi visiva con una chiara delimitazione tra immagine e testo.