Prova Grok 4.6 API di xAI per Image-to-Text, Q&A visivo, OCR, analisi e risposte multimodali in streaming tramite l’API unificata e stabile di Flaq AI.
Modelli Grok 4.6 correlati
Esempi API
Esempio di invio
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Esempio di invio
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Esempio di invio
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Prezzi di Grok 4.6 Image to Text
| Parametri | Prezzo | Prezzo originale | Sconto |
|---|
README
API Image-to-Text Grok 4.6 (ragionamento e analisi visiva)
L'API Image-to-Text Grok 4.6 combina su Flaq AI il modello testuale di xAI orientato al ragionamento con la comprensione delle immagini. Consente alle applicazioni di inviare un input visivo mirato insieme a un'istruzione e di ricevere un testo che spiega, estrae, confronta o analizza il contenuto dell'immagine. Questa integrazione dell'API vision di Grok è progettata per flussi di lavoro in cui le prove visive devono diventare una risposta utilizzabile, un'osservazione tecnica o un passaggio successivo strutturato.
Funzionalità principali dell'API Image-to-Text Grok 4.6
-
Analisi basata sull'immagine: poni domande su un'immagine fornita e ricevi risposte testuali legate ai dettagli visibili, al layout, agli oggetti e al contesto.
-
Ragionamento dal contenuto visivo al testo: combina un'immagine con istruzioni in linguaggio naturale per spiegazioni, confronti, risoluzione dei problemi e flussi di lavoro analitici.
-
Input immagine mirato: fornisci l'input immagine configurato per la route con un'istruzione chiara sull'attività, mantenendo semplici da integrare i flussi di lavoro basati su domande sulle immagini.
-
Assistenza all'ispezione tecnica: usa il contesto visivo per la revisione delle interfacce, l'interpretazione degli screenshot, la spiegazione di diagrammi, la classificazione dei feedback sui prodotti e attività analoghe con output testuale.
-
Richieste conversazionali controllate: abbina le domande sulle immagini a un contesto di messaggi strutturato, affinché le applicazioni possano fornire l'inquadramento dell'attività, requisiti precedenti e prompt di follow-up.
-
Risultati incentrati sul testo: ricevi testo generato pronto per la revisione, la visualizzazione, l'instradamento o l'uso da parte di un flusso di lavoro a valle, invece di trattare la route come un endpoint per la generazione di immagini.
Come utilizzare l'API Image-to-Text Grok 4.6 su Flaq AI
-
Dati di ingresso: un'immagine supportata insieme a una richiesta in linguaggio naturale che descrive la domanda, l'obiettivo di estrazione o l'attività di analisi.
-
Risultato: risposte testuali che descrivono, spiegano, confrontano o analizzano il contenuto visivo fornito.
-
Invio dell'immagine: usa nel flusso di lavoro della tua applicazione il formato di richiesta Flaq AI configurato per l'input immagine.
-
Capacità: analisi di screenshot, risposta a domande visive, spiegazione basata sulle immagini, revisione dei contenuti ed estrazione dei dettagli.
Migliori casi d'uso per l'integrazione dell'API Image-to-Text Grok 4.6
-
Revisione di screenshot e UI: spiega le interfacce, identifica gli stati visibili, riepiloga i feedback o trasforma uno screenshot in una descrizione del problema pronta per gli sviluppatori.
-
Assistenza per prodotti e cataloghi: estrai dettagli osservabili dei prodotti, genera bozze degli attributi e supporta la revisione umana dei contenuti visivi inviati.
-
Classificazione del supporto tecnico: aiuta i team a interpretare screenshot di errori, foto di dispositivi o immagini di configurazione prima di inoltrare un caso a un operatore.
-
Spiegazione di documenti e diagrammi: trasforma grafici, diagrammi, slide e riferimenti visivi in chiare osservazioni testuali e domande di follow-up.
-
Operazioni sui contenuti: supporta le code di moderazione, la stesura per l'accessibilità e i flussi di lavoro per la descrizione delle immagini, mantenendo la revisione finale in capo agli esseri umani.
Nota I risultati della comprensione delle immagini devono essere esaminati prima dell'uso in decisioni ad alto impatto, critiche per la sicurezza, legali, mediche o finanziarie. Non affidarti al testo generato come sostituto dell'ispezione di un esperto.
API Image-to-Text Grok 4.6 e concorrenti: analisi comparativa
-
Grok 4.6 Image-to-Text e Grok 4.5 Image-to-Text
Grok 4.5 offre un'opzione consolidata per i flussi di lavoro di domande e risposte visive. Grok 4.6 è la generazione di modelli più recente per i team che valutano un ragionamento più solido sulle richieste basate sulle immagini. -
Grok 4.6 Image-to-Text e Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash offre una famiglia di modelli multimodali efficiente. Grok 4.6 Image-to-Text fornisce una route Flaq mirata ai team che desiderano testare il ragionamento visivo di xAI in un flusso di lavoro con input visivo e output testuale. -
Grok 4.6 Image-to-Text e GPT 5.6 Terra Image-to-Text
I modelli visivi GPT 5.6 Terra vengono comunemente utilizzati per attività multimodali generiche. Grok 4.6 è un'alternativa utile quando il flusso di lavoro valorizza la famiglia di modelli xAI orientata al ragionamento e alla programmazione insieme all'analisi visiva. -
Grok 4.6 Image-to-Text e Claude Vision
I modelli vision di Claude possono essere adatti ad attività esplicative e orientate ai documenti. Grok 4.6 Image-to-Text offre agli sviluppatori un'altra opzione API per domande basate sulle immagini, revisioni e flussi di lavoro operativi. -
Grok 4.6 Image-to-Text e Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash bilancia ampie capacità multimodali con un funzionamento efficiente. Grok 4.6 è un valido candidato da valutare quando le richieste visive richiedono anche un ragionamento tecnico dettagliato in forma testuale.