Guida Claude Code
Configura i modelli Claude di Flaq AI ed esplora le skill di Claude Code
Prova Gemini 3.6 Flash API per Image-to-Text, Q&A visivo, OCR, analisi e risposte multimodali in streaming tramite l’accesso stabile di Flaq AI all’API Google.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parametri | Prezzo | Prezzo originale | Sconto |
|---|
L'API image-to-text Gemini 3.6 Flash offre alle applicazioni Flaq AI un percorso mirato dall'input visivo a un testo utile. Basata sul modello multimodale Gemini 3.6 Flash di Google, la route combina un'immagine con un'istruzione per consentire ai team di porre domande, estrarre osservazioni, spiegare screenshot e preparare contenuti visivi per i flussi di lavoro successivi. L'integrazione rimane volutamente circoscritta: una richiesta visiva mirata produce testo anziché contenuti multimediali generati.
Comprensione visiva multimodale: Combina un'immagine e un'istruzione in linguaggio naturale per creare descrizioni visive, risposte e analisi fondate.
Risposte efficienti a domande sulle immagini: Usa la famiglia di modelli Flash per attività visive reattive come la spiegazione di screenshot, l'estrazione dei dettagli dei prodotti e il confronto tra immagini.
Flusso di lavoro visivo mirato: Mantieni ogni richiesta incentrata su un input di immagine specifico, rendendo la route semplice da usare nelle funzionalità dei prodotti e nelle code di revisione.
Invio documentato delle immagini: Invia le immagini tramite il modello di richiesta Flaq AI configurato più adatto al flusso di caricamento e archiviazione della tua applicazione.
Contesto basato sui messaggi: Aggiungi indicazioni di sistema, intento dell'utente e contesto della conversazione alle domande visive quando l'attività richiede vincoli più chiari.
Integrazione incentrata sul testo: Ricevi testo adatto alla visualizzazione, revisione, instradamento e automazione senza considerare l'endpoint un servizio di generazione di immagini.
Ingresso: Un'immagine supportata abbinata a un prompt che specifichi la domanda, la descrizione, l'estrazione o il confronto richiesto.
Uscita: Risposte testuali basate sull'immagine fornita e sul contesto della richiesta.
Invio dell'immagine: Fornisci un'immagine secondo il formato di richiesta Flaq AI configurato.
Funzionalità: Risposte a domande visive, spiegazione di screenshot, sintesi di immagini, estrazione di dettagli e stesura di contenuti basati sulle immagini.
Revisione di interfacce e prodotti: Trasforma gli screenshot in descrizioni dell'interfaccia, bozze di segnalazioni di bug, note visive di QA o feedback di progettazione utilizzabili.
Arricchimento dei cataloghi: Estrai gli attributi visibili e prepara descrizioni dei prodotti per flussi commerciali e di inventario sottoposti a revisione umana.
Valutazione dell'assistenza clienti: Interpreta screenshot e immagini inviate dagli utenti per suggerire domande, risposte e decisioni di smistamento ai team di supporto.
Assistenza all'accessibilità: Produci bozze di descrizioni delle immagini e sintesi visive che gli editor possano esaminare e perfezionare prima della pubblicazione.
Spiegazione di documenti e diagrammi: Aiuta gli utenti a comprendere grafici, diagrammi, slide e riferimenti visivi tramite un testo generato chiaro.
Nota Questa route è configurata per un input mirato di immagini e un output testuale. Esamina i risultati derivati dalle immagini prima di usarli per decisioni critiche in materia di sicurezza, legali, mediche, finanziarie o di conformità.
Gemini 3.6 Flash Image-to-Text e Gemini 3.5 Flash Image-to-Text a confronto
Gemini 3.5 Flash offre un'opzione consolidata per
le attività image-to-text. Gemini 3.6 Flash è la generazione di modello più recente per i team che desiderano un'API multimodale efficiente
con un ragionamento e un supporto alla pianificazione legata alla programmazione più avanzati.
Gemini 3.6 Flash Image-to-Text e Gemini 3.7 Flash Image-to-Text a confronto
Gemini 3.7 Flash è il modello Flash più recente
per flussi di lavoro complessi, agentici e multimodali. Gemini 3.6 Flash offre una route equilibrata di comprensione visiva quando la
priorità è un flusso image-to-text mirato.
Gemini 3.6 Flash Image-to-Text e Grok 4.6 Image-to-Text a confronto
Grok 4.6 è una valida alternativa di xAI per il ragionamento tecnico
basato sulle immagini. Gemini 3.6 Flash offre la famiglia di modelli multimodali di Google con un'integrazione Flaq AI mirata per
le domande visive e le operazioni sui contenuti.
Gemini 3.6 Flash Image-to-Text e GPT 5.6 Terra Image-to-Text a confronto
I modelli visivi GPT 5.6 Terra supportano un'ampia gamma di scenari applicativi
multimodali. Gemini 3.6 Flash è una valida scelta da valutare quando i team richiedono una route efficiente basata su Gemini per
screenshot, prodotti e output testuali fondati sulle immagini.
Gemini 3.6 Flash Image-to-Text e Claude Vision a confronto
I modelli visivi Claude possono essere adatti ai documenti e alle
attività esplicative. Gemini 3.6 Flash offre un'altra opzione API pronta per la produzione per l'analisi visiva con una chiara
delimitazione tra immagine e testo.
Configura i modelli Claude di Flaq AI ed esplora le skill di Claude Code

Configura i modelli GPT di Flaq AI ed esplora le skill di Codex
Usa i modelli LLM di Flaq AI in Hermes Agent
Usa GLM 5.2, Kimi K3 e DeepSeek v4 in ZCode
Esegui DeepSeek Harness con i modelli DeepSeek di Flaq AI
Collega gli agenti AI agli strumenti Flaq per la generazione di immagini e video
Usa GPT 6 Astra e Claude Fable 5.1 in WorkBuddy