Guia Claude Code
Configure modelos Claude da Flaq AI e explore skills do Claude Code
Experimente Gemini 3.6 Flash API para Image-to-Text, Q&A visual, OCR, análise e respostas multimodais em streaming pelo acesso estável da Flaq AI à API do Google.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parâmetros | Preço | Preço original | Desconto |
|---|
A API de imagem para texto Gemini 3.6 Flash oferece aos aplicativos da Flaq AI um caminho focado da entrada visual até um texto útil. Baseada no modelo multimodal Gemini 3.6 Flash do Google, a rota combina uma imagem com uma instrução para que as equipes possam fazer perguntas, extrair observações, explicar capturas de tela e preparar conteúdo visual para fluxos de trabalho posteriores. A integração permanece deliberadamente restrita: uma solicitação visual específica produz texto em vez de mídia gerada.
Compreensão visual multimodal: Combine uma imagem e uma instrução em linguagem natural para criar descrições visuais, respostas e análises fundamentadas.
Respostas eficientes a perguntas sobre imagens: Use a família de modelos Flash em tarefas visuais responsivas, como explicação de capturas de tela, extração de detalhes de produtos e comparação de imagens.
Fluxo visual focado: Mantenha cada solicitação centrada em uma entrada de imagem específica, tornando a rota simples de usar em recursos de produtos e filas de revisão.
Envio documentado de imagens: Envie imagens pelo padrão de solicitação configurado da Flaq AI que seja adequado ao fluxo de upload e armazenamento do seu aplicativo.
Contexto baseado em mensagens: Adicione orientações do sistema, intenção do usuário e contexto conversacional às perguntas visuais quando a tarefa precisar de restrições mais claras.
Integração centrada em texto: Receba texto adequado para exibição, revisão, encaminhamento e automação sem tratar o endpoint como um serviço de geração de imagens.
Entrada: Uma imagem compatível acompanhada de um prompt que especifique a tarefa de pergunta, descrição, extração ou comparação desejada.
Saída: Respostas em texto fundamentadas na imagem fornecida e no contexto da solicitação.
Envio de imagem: Forneça uma imagem de acordo com o formato de solicitação configurado da Flaq AI.
Recursos: Respostas a perguntas visuais, explicação de capturas de tela, resumo de imagens, extração de detalhes e redação de conteúdo fundamentada em imagens.
Revisão de interface e produto: Transforme capturas de tela em descrições de interface, rascunhos de relatórios de bugs, notas visuais de QA ou feedback de design acionável.
Enriquecimento de catálogo: Extraia atributos visíveis e elabore descrições de produtos para fluxos de comércio e estoque revisados por pessoas.
Triagem do suporte ao cliente: Interprete capturas de tela e imagens enviadas por usuários para sugerir perguntas, respostas e decisões de encaminhamento às equipes de suporte.
Assistência à acessibilidade: Produza rascunhos de descrições de imagens e resumos visuais que os editores possam revisar e aperfeiçoar antes da publicação.
Explicação de documentos e diagramas: Ajude os usuários a entender gráficos, diagramas, slides e referências visuais por meio de texto gerado claro.
Observação Esta rota está configurada para entrada focada de imagem e saída de texto. Revise os resultados derivados de imagens antes de usá-los em decisões críticas de segurança, jurídicas, médicas, financeiras ou de conformidade.
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.5 Flash Image-to-Text
O Gemini 3.5 Flash oferece uma opção conhecida para
tarefas de imagem para texto. O Gemini 3.6 Flash é a geração de modelo mais recente para equipes que desejam uma API multimodal eficiente
com raciocínio e suporte a planejamento relacionado à programação mais avançados.
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
O Gemini 3.7 Flash é o modelo Flash mais recente
para fluxos de trabalho complexos, agênticos e multimodais. O Gemini 3.6 Flash oferece uma rota equilibrada de compreensão visual quando um
fluxo focado de imagem para texto é a prioridade.
Gemini 3.6 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
O Grok 4.6 é uma alternativa útil da xAI para raciocínio técnico
fundamentado em imagens. O Gemini 3.6 Flash oferece a família de modelos multimodais do Google com uma integração focada da Flaq AI para
perguntas visuais e operações de conteúdo.
Gemini 3.6 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Os modelos visuais GPT 5.6 Terra são compatíveis com amplos cenários de aplicativos
multimodais. O Gemini 3.6 Flash é uma opção avançada para avaliar quando as equipes precisam de uma rota eficiente baseada no Gemini para
capturas de tela, produtos e saída de texto fundamentada em imagens.
Gemini 3.6 Flash Image-to-Text vs. Claude Vision
Os modelos de visão do Claude podem ser adequados para documentos e
tarefas explicativas. O Gemini 3.6 Flash oferece outra opção de API pronta para produção para análise visual com uma delimitação clara
entre imagem e texto.
Configure modelos Claude da Flaq AI e explore skills do Claude Code

Configure modelos GPT da Flaq AI e explore skills do Codex
Use modelos LLM da Flaq AI no Hermes Agent
Use GLM 5.2, Kimi K3 e DeepSeek v4 no ZCode
Execute o DeepSeek Harness com modelos DeepSeek da Flaq AI
Conecte agentes de IA às ferramentas de geração de imagens e vídeos da Flaq
Use GPT 6 Astra e Claude Fable 5.1 no WorkBuddy