Guia Claude Code
Configure modelos Claude da Flaq AI e explore skills do Claude Code
Experimente Grok 4.6 API da xAI para Image-to-Text, Q&A visual, OCR, análise e respostas multimodais em streaming pela API unificada e estável da Flaq AI.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parâmetros | Preço | Preço original | Desconto |
|---|
A API Image-to-Text do Grok 4.6 combina o modelo de texto da xAI orientado por raciocínio com a compreensão de imagens no Flaq AI. Ela permite que os aplicativos enviem uma entrada visual específica junto com uma instrução e recebam um texto que explica, extrai, compara ou analisa o conteúdo da imagem. Esta integração da API de visão do Grok foi projetada para fluxos de trabalho em que evidências visuais precisam se transformar em uma resposta acionável, uma observação técnica ou um próximo passo estruturado.
Análise baseada em imagens: faça perguntas sobre uma imagem fornecida e receba respostas em texto vinculadas aos detalhes visíveis, ao layout, aos objetos e ao contexto.
Raciocínio do visual para o texto: combine uma imagem com instruções em linguagem natural para explicação, comparação, solução de problemas e fluxos de trabalho analíticos.
Entrada de imagem focada: forneça a entrada de imagem configurada para a rota com uma instrução clara sobre a tarefa, mantendo os fluxos de perguntas sobre imagens fáceis de integrar.
Assistência à inspeção técnica: use o contexto visual para revisão de interfaces, interpretação de capturas de tela, explicação de diagramas, triagem de feedback sobre produtos e tarefas semelhantes com saída em texto.
Solicitações de conversa controladas: combine perguntas sobre imagens com um contexto estruturado de mensagens para que os aplicativos possam fornecer o enquadramento da tarefa, requisitos anteriores e prompts de acompanhamento.
Resultados focados em texto: receba texto gerado pronto para revisão, exibição, encaminhamento ou uso por um fluxo de trabalho posterior, em vez de tratar a rota como um endpoint de geração de imagens.
Entrada: uma imagem compatível junto com uma solicitação em linguagem natural que descreve a pergunta, o objetivo de extração ou a tarefa de análise.
Saída: respostas em texto que descrevem, explicam, comparam ou analisam o conteúdo visual fornecido.
Envio da imagem: use o formato de solicitação do Flaq AI configurado para a entrada de imagem no fluxo de trabalho do seu aplicativo.
Recursos: análise de capturas de tela, respostas a perguntas visuais, explicação baseada em imagens, revisão de conteúdo e extração de detalhes.
Revisão de capturas de tela e UI: explique interfaces, identifique estados visíveis, resuma feedback ou transforme uma captura de tela em uma descrição de problema pronta para o desenvolvedor.
Assistência para produtos e catálogos: extraia detalhes observáveis de produtos, gere rascunhos de atributos e ofereça suporte à revisão humana de envios visuais.
Triagem de suporte técnico: ajude as equipes a interpretar capturas de tela de erros, fotos de dispositivos ou imagens de configuração antes de encaminhar um caso para um operador.
Explicação de documentos e diagramas: converta gráficos, diagramas, slides e referências visuais em observações textuais claras e perguntas de acompanhamento.
Operações de conteúdo: ofereça suporte a filas de moderação, redação para acessibilidade e fluxos de descrição de imagens, mantendo a revisão final sob responsabilidade humana.
Observação Os resultados da compreensão de imagens devem ser revisados antes do uso em decisões de alto impacto, críticas para a segurança, jurídicas, médicas ou financeiras. Não dependa do texto gerado como substituto da inspeção de um especialista.
Grok 4.6 Image-to-Text vs. Grok 4.5 Image-to-Text
O Grok 4.5 oferece uma opção consolidada para fluxos de trabalho de
perguntas e respostas visuais. O Grok 4.6 é a geração de modelo mais recente para equipes que avaliam um raciocínio mais avançado sobre
solicitações baseadas em imagens.
Grok 4.6 Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
O Gemini 3.7 Flash oferece uma família eficiente de modelos multimodais.
O Grok 4.6 Image-to-Text fornece uma rota específica do Flaq para equipes que desejam testar o raciocínio visual da xAI em um
fluxo de trabalho com entrada visual e saída em texto.
Grok 4.6 Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Os modelos visuais do GPT 5.6 Terra são usados com frequência em tarefas multimodais de uso geral.
O Grok 4.6 é uma alternativa útil quando o fluxo de trabalho valoriza a família de modelos da xAI orientada a raciocínio e programação junto com a
análise visual.
Grok 4.6 Image-to-Text vs. Claude Vision
Os modelos de visão do Claude podem ser adequados para tarefas de explicação e
voltadas a documentos. O Grok 4.6 Image-to-Text oferece aos desenvolvedores outra opção de API para perguntas baseadas em imagens,
revisões e fluxos de trabalho operacionais.
Grok 4.6 Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
O Gemini 3.6 Flash equilibra ampla capacidade multimodal
com operação eficiente. O Grok 4.6 é um forte candidato para avaliação quando as solicitações visuais também exigem
raciocínio técnico detalhado em texto.
Configure modelos Claude da Flaq AI e explore skills do Claude Code

Configure modelos GPT da Flaq AI e explore skills do Codex
Use modelos LLM da Flaq AI no Hermes Agent
Use GLM 5.2, Kimi K3 e DeepSeek v4 no ZCode
Execute o DeepSeek Harness com modelos DeepSeek da Flaq AI
Conecte agentes de IA às ferramentas de geração de imagens e vídeos da Flaq
Use GPT 6 Astra e Claude Fable 5.1 no WorkBuddy