Experimente Gemini 3.6 Flash API para Image-to-Text, Q&A visual, OCR, análise e respostas multimodais em streaming pelo acesso estável da Flaq AI à API do Google.
Modelos Gemini 3.6 Flash relacionados
Exemplos de API
Exemplo de envio
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Exemplo de envio
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Exemplo de envio
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Preços de Gemini 3.6 Flash Image to Text
| Parâmetros | Preço | Preço original | Desconto |
|---|
README
API de imagem para texto Gemini 3.6 Flash rápida e eficiente
A API de imagem para texto Gemini 3.6 Flash oferece aos aplicativos da Flaq AI um caminho focado da entrada visual até um texto útil. Baseada no modelo multimodal Gemini 3.6 Flash do Google, a rota combina uma imagem com uma instrução para que as equipes possam fazer perguntas, extrair observações, explicar capturas de tela e preparar conteúdo visual para fluxos de trabalho posteriores. A integração permanece deliberadamente restrita: uma solicitação visual específica produz texto em vez de mídia gerada.
Principais recursos da API de imagem para texto Gemini 3.6 Flash
-
Compreensão visual multimodal: Combine uma imagem e uma instrução em linguagem natural para criar descrições visuais, respostas e análises fundamentadas.
-
Respostas eficientes a perguntas sobre imagens: Use a família de modelos Flash em tarefas visuais responsivas, como explicação de capturas de tela, extração de detalhes de produtos e comparação de imagens.
-
Fluxo visual focado: Mantenha cada solicitação centrada em uma entrada de imagem específica, tornando a rota simples de usar em recursos de produtos e filas de revisão.
-
Envio documentado de imagens: Envie imagens pelo padrão de solicitação configurado da Flaq AI que seja adequado ao fluxo de upload e armazenamento do seu aplicativo.
-
Contexto baseado em mensagens: Adicione orientações do sistema, intenção do usuário e contexto conversacional às perguntas visuais quando a tarefa precisar de restrições mais claras.
-
Integração centrada em texto: Receba texto adequado para exibição, revisão, encaminhamento e automação sem tratar o endpoint como um serviço de geração de imagens.
Como usar a API de imagem para texto Gemini 3.6 Flash na Flaq AI
-
Entrada: Uma imagem compatível acompanhada de um prompt que especifique a tarefa de pergunta, descrição, extração ou comparação desejada.
-
Saída: Respostas em texto fundamentadas na imagem fornecida e no contexto da solicitação.
-
Envio de imagem: Forneça uma imagem de acordo com o formato de solicitação configurado da Flaq AI.
-
Recursos: Respostas a perguntas visuais, explicação de capturas de tela, resumo de imagens, extração de detalhes e redação de conteúdo fundamentada em imagens.
Melhores casos de uso para integrar a API de imagem para texto Gemini 3.6 Flash
-
Revisão de interface e produto: Transforme capturas de tela em descrições de interface, rascunhos de relatórios de bugs, notas visuais de QA ou feedback de design acionável.
-
Enriquecimento de catálogo: Extraia atributos visíveis e elabore descrições de produtos para fluxos de comércio e estoque revisados por pessoas.
-
Triagem do suporte ao cliente: Interprete capturas de tela e imagens enviadas por usuários para sugerir perguntas, respostas e decisões de encaminhamento às equipes de suporte.
-
Assistência à acessibilidade: Produza rascunhos de descrições de imagens e resumos visuais que os editores possam revisar e aperfeiçoar antes da publicação.
-
Explicação de documentos e diagramas: Ajude os usuários a entender gráficos, diagramas, slides e referências visuais por meio de texto gerado claro.
Observação Esta rota está configurada para entrada focada de imagem e saída de texto. Revise os resultados derivados de imagens antes de usá-los em decisões críticas de segurança, jurídicas, médicas, financeiras ou de conformidade.
API de imagem para texto Gemini 3.6 Flash vs. concorrentes: análise comparativa
-
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.5 Flash Image-to-Text
O Gemini 3.5 Flash oferece uma opção conhecida para tarefas de imagem para texto. O Gemini 3.6 Flash é a geração de modelo mais recente para equipes que desejam uma API multimodal eficiente com raciocínio e suporte a planejamento relacionado à programação mais avançados. -
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
O Gemini 3.7 Flash é o modelo Flash mais recente para fluxos de trabalho complexos, agênticos e multimodais. O Gemini 3.6 Flash oferece uma rota equilibrada de compreensão visual quando um fluxo focado de imagem para texto é a prioridade. -
Gemini 3.6 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
O Grok 4.6 é uma alternativa útil da xAI para raciocínio técnico fundamentado em imagens. O Gemini 3.6 Flash oferece a família de modelos multimodais do Google com uma integração focada da Flaq AI para perguntas visuais e operações de conteúdo. -
Gemini 3.6 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Os modelos visuais GPT 5.6 Terra são compatíveis com amplos cenários de aplicativos multimodais. O Gemini 3.6 Flash é uma opção avançada para avaliar quando as equipes precisam de uma rota eficiente baseada no Gemini para capturas de tela, produtos e saída de texto fundamentada em imagens. -
Gemini 3.6 Flash Image-to-Text vs. Claude Vision
Os modelos de visão do Claude podem ser adequados para documentos e tarefas explicativas. O Gemini 3.6 Flash oferece outra opção de API pronta para produção para análise visual com uma delimitação clara entre imagem e texto.