Guía de Claude Code
Configura modelos Claude de Flaq AI y explora skills de Claude Code
Prueba Gemini 3.6 Flash API para Image-to-Text, Q&A visual, OCR, análisis y respuestas multimodales en streaming mediante el acceso estable de Flaq AI a la API de Google.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
La API de imagen a texto Gemini 3.6 Flash ofrece a las aplicaciones de Flaq AI una ruta específica desde la entrada visual hasta texto útil. Basada en el modelo multimodal Gemini 3.6 Flash de Google, la ruta combina una imagen con una instrucción para que los equipos puedan formular preguntas, extraer observaciones, explicar capturas de pantalla y preparar contenido visual para flujos de trabajo posteriores. La integración se mantiene deliberadamente acotada: una solicitud visual específica produce texto en lugar de contenido multimedia generado.
Comprensión visual multimodal: Combina una imagen y una instrucción en lenguaje natural para crear descripciones visuales, respuestas y análisis fundamentados.
Respuesta eficiente a preguntas sobre imágenes: Utiliza la familia de modelos Flash para tareas visuales ágiles como la explicación de capturas de pantalla, la extracción de detalles de productos y la comparación de imágenes.
Flujo visual específico: Mantén cada solicitud centrada en una entrada de imagen concreta, lo que hace que la ruta sea fácil de usar en funciones de producto y colas de revisión.
Entrega de imágenes documentada: Envía imágenes mediante el patrón de solicitud configurado en Flaq AI que se adapte al flujo de carga y almacenamiento de tu aplicación.
Contexto basado en mensajes: Añade indicaciones del sistema, intención del usuario y contexto conversacional en torno a preguntas visuales cuando la tarea necesite restricciones más claras.
Integración centrada en texto: Recibe texto apto para mostrar, revisar, enrutar y automatizar sin tratar el endpoint como un servicio de generación de imágenes.
Entrada: Una imagen compatible acompañada de un prompt que especifique la tarea de pregunta, descripción, extracción o comparación que debe realizarse.
Salida: Respuestas de texto fundamentadas en la imagen proporcionada y el contexto de la solicitud.
Entrega de imágenes: Proporciona una imagen de acuerdo con el formato de solicitud configurado en Flaq AI.
Capacidades: Respuesta a preguntas visuales, explicación de capturas de pantalla, resumen de imágenes, extracción de detalles y redacción de contenido basado en imágenes.
Revisión de interfaces y productos: Convierte capturas de pantalla en descripciones de interfaces, borradores de informes de errores, notas visuales de QA o comentarios de diseño accionables.
Enriquecimiento de catálogos: Extrae atributos visibles y redacta descripciones de productos para flujos comerciales y de inventario revisados por personas.
Clasificación de soporte al cliente: Interpreta capturas de pantalla e imágenes enviadas por usuarios para sugerir preguntas, respuestas y decisiones de enrutamiento a los equipos de soporte.
Asistencia de accesibilidad: Genera borradores de descripciones de imágenes y resúmenes visuales que los editores puedan revisar y perfeccionar antes de publicarlos.
Explicación de documentos y diagramas: Ayuda a los usuarios a comprender gráficos, diagramas, diapositivas y referencias visuales mediante texto generado claro.
Nota Esta ruta está configurada para una entrada de imagen específica y salida de texto. Revisa los resultados derivados de imágenes antes de usarlos en decisiones críticas para la seguridad, legales, médicas, financieras o de cumplimiento normativo.
Gemini 3.6 Flash Image-to-Text frente a Gemini 3.5 Flash Image-to-Text
Gemini 3.5 Flash ofrece una opción conocida para
tareas de imagen a texto. Gemini 3.6 Flash es la generación más reciente para equipos que desean una API multimodal eficiente
con un razonamiento y una asistencia para la planificación relacionada con la programación más sólidos.
Gemini 3.6 Flash Image-to-Text frente a Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash es el modelo Flash más reciente
para flujos de trabajo complejos, agénticos y multimodales. Gemini 3.6 Flash ofrece una ruta equilibrada de comprensión visual cuando la prioridad es un
flujo específico de imagen a texto.
Gemini 3.6 Flash Image-to-Text frente a Grok 4.6 Image-to-Text
Grok 4.6 es una alternativa útil de xAI para el razonamiento técnico
basado en imágenes. Gemini 3.6 Flash proporciona la familia de modelos multimodales de Google con una integración específica en Flaq AI para
preguntas visuales y operaciones de contenido.
Gemini 3.6 Flash Image-to-Text frente a GPT 5.6 Terra Image-to-Text
Los modelos visuales GPT 5.6 Terra admiten amplios escenarios de aplicaciones
multimodales. Gemini 3.6 Flash es una opción sólida para evaluar cuando los equipos necesitan una ruta eficiente basada en Gemini para
capturas de pantalla, productos y salida de texto fundamentada en imágenes.
Gemini 3.6 Flash Image-to-Text frente a Claude Vision
Los modelos de visión de Claude pueden ser adecuados para documentos y
tareas explicativas. Gemini 3.6 Flash ofrece otra opción de API lista para producción para el análisis visual con un límite claro
entre imagen y texto.
Configura modelos Claude de Flaq AI y explora skills de Claude Code

Configura modelos GPT de Flaq AI y explora skills de Codex
Usa modelos LLM de Flaq AI en Hermes Agent
Usa GLM 5.2, Kimi K3 y DeepSeek v4 en ZCode
Ejecuta DeepSeek Harness con modelos DeepSeek de Flaq AI
Conecta agentes de IA con las herramientas de generación de imágenes y vídeos de Flaq
Usa GPT 6 Astra y Claude Fable 5.1 en WorkBuddy