Guía de Claude Code
Configura modelos Claude de Flaq AI y explora skills de Claude Code
Prueba Gemini 3.7 Flash API para Image-to-Text, Q&A visual, OCR, análisis y respuestas multimodales en streaming mediante el acceso estable de Flaq AI a la API de Google.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.7-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.7-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parámetros | Precio | Precio original | Descuento |
|---|
La API Gemini 3.7 Flash Image-to-Text conecta las aplicaciones de Flaq AI con el modelo Flash más reciente de Google para una comprensión visual rápida y avanzada. Envía una entrada de imagen concreta con una instrucción clara para generar texto que describa, explique, extraiga o analice contenido visual. La ruta combina las capacidades multimodales y de razonamiento de Gemini 3.7 Flash con un límite de entrada Flaq AI deliberadamente enfocado, lo que la hace idónea para funciones de producto ágiles y flujos de revisión.
Razonamiento visual avanzado: Convierte preguntas basadas en imágenes en respuestas de texto claras que reflejen el contexto visual proporcionado y la instrucción de la tarea.
Flujo de trabajo multimodal rentable: Utiliza una configuración Flash muy asequible para funciones de análisis visual que necesitan una salida de texto avanzada a gran escala.
Solicitud de imagen concreta: Mantén cada interacción centrada en una entrada visual y un objetivo específico, lo que ayuda a las aplicaciones a producir resultados más claros y fáciles de revisar.
Entrega de imágenes documentada: Envía la entrada de imagen mediante el patrón configurado de solicitud a la API de Flaq AI.
Compatibilidad con el contexto de mensajes: Combina la solicitud visual con mensajes estructurados del sistema, el usuario y el asistente cuando la tarea necesite instrucciones, criterios o contexto de seguimiento.
Integración ágil de la API: Selecciona streaming o la entrega de una respuesta completa para adaptarte a asistentes interactivos, trabajos de revisión asíncronos y herramientas internas.
Entrada: Una imagen compatible con un prompt en lenguaje natural que defina la descripción, pregunta, extracción o análisis solicitados.
Salida: Respuestas de texto para experiencias de usuario, revisión humana, flujos de contenido y automatización posterior.
Entrega de imágenes: Utiliza el formato configurado de solicitud de Flaq AI para la entrada de imagen.
Capacidades: Respuesta a preguntas basadas en imágenes, interpretación de capturas de pantalla, extracción de detalles visuales, resumen de imágenes y redacción de contenido.
Experiencias visuales de producto: Añade preguntas sobre imágenes, asistencia de búsqueda visual y explicaciones contextuales a aplicaciones orientadas al usuario.
Revisión de diseño y QA: Genera notas iniciales a partir de capturas de pantalla de interfaces, imágenes de productos, diagramas y comentarios visuales para su revisión humana.
Flujos de asistencia: Ayuda a los agentes a interpretar imágenes y capturas de pantalla de clientes, identificar detalles útiles y preparar borradores de respuesta o escalado.
Operaciones comerciales y de catálogo: Extrae atributos visibles, redacta descripciones y facilita la revisión editorial de imágenes de productos.
Flujos de accesibilidad y contenido: Crea borradores de descripciones y resúmenes visuales revisables para ayudar a los equipos editoriales a preparar contenido accesible.
Nota La ruta actual de Flaq AI está diseñada para entradas de imagen concretas y salidas de texto. No utilices el análisis generado como único fundamento para decisiones de gran impacto; mantén una revisión humana y una verificación de las fuentes adecuadas.
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash ofrece una ruta multimodal equilibrada
para preguntas y operaciones con imágenes. Gemini 3.7 Flash es el modelo Flash más reciente que conviene evaluar cuando la tarea visual
también se beneficia de un razonamiento más avanzado en varios pasos.
Gemini 3.7 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
Grok 4.6 es una opción de xAI para el razonamiento técnico basado en
imágenes. Gemini 3.7 Flash ofrece una ruta de modelo Google altamente rentable para preguntas visuales, capturas de pantalla y
funciones de producto centradas en el texto.
Gemini 3.7 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Los modelos visuales GPT 5.6 Terra admiten una amplia variedad de aplicaciones multimodales.
Gemini 3.7 Flash es una alternativa atractiva cuando los equipos quieren un modelo Flash eficiente para el análisis concreto de imágenes y la
generación de texto.
Gemini 3.7 Flash Image-to-Text vs. Claude Vision
Los modelos de visión de Claude pueden ser una opción sólida para tareas explicativas y
orientadas a documentos. Gemini 3.7 Flash ofrece una API ágil de comprensión visual para equipos que evalúan
flujos de trabajo multimodales rentables.
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.7 Flash Text-to-Text
Text-to-Text está optimizado para prompts sin
entrada visual. Image-to-Text es la ruta más adecuada cuando la respuesta debe basarse tanto en una imagen proporcionada como en
instrucciones escritas.
Configura modelos Claude de Flaq AI y explora skills de Claude Code

Configura modelos GPT de Flaq AI y explora skills de Codex
Usa modelos LLM de Flaq AI en Hermes Agent
Usa GLM 5.2, Kimi K3 y DeepSeek v4 en ZCode
Ejecuta DeepSeek Harness con modelos DeepSeek de Flaq AI
Conecta agentes de IA con las herramientas de generación de imágenes y vídeos de Flaq
Usa GPT 6 Astra y Claude Fable 5.1 en WorkBuddy