Prueba Gemini 3.7 Flash API para Image-to-Text, Q&A visual, OCR, análisis y respuestas multimodales en streaming mediante el acceso estable de Flaq AI a la API de Google.
Modelos Gemini 3.7 Flash relacionados
Ejemplos de API
Ejemplo de envio
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.7-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Ejemplo de envio
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.7-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Ejemplo de envio
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Precios de Gemini 3.7 Flash Image to Text
| Parámetros | Precio | Precio original | Descuento |
|---|
README
API Gemini 3.7 Flash Image-to-Text rápida y asequible
La API Gemini 3.7 Flash Image-to-Text conecta las aplicaciones de Flaq AI con el modelo Flash más reciente de Google para una comprensión visual rápida y avanzada. Envía una entrada de imagen concreta con una instrucción clara para generar texto que describa, explique, extraiga o analice contenido visual. La ruta combina las capacidades multimodales y de razonamiento de Gemini 3.7 Flash con un límite de entrada Flaq AI deliberadamente enfocado, lo que la hace idónea para funciones de producto ágiles y flujos de revisión.
Funciones principales de la API Gemini 3.7 Flash Image-to-Text
-
Razonamiento visual avanzado: Convierte preguntas basadas en imágenes en respuestas de texto claras que reflejen el contexto visual proporcionado y la instrucción de la tarea.
-
Flujo de trabajo multimodal rentable: Utiliza una configuración Flash muy asequible para funciones de análisis visual que necesitan una salida de texto avanzada a gran escala.
-
Solicitud de imagen concreta: Mantén cada interacción centrada en una entrada visual y un objetivo específico, lo que ayuda a las aplicaciones a producir resultados más claros y fáciles de revisar.
-
Entrega de imágenes documentada: Envía la entrada de imagen mediante el patrón configurado de solicitud a la API de Flaq AI.
-
Compatibilidad con el contexto de mensajes: Combina la solicitud visual con mensajes estructurados del sistema, el usuario y el asistente cuando la tarea necesite instrucciones, criterios o contexto de seguimiento.
-
Integración ágil de la API: Selecciona streaming o la entrega de una respuesta completa para adaptarte a asistentes interactivos, trabajos de revisión asíncronos y herramientas internas.
Cómo utilizar la API Gemini 3.7 Flash Image-to-Text en Flaq AI
-
Entrada: Una imagen compatible con un prompt en lenguaje natural que defina la descripción, pregunta, extracción o análisis solicitados.
-
Salida: Respuestas de texto para experiencias de usuario, revisión humana, flujos de contenido y automatización posterior.
-
Entrega de imágenes: Utiliza el formato configurado de solicitud de Flaq AI para la entrada de imagen.
-
Capacidades: Respuesta a preguntas basadas en imágenes, interpretación de capturas de pantalla, extracción de detalles visuales, resumen de imágenes y redacción de contenido.
Mejores casos de uso para integrar la API Gemini 3.7 Flash Image-to-Text
-
Experiencias visuales de producto: Añade preguntas sobre imágenes, asistencia de búsqueda visual y explicaciones contextuales a aplicaciones orientadas al usuario.
-
Revisión de diseño y QA: Genera notas iniciales a partir de capturas de pantalla de interfaces, imágenes de productos, diagramas y comentarios visuales para su revisión humana.
-
Flujos de asistencia: Ayuda a los agentes a interpretar imágenes y capturas de pantalla de clientes, identificar detalles útiles y preparar borradores de respuesta o escalado.
-
Operaciones comerciales y de catálogo: Extrae atributos visibles, redacta descripciones y facilita la revisión editorial de imágenes de productos.
-
Flujos de accesibilidad y contenido: Crea borradores de descripciones y resúmenes visuales revisables para ayudar a los equipos editoriales a preparar contenido accesible.
Nota La ruta actual de Flaq AI está diseñada para entradas de imagen concretas y salidas de texto. No utilices el análisis generado como único fundamento para decisiones de gran impacto; mantén una revisión humana y una verificación de las fuentes adecuadas.
API Gemini 3.7 Flash Image-to-Text frente a la competencia: análisis comparativo
-
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash ofrece una ruta multimodal equilibrada para preguntas y operaciones con imágenes. Gemini 3.7 Flash es el modelo Flash más reciente que conviene evaluar cuando la tarea visual también se beneficia de un razonamiento más avanzado en varios pasos. -
Gemini 3.7 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
Grok 4.6 es una opción de xAI para el razonamiento técnico basado en imágenes. Gemini 3.7 Flash ofrece una ruta de modelo Google altamente rentable para preguntas visuales, capturas de pantalla y funciones de producto centradas en el texto. -
Gemini 3.7 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Los modelos visuales GPT 5.6 Terra admiten una amplia variedad de aplicaciones multimodales. Gemini 3.7 Flash es una alternativa atractiva cuando los equipos quieren un modelo Flash eficiente para el análisis concreto de imágenes y la generación de texto. -
Gemini 3.7 Flash Image-to-Text vs. Claude Vision
Los modelos de visión de Claude pueden ser una opción sólida para tareas explicativas y orientadas a documentos. Gemini 3.7 Flash ofrece una API ágil de comprensión visual para equipos que evalúan flujos de trabajo multimodales rentables. -
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.7 Flash Text-to-Text
Text-to-Text está optimizado para prompts sin entrada visual. Image-to-Text es la ruta más adecuada cuando la respuesta debe basarse tanto en una imagen proporcionada como en instrucciones escritas.