API de Gemini 3.5 Flash para preguntas y respuestas visuales, OCR, análisis de imágenes y razonamiento multimodal. Acceso estable para aplicaciones de IA en producción.
Modelos Gemini 3.5 Flash relacionados
Ejemplos de API
Ejemplo de envio
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.5-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Ejemplo de envio
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.5-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Ejemplo de envio
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Precios de Gemini 3.5 Flash Image to Text
| Parámetros | Precio | Precio original | Descuento |
|---|
README
API Gemini 3.5 Flash Image-to-Text rápida y asequible (modelo eficiente de comprensión visual de Google)
La API Gemini 3.5 Flash Image-to-Text en Flaq AI ofrece acceso al modelo de Google para comprensión visual rápida, análisis de imágenes y flujos de razonamiento multimodal. Esta integración eficiente de la API Gemini ayuda a los desarrolladores a convertir imágenes subidas en descripciones, detalles extraídos, respuestas y resúmenes estructurados mediante una ruta gestionada estable. Está diseñada para equipos que necesitan capacidad image-to-text responsiva sin crear infraestructura específica de proveedores.
Funciones clave de la API Gemini 3.5 Flash Image-to-Text
- Comprensión visual rápida: Analiza imágenes, capturas de pantalla, objetos, diseños y detalles visuales con comportamiento responsivo del modelo Gemini.
- Respuestas basadas en imagen: Haz preguntas en lenguaje natural sobre imágenes subidas y recibe respuestas de texto enfocadas.
- Acceso económico a la API: Crea flujos de análisis visual de alto volumen mediante una ruta Gemini gestionada y asequible.
- Salida con contexto conversacional: Admite preguntas de seguimiento y revisión iterativa de imágenes con contexto flexible.
- Controles amigables para desarrolladores: Orienta la longitud de la respuesta, el nivel de detalle y la dirección de la tarea mediante configuración práctica en Flaq AI.
- Integración lista para producción: Añade capacidad image-to-text a apps, herramientas y flujos internos sin gestionar infraestructura de modelos.
Cómo usar la API Gemini 3.5 Flash Image-to-Text para análisis visual en Flaq AI
- Entrada: Contenido de imagen subido más instrucciones en lenguaje natural que describen la tarea de análisis, extracción o razonamiento.
- Salida: Descripciones de texto, detalles extraídos, razonamiento visual o resúmenes estructurados de imágenes subidas.
- Configuración de ruta: Diseñada para flujos enfocados de comprensión de imagen con soporte de entrada de imagen específico de la ruta.
- Configuración: Admite controles prácticos de salida para la longitud de la respuesta, el nivel de detalle y la dirección de la tarea.
- Capacidades: Comprensión de imagen, extracción estilo OCR, QA visual, revisión de capturas de pantalla, inspección de productos y razonamiento multimodal mediante la integración asequible de la API Gemini.
Mejores casos de uso para la integración de la API Gemini 3.5 Flash Image-to-Text
- Revisión de capturas de pantalla y UI: Extrae detalles clave de capturas de interfaces, dashboards y pantallas de producto.
- Análisis de productos y catálogos: Genera descripciones de productos, identifica atributos y resume diferencias visuales.
- Comprensión de imágenes documentales: Lee diseños visuales, formularios, recibos y material de referencia basado en imágenes.
- QA de activos creativos: Revisa anuncios, visuales sociales, mockups y exportaciones de diseño para detectar detalles de contenido.
- Flujos de accesibilidad: Produce descripciones de imágenes y resúmenes visuales que facilitan entender y reutilizar los medios.
Nota Asegúrate de que los prompts, las imágenes subidas y los flujos de aplicación cumplan con las directrices de seguridad de Google. Si ocurre un error, revisa la entrada en busca de contenido restringido, simplifica la solicitud e inténtalo de nuevo.
Gemini 3.5 Flash Image-to-Text vs competidores: análisis comparativo
-
Gemini 3.5 Flash vs. GPT Image-to-Text
Las rutas GPT image-to-text ofrecen comportamiento multimodal nativo de OpenAI. Gemini 3.5 Flash proporciona una ruta rápida de modelo Google para comprensión visual rentable en Flaq AI. -
Gemini 3.5 Flash vs. Claude File Analysis
Claude file analysis es sólido para razonamiento cuidadoso sobre documentos y adjuntos. Gemini 3.5 Flash Image-to-Text se centra en comprensión de imagen responsiva y QA visual. -
Gemini 3.5 Flash vs. Grok Image-to-Text
Grok Image-to-Text ofrece comportamiento de modelo xAI para análisis visual. Gemini 3.5 Flash proporciona una alternativa Google con acceso eficiente a API gestionada. -
Gemini 3.5 Flash vs. flujos de visión Qwen
Los flujos de visión Qwen son atractivos para usuarios de modelos Alibaba. Gemini 3.5 Flash encaja muy bien para equipos que quieren integración image-to-text rápida de Google. -
Gemini 3.5 Flash vs. modelos Llama Vision
Los modelos Llama Vision ofrecen flexibilidad de despliegue de modelo abierto. Gemini 3.5 Flash elimina el trabajo de hospedaje y da a los desarrolladores una ruta gestionada estable.