Gemini 3.5 Flash API untuk Q&A visual, OCR, analisis gambar, dan penalaran multimodal. Akses stabil untuk aplikasi AI produksi. Uji output model, bandingkan kualitas visual, lalu skalakan ide terbaik melalui workflow API gambar, video, atau multimodal yang stabil untuk tim.
Model Gemini 3.5 Flash Terkait
Contoh API
Contoh Pengiriman
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.5-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Contoh Pengiriman
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.5-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Contoh Pengiriman
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Harga Gemini 3.5 Flash Image to Text
| Parameter | Harga | Harga asli | Diskon |
|---|
README
API Gemini 3.5 Flash Image-to-Text yang Cepat & Terjangkau (Model Pemahaman Visi Efisien Google)
Gemini 3.5 Flash Image-to-Text API di Flaq AI menyediakan akses model Google untuk workflow pemahaman visual cepat, analisis gambar, dan penalaran multimodal. Integrasi Gemini API yang efisien ini membantu developer mengubah gambar yang diunggah menjadi deskripsi, detail yang diekstrak, jawaban, dan ringkasan terstruktur melalui route terkelola yang stabil. API ini dirancang untuk tim yang membutuhkan kemampuan image-to-text responsif tanpa membangun infrastruktur khusus provider.
Fitur Utama Gemini 3.5 Flash Image-to-Text API
- Pemahaman Visi Cepat: Analisis gambar, screenshot, objek, layout, dan detail visual dengan perilaku model Gemini yang responsif.
- Jawaban Berbasis Gambar: Ajukan pertanyaan bahasa alami tentang gambar yang diunggah dan terima respons teks yang terfokus.
- Akses API Hemat Biaya: Bangun workflow analisis visual bervolume tinggi melalui route Gemini terkelola yang terjangkau.
- Output Sadar Percakapan: Dukung pertanyaan lanjutan dan review gambar iteratif dengan konteks fleksibel.
- Kontrol Ramah Developer: Arahkan panjang respons, tingkat detail, dan arah tugas melalui konfigurasi praktis di Flaq AI.
- Integrasi Siap Produksi: Tambahkan kemampuan image-to-text ke aplikasi, alat, dan workflow internal tanpa mengelola infrastruktur model.
Cara Menggunakan Gemini 3.5 Flash Image-to-Text API untuk Analisis Visual di Flaq AI
- Input: Konten gambar yang diunggah plus instruksi bahasa alami yang menjelaskan tugas analisis, ekstraksi, atau penalaran.
- Output: Deskripsi teks, detail yang diekstrak, penalaran visual, atau ringkasan terstruktur dari gambar yang diunggah.
- Konfigurasi Route: Dirancang untuk workflow pemahaman gambar terfokus dengan dukungan input gambar khusus route.
- Konfigurasi: Mendukung kontrol output praktis untuk panjang respons, tingkat detail, dan arah tugas.
- Kemampuan: Pemahaman gambar, ekstraksi bergaya OCR, visual QA, review screenshot, inspeksi produk, dan penalaran multimodal melalui integrasi Gemini API yang terjangkau.
Use Case Terbaik untuk Integrasi Gemini 3.5 Flash Image-to-Text API
- Review Screenshot & UI: Ekstrak detail utama dari tangkapan antarmuka, dashboard, dan screenshot produk.
- Analisis Produk & Katalog: Hasilkan deskripsi produk, identifikasi atribut, dan ringkas perbedaan visual.
- Pemahaman Gambar Dokumen: Baca layout visual, formulir, tanda terima, dan materi referensi berbasis gambar.
- QA Aset Kreatif: Tinjau iklan, visual sosial, mockup, dan export desain untuk detail konten.
- Workflow Aksesibilitas: Hasilkan deskripsi gambar dan ringkasan visual yang membuat media lebih mudah dipahami dan digunakan kembali.
Catatan Pastikan prompt, gambar yang diunggah, dan workflow aplikasi mematuhi panduan keamanan Google. Jika terjadi error, tinjau input untuk konten yang dibatasi, sederhanakan permintaan, lalu coba lagi.
Gemini 3.5 Flash Image-to-Text vs Kompetitor: Analisis Perbandingan
-
Gemini 3.5 Flash vs. GPT Image-to-Text
Route GPT image-to-text menawarkan perilaku multimodal native OpenAI. Gemini 3.5 Flash menyediakan route model Google yang cepat untuk pemahaman visual hemat biaya di Flaq AI. -
Gemini 3.5 Flash vs. Claude File Analysis
Claude file analysis kuat untuk penalaran dokumen dan lampiran yang cermat. Gemini 3.5 Flash Image-to-Text berfokus pada pemahaman gambar responsif dan visual QA. -
Gemini 3.5 Flash vs. Grok Image-to-Text
Grok Image-to-Text menawarkan perilaku model xAI untuk analisis visual. Gemini 3.5 Flash menyediakan alternatif Google dengan akses API terkelola yang efisien. -
Gemini 3.5 Flash vs. Qwen Vision Workflows
Workflow Qwen vision menarik bagi pengguna model Alibaba. Gemini 3.5 Flash cocok untuk tim yang menginginkan integrasi Google image-to-text yang cepat. -
Gemini 3.5 Flash vs. Llama Vision Models
Model Llama vision menawarkan fleksibilitas deployment open-model. Gemini 3.5 Flash menghilangkan pekerjaan hosting dan memberi developer route terkelola yang stabil.