Coba Gemini 3.6 Flash API untuk image-to-text, Q&A visual, OCR, analisis, dan respons multimodal streaming melalui akses Google API Flaq AI yang stabil.
Model Gemini 3.6 Flash Terkait
Contoh API
Contoh Pengiriman
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Contoh Pengiriman
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Contoh Pengiriman
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Harga Gemini 3.6 Flash Image to Text
| Parameter | Harga | Harga asli | Diskon |
|---|
README
API Gemini 3.6 Flash Image-to-Text yang Cepat dan Efisien
API Gemini 3.6 Flash Image-to-Text memberikan jalur terfokus bagi aplikasi Flaq AI dari input visual ke teks yang berguna. Dibangun dengan model Gemini 3.6 Flash multimodal Google, rute ini menggabungkan gambar dengan instruksi agar tim dapat mengajukan pertanyaan, mengekstrak pengamatan, menjelaskan tangkapan layar, dan menyiapkan konten visual untuk alur kerja lanjutan. Integrasi ini sengaja dibuat terbatas: permintaan visual yang terfokus menghasilkan teks, bukan media buatan.
Fitur Utama API Gemini 3.6 Flash Image-to-Text
-
Pemahaman Visual Multimodal: Gabungkan gambar dan instruksi bahasa alami untuk membuat deskripsi visual, jawaban, dan analisis yang didasarkan pada gambar.
-
Jawaban Pertanyaan Gambar yang Efisien: Gunakan keluarga model Flash untuk tugas visual responsif seperti penjelasan tangkapan layar, ekstraksi detail produk, dan perbandingan gambar.
-
Alur Kerja Visual Terfokus: Jaga agar setiap permintaan berpusat pada input gambar yang terfokus sehingga rute ini mudah digunakan dalam fitur produk dan antrean peninjauan.
-
Pengiriman Gambar Terdokumentasi: Kirim gambar melalui pola permintaan Flaq AI yang dikonfigurasi dan sesuai dengan alur kerja pengunggahan serta penyimpanan aplikasi Anda.
-
Konteks Berbasis Pesan: Tambahkan panduan sistem, maksud pengguna, dan konteks percakapan di sekitar pertanyaan visual ketika tugas memerlukan batasan yang lebih jelas.
-
Integrasi Berorientasi Teks: Terima teks yang sesuai untuk ditampilkan, ditinjau, dirutekan, dan diotomatisasi tanpa memperlakukan endpoint sebagai layanan pembuatan gambar.
Cara Menggunakan API Gemini 3.6 Flash Image-to-Text di Flaq AI
-
Input: Gambar yang didukung dipasangkan dengan prompt yang menentukan tugas pertanyaan, deskripsi, ekstraksi, atau perbandingan yang diinginkan.
-
Output: Respons teks yang didasarkan pada gambar yang diberikan dan konteks permintaan.
-
Pengiriman Gambar: Berikan gambar sesuai dengan format permintaan Flaq AI yang dikonfigurasi.
-
Kemampuan: Menjawab pertanyaan visual, menjelaskan tangkapan layar, meringkas gambar, mengekstrak detail, dan menyusun konten berdasarkan gambar.
Kasus Penggunaan Terbaik untuk Integrasi API Gemini 3.6 Flash Image-to-Text
-
Peninjauan UI dan Produk: Ubah tangkapan layar menjadi deskripsi antarmuka, draf laporan bug, catatan QA visual, atau umpan balik desain yang dapat ditindaklanjuti.
-
Pengayaan Katalog: Ekstrak atribut yang terlihat dan susun deskripsi produk untuk alur kerja perdagangan dan inventaris yang ditinjau manusia.
-
Triase Dukungan Pelanggan: Tafsirkan tangkapan layar dan gambar yang dikirim pengguna untuk menyarankan pertanyaan, respons, dan keputusan perutean bagi tim dukungan.
-
Bantuan Aksesibilitas: Buat draf deskripsi gambar dan ringkasan visual yang dapat ditinjau dan disempurnakan editor sebelum diterbitkan.
-
Penjelasan Dokumen dan Diagram: Bantu pengguna memahami bagan, diagram, slide, dan referensi visual melalui teks hasil generasi yang jelas.
Catatan Rute ini dikonfigurasi untuk input gambar terfokus dan output teks. Tinjau output yang berasal dari gambar sebelum menggunakannya untuk keputusan penting terkait keselamatan, hukum, medis, keuangan, atau kepatuhan.
API Gemini 3.6 Flash Image-to-Text vs Pesaing: Analisis Perbandingan
-
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.5 Flash Image-to-Text
Gemini 3.5 Flash menyediakan opsi yang sudah dikenal untuk tugas image-to-text. Gemini 3.6 Flash adalah generasi model lebih baru bagi tim yang menginginkan API multimodal yang efisien dengan penalaran yang lebih kuat dan dukungan perencanaan yang berkaitan dengan pemrograman. -
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash adalah model Flash yang lebih baru untuk alur kerja agentik dan multimodal yang kompleks. Gemini 3.6 Flash menawarkan rute pemahaman visual yang seimbang ketika alur kerja image-to-text terfokus menjadi prioritas. -
Gemini 3.6 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
Grok 4.6 adalah alternatif xAI yang bermanfaat untuk penalaran teknis berdasarkan gambar. Gemini 3.6 Flash menyediakan keluarga model multimodal Google dengan integrasi Flaq AI yang terfokus untuk pertanyaan visual dan operasi konten. -
Gemini 3.6 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Model visual GPT 5.6 Terra mendukung beragam skenario aplikasi multimodal. Gemini 3.6 Flash adalah pilihan kuat untuk dievaluasi ketika tim membutuhkan rute berbasis Gemini yang efisien untuk tangkapan layar, produk, dan output teks berdasarkan gambar. -
Gemini 3.6 Flash Image-to-Text vs. Claude Vision
Model visi Claude dapat sesuai untuk tugas dokumen dan penjelasan. Gemini 3.6 Flash menawarkan opsi API siap produksi lainnya untuk analisis visual dengan batasan image-to-text yang jelas.