Coba Gemini 3.7 Flash API untuk image-to-text, Q&A visual, OCR, analisis, dan respons multimodal streaming melalui akses Google API Flaq AI yang stabil.
Model Gemini 3.7 Flash Terkait
Contoh API
Contoh Pengiriman
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.7-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Contoh Pengiriman
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.7-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Contoh Pengiriman
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Harga Gemini 3.7 Flash Image to Text
| Parameter | Harga | Harga asli | Diskon |
|---|
README
API Gemini 3.7 Flash Image-to-Text yang Cepat dan Terjangkau
API Gemini 3.7 Flash Image-to-Text menghubungkan aplikasi Flaq AI ke model Flash terbaru Google untuk pemahaman visual yang cepat dan mumpuni. Kirim input gambar yang terfokus dengan instruksi yang jelas untuk menghasilkan teks yang mendeskripsikan, menjelaskan, mengekstrak, atau menganalisis konten visual. Rute ini memadukan kekuatan multimodal dan penalaran Gemini 3.7 Flash dengan batas input Flaq AI yang sengaja dibuat terfokus, sehingga sangat cocok untuk fitur produk yang responsif dan alur kerja peninjauan.
Fitur Utama API Gemini 3.7 Flash Image-to-Text
-
Penalaran Visual Tingkat Lanjut: Ubah pertanyaan berbasis gambar menjadi respons teks yang jelas dan mencerminkan konteks visual serta instruksi tugas yang diberikan.
-
Alur Kerja Multimodal yang Hemat Biaya: Gunakan konfigurasi Flash yang sangat terjangkau untuk fitur analisis visual yang memerlukan output teks mumpuni dalam skala besar.
-
Permintaan Gambar yang Terfokus: Pertahankan setiap interaksi agar berpusat pada satu input visual dan tujuan tertentu, sehingga membantu aplikasi menghasilkan output yang lebih jelas dan lebih mudah ditinjau.
-
Pengiriman Gambar yang Terdokumentasi: Kirim input gambar melalui pola permintaan API Flaq AI yang dikonfigurasi.
-
Dukungan Konteks Pesan: Gabungkan permintaan visual dengan pesan sistem, pengguna, dan asisten yang terstruktur saat tugas memerlukan instruksi, kriteria, atau konteks tindak lanjut.
-
Integrasi API yang Responsif: Pilih pengiriman streaming atau respons lengkap agar sesuai dengan asisten interaktif, tugas peninjauan asinkron, dan alat internal.
Cara Menggunakan API Gemini 3.7 Flash Image-to-Text di Flaq AI
-
Masukan: Gambar yang didukung beserta prompt bahasa alami yang menentukan deskripsi, pertanyaan, ekstraksi, atau analisis yang diminta.
-
Keluaran: Respons teks untuk pengalaman pengguna, peninjauan manusia, alur kerja konten, dan otomatisasi lanjutan.
-
Pengiriman Gambar: Gunakan format permintaan Flaq AI yang dikonfigurasi untuk input gambar.
-
Kemampuan: Tanya jawab berbasis gambar, interpretasi tangkapan layar, ekstraksi detail visual, peringkasan gambar, dan penyusunan draf konten.
Kasus Penggunaan Terbaik untuk Integrasi API Gemini 3.7 Flash Image-to-Text
-
Pengalaman Produk Visual: Tambahkan pertanyaan gambar, bantuan pencarian visual, dan penjelasan kontekstual ke aplikasi yang ditujukan kepada pengguna.
-
Peninjauan Desain dan QA: Hasilkan catatan awal dari tangkapan layar UI, citra produk, diagram, dan umpan balik visual untuk ditinjau manusia.
-
Alur Kerja Dukungan: Bantu agen menafsirkan gambar dan tangkapan layar pelanggan, mengidentifikasi detail yang berguna, serta menyiapkan draf respons atau eskalasi.
-
Operasi Perdagangan dan Katalog: Ekstrak atribut yang terlihat, susun deskripsi, dan dukung peninjauan editorial atas citra produk.
-
Alur Kerja Aksesibilitas dan Konten: Buat draf deskripsi serta rangkuman visual yang dapat ditinjau untuk membantu tim editorial menyiapkan konten yang aksesibel.
Catatan Rute Flaq AI saat ini dirancang untuk input gambar yang terfokus dan output teks. Jangan gunakan analisis yang dihasilkan sebagai satu-satunya dasar keputusan berdampak besar; pertahankan peninjauan manusia dan verifikasi sumber yang sesuai.
API Gemini 3.7 Flash Image-to-Text vs Pesaing: Analisis Perbandingan
-
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash menawarkan rute multimodal yang seimbang untuk pertanyaan dan operasi gambar. Gemini 3.7 Flash adalah model Flash yang lebih baru untuk dievaluasi ketika tugas visual juga memperoleh manfaat dari penalaran multitahap yang lebih maju. -
Gemini 3.7 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
Grok 4.6 adalah opsi xAI untuk penalaran teknis berbasis gambar. Gemini 3.7 Flash menyediakan rute model Google yang sangat hemat biaya untuk pertanyaan visual, tangkapan layar, dan fitur produk yang mengutamakan teks. -
Gemini 3.7 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Model visual GPT 5.6 Terra mendukung aplikasi multimodal yang luas. Gemini 3.7 Flash adalah alternatif yang menarik saat tim menginginkan model Flash yang efisien untuk analisis gambar terfokus dan teks yang dihasilkan. -
Gemini 3.7 Flash Image-to-Text vs. Claude Vision
Model vision Claude dapat menjadi pilihan kuat untuk tugas penjelasan dan berorientasi dokumen. Gemini 3.7 Flash menawarkan API pemahaman visual yang responsif bagi tim yang mengevaluasi alur kerja multimodal hemat biaya. -
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.7 Flash Text-to-Text
Text-to-Text dioptimalkan untuk prompt tanpa input visual. Image-to-Text adalah rute yang lebih tepat ketika jawaban harus didasarkan pada gambar yang diberikan serta instruksi tertulis.