Panduan Claude Code
Siapkan model Claude Flaq AI dan jelajahi skill Claude Code
Coba Gemini 3.6 Flash API untuk image-to-text, Q&A visual, OCR, analisis, dan respons multimodal streaming melalui akses Google API Flaq AI yang stabil.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parameter | Harga | Harga asli | Diskon |
|---|
API Gemini 3.6 Flash Image-to-Text memberikan jalur terfokus bagi aplikasi Flaq AI dari input visual ke teks yang berguna. Dibangun dengan model Gemini 3.6 Flash multimodal Google, rute ini menggabungkan gambar dengan instruksi agar tim dapat mengajukan pertanyaan, mengekstrak pengamatan, menjelaskan tangkapan layar, dan menyiapkan konten visual untuk alur kerja lanjutan. Integrasi ini sengaja dibuat terbatas: permintaan visual yang terfokus menghasilkan teks, bukan media buatan.
Pemahaman Visual Multimodal: Gabungkan gambar dan instruksi bahasa alami untuk membuat deskripsi visual, jawaban, dan analisis yang didasarkan pada gambar.
Jawaban Pertanyaan Gambar yang Efisien: Gunakan keluarga model Flash untuk tugas visual responsif seperti penjelasan tangkapan layar, ekstraksi detail produk, dan perbandingan gambar.
Alur Kerja Visual Terfokus: Jaga agar setiap permintaan berpusat pada input gambar yang terfokus sehingga rute ini mudah digunakan dalam fitur produk dan antrean peninjauan.
Pengiriman Gambar Terdokumentasi: Kirim gambar melalui pola permintaan Flaq AI yang dikonfigurasi dan sesuai dengan alur kerja pengunggahan serta penyimpanan aplikasi Anda.
Konteks Berbasis Pesan: Tambahkan panduan sistem, maksud pengguna, dan konteks percakapan di sekitar pertanyaan visual ketika tugas memerlukan batasan yang lebih jelas.
Integrasi Berorientasi Teks: Terima teks yang sesuai untuk ditampilkan, ditinjau, dirutekan, dan diotomatisasi tanpa memperlakukan endpoint sebagai layanan pembuatan gambar.
Input: Gambar yang didukung dipasangkan dengan prompt yang menentukan tugas pertanyaan, deskripsi, ekstraksi, atau perbandingan yang diinginkan.
Output: Respons teks yang didasarkan pada gambar yang diberikan dan konteks permintaan.
Pengiriman Gambar: Berikan gambar sesuai dengan format permintaan Flaq AI yang dikonfigurasi.
Kemampuan: Menjawab pertanyaan visual, menjelaskan tangkapan layar, meringkas gambar, mengekstrak detail, dan menyusun konten berdasarkan gambar.
Peninjauan UI dan Produk: Ubah tangkapan layar menjadi deskripsi antarmuka, draf laporan bug, catatan QA visual, atau umpan balik desain yang dapat ditindaklanjuti.
Pengayaan Katalog: Ekstrak atribut yang terlihat dan susun deskripsi produk untuk alur kerja perdagangan dan inventaris yang ditinjau manusia.
Triase Dukungan Pelanggan: Tafsirkan tangkapan layar dan gambar yang dikirim pengguna untuk menyarankan pertanyaan, respons, dan keputusan perutean bagi tim dukungan.
Bantuan Aksesibilitas: Buat draf deskripsi gambar dan ringkasan visual yang dapat ditinjau dan disempurnakan editor sebelum diterbitkan.
Penjelasan Dokumen dan Diagram: Bantu pengguna memahami bagan, diagram, slide, dan referensi visual melalui teks hasil generasi yang jelas.
Catatan Rute ini dikonfigurasi untuk input gambar terfokus dan output teks. Tinjau output yang berasal dari gambar sebelum menggunakannya untuk keputusan penting terkait keselamatan, hukum, medis, keuangan, atau kepatuhan.
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.5 Flash Image-to-Text
Gemini 3.5 Flash menyediakan opsi yang sudah dikenal untuk
tugas image-to-text. Gemini 3.6 Flash adalah generasi model lebih baru bagi tim yang menginginkan API multimodal yang efisien
dengan penalaran yang lebih kuat dan dukungan perencanaan yang berkaitan dengan pemrograman.
Gemini 3.6 Flash Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash adalah model Flash yang lebih baru
untuk alur kerja agentik dan multimodal yang kompleks. Gemini 3.6 Flash menawarkan rute pemahaman visual yang seimbang ketika
alur kerja image-to-text terfokus menjadi prioritas.
Gemini 3.6 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
Grok 4.6 adalah alternatif xAI yang bermanfaat untuk penalaran teknis
berdasarkan gambar. Gemini 3.6 Flash menyediakan keluarga model multimodal Google dengan integrasi Flaq AI yang terfokus untuk
pertanyaan visual dan operasi konten.
Gemini 3.6 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Model visual GPT 5.6 Terra mendukung beragam skenario aplikasi
multimodal. Gemini 3.6 Flash adalah pilihan kuat untuk dievaluasi ketika tim membutuhkan rute berbasis Gemini yang efisien untuk
tangkapan layar, produk, dan output teks berdasarkan gambar.
Gemini 3.6 Flash Image-to-Text vs. Claude Vision
Model visi Claude dapat sesuai untuk tugas dokumen dan
penjelasan. Gemini 3.6 Flash menawarkan opsi API siap produksi lainnya untuk analisis visual dengan batasan
image-to-text yang jelas.
Siapkan model Claude Flaq AI dan jelajahi skill Claude Code

Siapkan model GPT Flaq AI dan jelajahi skill Codex
Gunakan model LLM Flaq AI di Hermes Agent
Gunakan GLM 5.2, Kimi K3, dan DeepSeek v4 di ZCode
Jalankan DeepSeek Harness dengan model DeepSeek Flaq AI
Hubungkan agen AI ke alat pembuatan gambar dan video Flaq
Gunakan GPT 6 Astra dan Claude Fable 5.1 di WorkBuddy