Panduan Claude Code
Siapkan model Claude Flaq AI dan jelajahi skill Claude Code
Coba Grok 4.6 API dari xAI untuk image-to-text, Q&A visual, OCR, analisis, dan respons multimodal streaming melalui API terpadu Flaq AI yang stabil.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parameter | Harga | Harga asli | Diskon |
|---|
API Image-to-Text Grok 4.6 memadukan model teks xAI yang berorientasi penalaran dengan pemahaman gambar di Flaq AI. API ini memungkinkan aplikasi mengirim masukan visual yang terfokus bersama instruksi, lalu menerima teks yang menjelaskan, mengekstrak, membandingkan, atau menganalisis isi gambar. Integrasi API vision Grok ini dirancang untuk alur kerja ketika bukti visual perlu diubah menjadi jawaban yang dapat ditindaklanjuti, pengamatan teknis, atau langkah berikutnya yang terstruktur.
Analisis Berbasis Gambar: Ajukan pertanyaan tentang gambar yang diberikan dan terima respons teks yang terkait dengan detail yang terlihat, tata letak, objek, dan konteks.
Penalaran Visual ke Teks: Gabungkan gambar dengan instruksi bahasa alami untuk penjelasan, perbandingan, pemecahan masalah, dan alur kerja analitis.
Masukan Gambar Terfokus: Berikan masukan gambar yang dikonfigurasi untuk rute tersebut beserta instruksi tugas yang jelas agar alur kerja tanya jawab tentang gambar mudah diintegrasikan.
Bantuan Pemeriksaan Teknis: Gunakan konteks visual untuk peninjauan antarmuka, interpretasi tangkapan layar, penjelasan diagram, penyortiran umpan balik produk, dan tugas serupa yang menghasilkan teks.
Permintaan Percakapan Terkendali: Padukan pertanyaan gambar dengan konteks pesan terstruktur agar aplikasi dapat memberikan kerangka tugas, persyaratan sebelumnya, dan prompt tindak lanjut.
Hasil yang Berfokus pada Teks: Terima teks yang dihasilkan dan siap untuk ditinjau, ditampilkan, diteruskan, atau digunakan oleh alur kerja lanjutan, alih-alih memperlakukan rute ini sebagai endpoint pembuatan gambar.
Masukan: Gambar yang didukung bersama permintaan bahasa alami yang menjelaskan pertanyaan, tujuan ekstraksi, atau tugas analisis.
Keluaran: Respons teks yang mendeskripsikan, menjelaskan, membandingkan, atau menganalisis konten visual yang diberikan.
Pengiriman Gambar: Gunakan format permintaan Flaq AI yang dikonfigurasi untuk masukan gambar dalam alur kerja aplikasi Anda.
Kemampuan: Analisis tangkapan layar, tanya jawab visual, penjelasan berbasis gambar, peninjauan konten, dan ekstraksi detail.
Peninjauan Tangkapan Layar dan UI: Jelaskan antarmuka, identifikasi status yang terlihat, rangkum umpan balik, atau ubah tangkapan layar menjadi deskripsi masalah yang siap digunakan pengembang.
Bantuan Produk dan Katalog: Ekstrak detail produk yang dapat diamati, buat draf atribut, dan dukung peninjauan oleh manusia terhadap kiriman visual.
Penyortiran Dukungan Teknis: Bantu tim menafsirkan tangkapan layar kesalahan, foto perangkat, atau gambar penyiapan sebelum meneruskan kasus kepada operator.
Penjelasan Dokumen dan Diagram: Ubah bagan, diagram, slide, dan referensi visual menjadi pengamatan tekstual yang jelas serta pertanyaan tindak lanjut.
Operasional Konten: Dukung antrean moderasi, penyusunan konten aksesibilitas, dan alur kerja deskripsi gambar dengan tetap menempatkan peninjauan akhir pada manusia.
Catatan Hasil pemahaman gambar harus ditinjau sebelum digunakan dalam keputusan yang berdampak besar, sangat penting bagi keselamatan, hukum, medis, atau keuangan. Jangan mengandalkan teks yang dihasilkan sebagai pengganti pemeriksaan ahli.
Grok 4.6 Image-to-Text vs. Grok 4.5 Image-to-Text
Grok 4.5 menyediakan pilihan yang sudah mapan untuk alur kerja
tanya jawab visual. Grok 4.6 adalah generasi model yang lebih baru bagi tim yang mengevaluasi penalaran lebih kuat seputar
permintaan berbasis gambar.
Grok 4.6 Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash menawarkan keluarga model multimodal yang efisien.
Grok 4.6 Image-to-Text menyediakan rute Flaq terfokus bagi tim yang ingin menguji penalaran visual xAI dalam
alur kerja masukan visual dan keluaran teks.
Grok 4.6 Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Model visual GPT 5.6 Terra umum digunakan untuk tugas multimodal serbaguna.
Grok 4.6 merupakan alternatif yang berguna ketika alur kerja mengutamakan keluarga model xAI yang berorientasi penalaran dan pemrograman bersama
analisis visual.
Grok 4.6 Image-to-Text vs. Claude Vision
Model vision Claude sesuai untuk tugas penjelasan dan
berorientasi dokumen. Grok 4.6 Image-to-Text memberi pengembang pilihan API lain untuk pertanyaan berbasis gambar,
peninjauan, dan alur kerja operasional.
Grok 4.6 Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash menyeimbangkan kemampuan multimodal yang luas
dengan operasi yang efisien. Grok 4.6 adalah kandidat kuat untuk dievaluasi ketika permintaan visual juga memerlukan
penalaran teknis terperinci dalam bentuk teks.
Siapkan model Claude Flaq AI dan jelajahi skill Claude Code

Siapkan model GPT Flaq AI dan jelajahi skill Codex
Gunakan model LLM Flaq AI di Hermes Agent
Gunakan GLM 5.2, Kimi K3, dan DeepSeek v4 di ZCode
Jalankan DeepSeek Harness dengan model DeepSeek Flaq AI
Hubungkan agen AI ke alat pembuatan gambar dan video Flaq
Gunakan GPT 6 Astra dan Claude Fable 5.1 di WorkBuddy