Coba Grok 4.6 API dari xAI untuk image-to-text, Q&A visual, OCR, analisis, dan respons multimodal streaming melalui API terpadu Flaq AI yang stabil.
Model Grok 4.6 Terkait
Contoh API
Contoh Pengiriman
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Contoh Pengiriman
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Contoh Pengiriman
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Harga Grok 4.6 Image to Text
| Parameter | Harga | Harga asli | Diskon |
|---|
README
API Image-to-Text Grok 4.6 (Penalaran dan Analisis Visual)
API Image-to-Text Grok 4.6 memadukan model teks xAI yang berorientasi penalaran dengan pemahaman gambar di Flaq AI. API ini memungkinkan aplikasi mengirim masukan visual yang terfokus bersama instruksi, lalu menerima teks yang menjelaskan, mengekstrak, membandingkan, atau menganalisis isi gambar. Integrasi API vision Grok ini dirancang untuk alur kerja ketika bukti visual perlu diubah menjadi jawaban yang dapat ditindaklanjuti, pengamatan teknis, atau langkah berikutnya yang terstruktur.
Fitur Utama API Image-to-Text Grok 4.6
-
Analisis Berbasis Gambar: Ajukan pertanyaan tentang gambar yang diberikan dan terima respons teks yang terkait dengan detail yang terlihat, tata letak, objek, dan konteks.
-
Penalaran Visual ke Teks: Gabungkan gambar dengan instruksi bahasa alami untuk penjelasan, perbandingan, pemecahan masalah, dan alur kerja analitis.
-
Masukan Gambar Terfokus: Berikan masukan gambar yang dikonfigurasi untuk rute tersebut beserta instruksi tugas yang jelas agar alur kerja tanya jawab tentang gambar mudah diintegrasikan.
-
Bantuan Pemeriksaan Teknis: Gunakan konteks visual untuk peninjauan antarmuka, interpretasi tangkapan layar, penjelasan diagram, penyortiran umpan balik produk, dan tugas serupa yang menghasilkan teks.
-
Permintaan Percakapan Terkendali: Padukan pertanyaan gambar dengan konteks pesan terstruktur agar aplikasi dapat memberikan kerangka tugas, persyaratan sebelumnya, dan prompt tindak lanjut.
-
Hasil yang Berfokus pada Teks: Terima teks yang dihasilkan dan siap untuk ditinjau, ditampilkan, diteruskan, atau digunakan oleh alur kerja lanjutan, alih-alih memperlakukan rute ini sebagai endpoint pembuatan gambar.
Cara Menggunakan API Image-to-Text Grok 4.6 di Flaq AI
-
Masukan: Gambar yang didukung bersama permintaan bahasa alami yang menjelaskan pertanyaan, tujuan ekstraksi, atau tugas analisis.
-
Keluaran: Respons teks yang mendeskripsikan, menjelaskan, membandingkan, atau menganalisis konten visual yang diberikan.
-
Pengiriman Gambar: Gunakan format permintaan Flaq AI yang dikonfigurasi untuk masukan gambar dalam alur kerja aplikasi Anda.
-
Kemampuan: Analisis tangkapan layar, tanya jawab visual, penjelasan berbasis gambar, peninjauan konten, dan ekstraksi detail.
Kasus Penggunaan Terbaik untuk Integrasi API Image-to-Text Grok 4.6
-
Peninjauan Tangkapan Layar dan UI: Jelaskan antarmuka, identifikasi status yang terlihat, rangkum umpan balik, atau ubah tangkapan layar menjadi deskripsi masalah yang siap digunakan pengembang.
-
Bantuan Produk dan Katalog: Ekstrak detail produk yang dapat diamati, buat draf atribut, dan dukung peninjauan oleh manusia terhadap kiriman visual.
-
Penyortiran Dukungan Teknis: Bantu tim menafsirkan tangkapan layar kesalahan, foto perangkat, atau gambar penyiapan sebelum meneruskan kasus kepada operator.
-
Penjelasan Dokumen dan Diagram: Ubah bagan, diagram, slide, dan referensi visual menjadi pengamatan tekstual yang jelas serta pertanyaan tindak lanjut.
-
Operasional Konten: Dukung antrean moderasi, penyusunan konten aksesibilitas, dan alur kerja deskripsi gambar dengan tetap menempatkan peninjauan akhir pada manusia.
Catatan Hasil pemahaman gambar harus ditinjau sebelum digunakan dalam keputusan yang berdampak besar, sangat penting bagi keselamatan, hukum, medis, atau keuangan. Jangan mengandalkan teks yang dihasilkan sebagai pengganti pemeriksaan ahli.
API Image-to-Text Grok 4.6 vs Pesaing: Analisis Perbandingan
-
Grok 4.6 Image-to-Text vs. Grok 4.5 Image-to-Text
Grok 4.5 menyediakan pilihan yang sudah mapan untuk alur kerja tanya jawab visual. Grok 4.6 adalah generasi model yang lebih baru bagi tim yang mengevaluasi penalaran lebih kuat seputar permintaan berbasis gambar. -
Grok 4.6 Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash menawarkan keluarga model multimodal yang efisien. Grok 4.6 Image-to-Text menyediakan rute Flaq terfokus bagi tim yang ingin menguji penalaran visual xAI dalam alur kerja masukan visual dan keluaran teks. -
Grok 4.6 Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Model visual GPT 5.6 Terra umum digunakan untuk tugas multimodal serbaguna. Grok 4.6 merupakan alternatif yang berguna ketika alur kerja mengutamakan keluarga model xAI yang berorientasi penalaran dan pemrograman bersama analisis visual. -
Grok 4.6 Image-to-Text vs. Claude Vision
Model vision Claude sesuai untuk tugas penjelasan dan berorientasi dokumen. Grok 4.6 Image-to-Text memberi pengembang pilihan API lain untuk pertanyaan berbasis gambar, peninjauan, dan alur kerja operasional. -
Grok 4.6 Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash menyeimbangkan kemampuan multimodal yang luas dengan operasi yang efisien. Grok 4.6 adalah kandidat kuat untuk dievaluasi ketika permintaan visual juga memerlukan penalaran teknis terperinci dalam bentuk teks.