جرّب واجهة Grok 4.6 API من xAI لتحويل الصور إلى نصوص والأسئلة والأجوبة المرئية وOCR والتحليل والاستجابات المتدفقة متعددة الوسائط عبر واجهة Flaq AI API الموحدة والمستقرة.
نماذج Grok 4.6 ذات الصلة
أمثلة API
مثال الإرسال
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
مثال الإرسال
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
مثال الإرسال
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
أسعار Grok 4.6 Image to Text
| المعلمات | السعر | السعر الأصلي | الخصم |
|---|
README
واجهة Grok 4.6 Image-to-Text API (الاستدلال والتحليل البصريان)
تجمع Grok 4.6 Image-to-Text API بين نموذج xAI النصي المتمحور حول الاستدلال وفهم الصور على Flaq AI. وتتيح للتطبيقات إرسال إدخال بصري محدد إلى جانب تعليمات، ثم تلقي نص يشرح محتوى الصورة أو يستخرجه أو يقارنه أو يحلله. وقد صُمم تكامل Grok Vision API هذا لسير العمل الذي يحتاج إلى تحويل الأدلة البصرية إلى إجابة قابلة للتنفيذ أو ملاحظة تقنية أو خطوة تالية منظمة.
الميزات الرئيسية لواجهة Grok 4.6 Image-to-Text API
-
تحليل مستند إلى الصور: اطرح أسئلة حول صورة مقدمة وتلقَّ استجابات نصية مرتبطة بالتفاصيل الظاهرة والتخطيط والعناصر والسياق.
-
الاستدلال من الصور إلى النصوص: ادمج صورة مع تعليمات باللغة الطبيعية لأغراض الشرح والمقارنة واستكشاف الأخطاء وإصلاحها وسير العمل التحليلي.
-
إدخال صور محدد: قدم إدخال الصورة المضبوط للمسار مع تعليمات واضحة للمهمة، ما يحافظ على سهولة تكامل سير عمل الأسئلة المتعلقة بالصور.
-
المساعدة في الفحص التقني: استخدم السياق البصري لمراجعة الواجهات وتفسير لقطات الشاشة وشرح المخططات وفرز ملاحظات المنتجات ومهام إخراج النصوص المشابهة.
-
طلبات محادثة مضبوطة: اقرن الأسئلة المتعلقة بالصور بسياق رسائل منظم حتى تتمكن التطبيقات من تقديم إطار المهمة والمتطلبات السابقة ومطالبات المتابعة.
-
نتائج تركز على النصوص: احصل على نص منشأ جاهز للمراجعة أو العرض أو التوجيه أو الاستخدام في سير عمل لاحق بدلًا من التعامل مع المسار بوصفه نقطة نهاية لإنشاء الصور.
كيفية استخدام Grok 4.6 Image-to-Text API على Flaq AI
-
الإدخال: صورة مدعومة إلى جانب طلب باللغة الطبيعية يصف السؤال أو هدف الاستخراج أو مهمة التحليل.
-
الإخراج: استجابات نصية تصف المحتوى البصري المقدم أو تشرحه أو تقارنه أو تحلله.
-
إرسال الصورة: استخدم تنسيق طلب Flaq AI المضبوط لإدخال الصورة في سير عمل تطبيقك.
-
الإمكانات: تحليل لقطات الشاشة والإجابة عن الأسئلة البصرية والشرح المستند إلى الصور ومراجعة المحتوى واستخراج التفاصيل.
أفضل حالات الاستخدام لتكامل Grok 4.6 Image-to-Text API
-
مراجعة لقطات الشاشة وواجهة المستخدم: اشرح الواجهات وحدد الحالات الظاهرة ولخّص الملاحظات أو حوّل لقطة شاشة إلى وصف للمشكلة جاهز للمطورين.
-
المساعدة في المنتجات والكتالوجات: استخرج تفاصيل المنتجات القابلة للملاحظة وأنشئ مسودات السمات وادعم المراجعة البشرية للمحتوى البصري المقدم.
-
فرز الدعم التقني: ساعد الفرق على تفسير لقطات شاشة الأخطاء أو صور الأجهزة أو صور الإعداد قبل توجيه الحالة إلى مشغل.
-
شرح الوثائق والمخططات: حوّل الرسوم البيانية والمخططات والشرائح والمراجع البصرية إلى ملاحظات نصية واضحة وأسئلة متابعة.
-
عمليات المحتوى: ادعم قوائم انتظار الإشراف وصياغة محتوى إمكانية الوصول وسير عمل وصف الصور حيث يحتفظ البشر بالمراجعة النهائية.
ملاحظة ينبغي مراجعة نتائج فهم الصور قبل استخدامها في قرارات عالية التأثير أو حساسة للسلامة أو قانونية أو طبية أو مالية. لا تعتمد على النص المنشأ بوصفه بديلًا عن فحص الخبراء.
مقارنة Grok 4.6 Image-to-Text API بالمنافسين: تحليل مقارن
-
Grok 4.6 Image-to-Text مقابل Grok 4.5 Image-to-Text
يوفر Grok 4.5 خيارًا راسخًا لسير عمل الأسئلة والأجوبة البصرية. أما Grok 4.6 فهو الجيل الأحدث من النماذج للفرق التي تقيّم استدلالًا أقوى حول الطلبات المستندة إلى الصور. -
Grok 4.6 Image-to-Text مقابل Gemini 3.7 Flash Image-to-Text
يقدم Gemini 3.7 Flash عائلة نماذج فعالة متعددة الوسائط. وتوفر Grok 4.6 Image-to-Text مسارًا محددًا عبر Flaq للفرق التي ترغب في اختبار الاستدلال البصري لدى xAI ضمن سير عمل يعتمد على إدخال الصور وإخراج النصوص. -
Grok 4.6 Image-to-Text مقابل GPT 5.6 Terra Image-to-Text
تُستخدم نماذج GPT 5.6 Terra البصرية عادةً للمهام العامة متعددة الوسائط. ويعد Grok 4.6 بديلًا مفيدًا عندما يمنح سير العمل الأولوية لعائلة نماذج xAI المتمحورة حول الاستدلال والبرمجة إلى جانب التحليل البصري. -
Grok 4.6 Image-to-Text مقابل Claude Vision
قد تكون نماذج Claude البصرية ملائمة لمهام الشرح والمهام المتمحورة حول الوثائق. وتمنح Grok 4.6 Image-to-Text المطورين خيار API آخر للأسئلة المستندة إلى الصور والمراجعات وسير العمل التشغيلي. -
Grok 4.6 Image-to-Text مقابل Gemini 3.6 Flash Image-to-Text
يوازن Gemini 3.6 Flash بين الإمكانات الواسعة متعددة الوسائط وكفاءة التشغيل. ويعد Grok 4.6 خيارًا قويًا يستحق التقييم عندما تتطلب الطلبات البصرية أيضًا استدلالًا تقنيًا مفصلًا في صورة نص.