جرّب واجهة Gemini 3.6 Flash API لتحويل الصور إلى نصوص والأسئلة والأجوبة المرئية وOCR والتحليل والاستجابات المتدفقة متعددة الوسائط عبر وصول Flaq AI المستقر إلى Google API.
نماذج Gemini 3.6 Flash ذات الصلة
أمثلة API
مثال الإرسال
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
مثال الإرسال
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
مثال الإرسال
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
أسعار Gemini 3.6 Flash Image to Text
| المعلمات | السعر | السعر الأصلي | الخصم |
|---|
README
واجهة Gemini 3.6 Flash Image-to-Text API السريعة والفعالة
توفر واجهة Gemini 3.6 Flash Image-to-Text API لتطبيقات Flaq AI مسارًا مركزًا يحول المدخلات المرئية إلى نص مفيد. وبُنيت على نموذج Gemini 3.6 Flash متعدد الوسائط من Google، حيث يجمع المسار صورة مع تعليمات كي تتمكن الفرق من طرح الأسئلة، واستخراج الملاحظات، وشرح لقطات الشاشة، وإعداد المحتوى المرئي لسير العمل اللاحق. ويحافظ التكامل على نطاق ضيق عمدًا: ينتج الطلب المرئي المركز نصًا بدلًا من وسائط منشأة.
الميزات الرئيسية لواجهة Gemini 3.6 Flash Image-to-Text API
-
فهم مرئي متعدد الوسائط: اجمع صورة وتعليمات بلغة طبيعية لإنشاء أوصاف وإجابات وتحليلات مستندة إلى المحتوى المرئي.
-
إجابة فعالة عن أسئلة الصور: استخدم عائلة نماذج Flash لمهام مرئية سريعة الاستجابة، مثل شرح لقطات الشاشة، واستخراج تفاصيل المنتجات، ومقارنة الصور.
-
سير عمل مرئي مركز: اجعل كل طلب متمحورًا حول إدخال صورة محدد، مما يجعل المسار مباشرًا وسهل الاستخدام في ميزات المنتجات وقوائم انتظار المراجعة.
-
تسليم صور موثق: أرسل الصور عبر نمط طلب Flaq AI المهيأ الذي يلائم سير عمل الرفع والتخزين في تطبيقك.
-
سياق قائم على الرسائل: أضف توجيهات النظام، وقصد المستخدم، وسياق المحادثة حول الأسئلة المرئية عندما تحتاج المهمة إلى قيود أوضح.
-
تكامل يركز على النص: استلم نصًا ملائمًا للعرض والمراجعة والتوجيه والأتمتة من دون التعامل مع نقطة النهاية على أنها خدمة لإنشاء الصور.
كيفية استخدام واجهة Gemini 3.6 Flash Image-to-Text API على Flaq AI
-
الإدخال: صورة مدعومة مقترنة بمطالبة تحدد مهمة السؤال أو الوصف أو الاستخراج أو المقارنة المطلوبة.
-
الإخراج: استجابات نصية مستندة إلى الصورة المقدمة وسياق الطلب.
-
تسليم الصورة: قدّم صورة وفق تنسيق طلب Flaq AI المهيأ.
-
الإمكانات: الإجابة عن الأسئلة المرئية، وشرح لقطات الشاشة، وتلخيص الصور، واستخراج التفاصيل، وصياغة محتوى مستند إلى الصور.
أفضل حالات الاستخدام لتكامل Gemini 3.6 Flash Image-to-Text API
-
مراجعة واجهات المستخدم والمنتجات: حوّل لقطات الشاشة إلى أوصاف للواجهات، أو مسودات لتقارير الأخطاء، أو ملاحظات ضمان جودة مرئية، أو تعليقات تصميم قابلة للتنفيذ.
-
إثراء الكتالوج: استخرج السمات المرئية وصغ أوصاف المنتجات لسير عمل التجارة والمخزون الخاضع للمراجعة البشرية.
-
فرز دعم العملاء: فسّر لقطات الشاشة والصور المقدمة من المستخدمين لاقتراح الأسئلة والردود وقرارات التوجيه لفرق الدعم.
-
المساعدة في إمكانية الوصول: أنشئ مسودات لأوصاف الصور وملخصات مرئية يمكن للمحررين مراجعتها وتحسينها قبل النشر.
-
شرح المستندات والمخططات: ساعد المستخدمين على فهم الرسوم البيانية والمخططات والشرائح والمراجع المرئية عبر نص واضح منشأ.
ملاحظة هذا المسار مهيأ لإدخال صورة محددة وإخراج نص. راجع المخرجات المستمدة من الصور قبل استخدامها في قرارات حساسة للسلامة أو قانونية أو طبية أو مالية أو متعلقة بالامتثال.
Gemini 3.6 Flash Image-to-Text API مقابل المنافسين: تحليل مقارن
-
Gemini 3.6 Flash Image-to-Text مقابل Gemini 3.5 Flash Image-to-Text
يوفر Gemini 3.5 Flash خيارًا مألوفًا لمهام تحويل الصور إلى نص. ويمثل Gemini 3.6 Flash جيلًا أحدث من النماذج للفرق التي تريد API متعددة الوسائط وفعالة مع استدلال أقوى ودعم للتخطيط المرتبط بالبرمجة. -
Gemini 3.6 Flash Image-to-Text مقابل Gemini 3.7 Flash Image-to-Text
يعد Gemini 3.7 Flash نموذج Flash الأحدث لسير العمل القائم على الوكلاء ومتعدد الوسائط المعقد. ويقدم Gemini 3.6 Flash مسار فهم مرئي متوازنًا عندما تكون الأولوية لسير عمل مركز لتحويل الصور إلى نص. -
Gemini 3.6 Flash Image-to-Text مقابل Grok 4.6 Image-to-Text
يعد Grok 4.6 بديلًا مفيدًا من xAI للاستدلال التقني المستند إلى الصور. ويوفر Gemini 3.6 Flash عائلة نماذج Google متعددة الوسائط مع تكامل Flaq AI مركز من أجل الأسئلة المرئية وعمليات المحتوى. -
Gemini 3.6 Flash Image-to-Text مقابل GPT 5.6 Terra Image-to-Text
تدعم نماذج GPT 5.6 Terra المرئية نطاقًا واسعًا من سيناريوهات التطبيقات متعددة الوسائط. ويعد Gemini 3.6 Flash خيارًا قويًا للتقييم عندما تحتاج الفرق إلى مسار فعال قائم على Gemini من أجل لقطات الشاشة والمنتجات وإخراج النص المستند إلى الصور. -
Gemini 3.6 Flash Image-to-Text مقابل Claude Vision
قد تكون نماذج Claude للرؤية مناسبة تمامًا لمهام المستندات والشرح. ويقدم Gemini 3.6 Flash خيار API آخر جاهزًا للإنتاج لتحليل المحتوى المرئي ضمن نطاق واضح لتحويل الصور إلى نص.