Dùng thử Gemini 3.7 Flash API để chuyển ảnh thành văn bản, hỏi đáp hình ảnh, OCR, phân tích và phản hồi đa phương thức theo luồng qua Google API ổn định của Flaq AI.
Mô hình Gemini 3.7 Flash liên quan
Ví dụ API
Ví dụ gửi yêu cầu
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.7-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Ví dụ gửi yêu cầu
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.7-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Ví dụ gửi yêu cầu
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Giá Gemini 3.7 Flash Image to Text
| Tham số | Giá | Giá gốc | Giảm giá |
|---|
README
API Gemini 3.7 Flash Image-to-Text nhanh chóng và tiết kiệm
API Gemini 3.7 Flash Image-to-Text kết nối ứng dụng Flaq AI với mô hình Flash mới nhất của Google để hiểu hình ảnh nhanh chóng và hiệu quả. Gửi một hình ảnh đầu vào tập trung cùng hướng dẫn rõ ràng để tạo văn bản mô tả, giải thích, trích xuất hoặc phân tích nội dung hình ảnh. Phương thức này kết hợp thế mạnh đa phương thức và suy luận của Gemini 3.7 Flash với ranh giới đầu vào Flaq AI được chủ đích thu hẹp, rất phù hợp với các tính năng sản phẩm phản hồi nhanh và quy trình đánh giá.
Các tính năng chính của API Gemini 3.7 Flash Image-to-Text
-
Suy luận hình ảnh nâng cao: Chuyển các câu hỏi dựa trên hình ảnh thành phản hồi văn bản rõ ràng, phản ánh ngữ cảnh hình ảnh và hướng dẫn tác vụ được cung cấp.
-
Quy trình đa phương thức tiết kiệm chi phí: Sử dụng cấu hình Flash có chi phí rất hợp lý cho các tính năng phân tích hình ảnh cần đầu ra văn bản mạnh mẽ ở quy mô lớn.
-
Yêu cầu hình ảnh tập trung: Giữ mỗi lượt tương tác xoay quanh một hình ảnh đầu vào và mục tiêu cụ thể, giúp ứng dụng tạo đầu ra rõ ràng hơn và dễ đánh giá hơn.
-
Cung cấp hình ảnh theo tài liệu: Gửi hình ảnh đầu vào qua mẫu yêu cầu Flaq AI API đã định cấu hình.
-
Hỗ trợ ngữ cảnh tin nhắn: Kết hợp yêu cầu hình ảnh với các tin nhắn system, user và assistant có cấu trúc khi tác vụ cần hướng dẫn, tiêu chí hoặc ngữ cảnh tiếp nối.
-
Tích hợp API phản hồi nhanh: Chọn cung cấp phản hồi truyền phát hoặc hoàn chỉnh để phù hợp với trợ lý tương tác, tác vụ đánh giá bất đồng bộ và công cụ nội bộ.
Cách sử dụng API Gemini 3.7 Flash Image-to-Text trên Flaq AI
-
Đầu vào: Hình ảnh được hỗ trợ cùng câu lệnh ngôn ngữ tự nhiên xác định nội dung mô tả, câu hỏi, trích xuất hoặc phân tích được yêu cầu.
-
Đầu ra: Phản hồi văn bản cho trải nghiệm hướng đến người dùng, đánh giá của con người, quy trình nội dung và tự động hóa hạ nguồn.
-
Cung cấp hình ảnh: Sử dụng định dạng yêu cầu Flaq AI đã định cấu hình cho hình ảnh đầu vào.
-
Khả năng: Trả lời câu hỏi dựa trên hình ảnh, diễn giải ảnh chụp màn hình, trích xuất chi tiết hình ảnh, tóm tắt hình ảnh và soạn thảo nội dung.
Các trường hợp sử dụng phù hợp nhất để tích hợp API Gemini 3.7 Flash Image-to-Text
-
Trải nghiệm sản phẩm hình ảnh: Thêm câu hỏi về hình ảnh, hỗ trợ tìm kiếm trực quan và giải thích theo ngữ cảnh vào ứng dụng hướng đến người dùng.
-
Đánh giá thiết kế và QA: Tạo ghi chú sơ bộ từ ảnh chụp màn hình UI, hình ảnh sản phẩm, sơ đồ và phản hồi trực quan để con người xem xét.
-
Quy trình hỗ trợ: Giúp nhân viên diễn giải hình ảnh và ảnh chụp màn hình của khách hàng, xác định chi tiết hữu ích và chuẩn bị bản thảo phản hồi hoặc chuyển cấp.
-
Vận hành thương mại và danh mục: Trích xuất thuộc tính nhìn thấy được, soạn thảo mô tả và hỗ trợ đánh giá biên tập đối với hình ảnh sản phẩm.
-
Quy trình hỗ trợ tiếp cận và nội dung: Tạo bản thảo mô tả và bản tóm tắt hình ảnh có thể đánh giá để giúp đội ngũ biên tập chuẩn bị nội dung dễ tiếp cận.
Lưu ý Phương thức Flaq AI hiện tại được thiết kế cho đầu vào hình ảnh tập trung và đầu ra văn bản. Không sử dụng phân tích được tạo làm cơ sở duy nhất cho các quyết định có tác động lớn; hãy duy trì đánh giá phù hợp của con người và xác minh nguồn.
API Gemini 3.7 Flash Image-to-Text so với đối thủ: Phân tích so sánh
-
Gemini 3.7 Flash Image-to-Text so với Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash cung cấp một phương thức đa phương thức cân bằng cho câu hỏi và hoạt động về hình ảnh. Gemini 3.7 Flash là mô hình Flash mới hơn để cân nhắc khi tác vụ hình ảnh cũng được hưởng lợi từ khả năng suy luận nhiều bước nâng cao hơn. -
Gemini 3.7 Flash Image-to-Text so với Grok 4.6 Image-to-Text
Grok 4.6 là một tùy chọn xAI cho khả năng suy luận kỹ thuật dựa trên hình ảnh. Gemini 3.7 Flash cung cấp phương thức mô hình Google cực kỳ tiết kiệm chi phí cho câu hỏi hình ảnh, ảnh chụp màn hình và các tính năng sản phẩm ưu tiên văn bản. -
Gemini 3.7 Flash Image-to-Text so với GPT 5.6 Terra Image-to-Text
Các mô hình hình ảnh GPT 5.6 Terra hỗ trợ nhiều ứng dụng đa phương thức. Gemini 3.7 Flash là một lựa chọn thay thế hấp dẫn khi các nhóm muốn có mô hình Flash hiệu quả cho việc phân tích hình ảnh tập trung và văn bản được tạo. -
Gemini 3.7 Flash Image-to-Text so với Claude Vision
Các mô hình hình ảnh Claude có thể là lựa chọn mạnh mẽ cho các tác vụ giải thích và xử lý tài liệu. Gemini 3.7 Flash cung cấp API hiểu hình ảnh phản hồi nhanh cho các nhóm đang đánh giá quy trình đa phương thức tiết kiệm chi phí. -
Gemini 3.7 Flash Image-to-Text so với Gemini 3.7 Flash Text-to-Text
Text-to-Text được tối ưu hóa cho câu lệnh không có hình ảnh đầu vào. Image-to-Text là phương thức phù hợp hơn khi câu trả lời phải dựa trên cả hình ảnh được cung cấp và hướng dẫn bằng văn bản.