Dùng thử Grok 4.6 API của xAI cho chuyển hình ảnh thành văn bản, hỏi đáp hình ảnh, OCR, phân tích và phản hồi đa phương thức theo luồng qua API thống nhất, ổn định của Flaq AI.
Mô hình Grok 4.6 liên quan
Ví dụ API
Ví dụ gửi yêu cầu
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Ví dụ gửi yêu cầu
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Ví dụ gửi yêu cầu
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Giá Grok 4.6 Image to Text
| Tham số | Giá | Giá gốc | Giảm giá |
|---|
README
Grok 4.6 Image-to-Text API (Lập luận và phân tích hình ảnh)
Grok 4.6 Image-to-Text API kết hợp mô hình văn bản định hướng lập luận của xAI với khả năng hiểu hình ảnh trên Flaq AI. API này cho phép ứng dụng gửi một đầu vào hình ảnh cụ thể cùng với chỉ dẫn, sau đó nhận văn bản giải thích, trích xuất, so sánh hoặc phân tích nội dung trong hình ảnh. Tích hợp Grok Vision API này được thiết kế cho các quy trình cần chuyển bằng chứng trực quan thành câu trả lời có thể thực hiện, nhận xét kỹ thuật hoặc bước tiếp theo có cấu trúc.
Các tính năng chính của Grok 4.6 Image-to-Text API
-
Phân tích dựa trên hình ảnh: Đặt câu hỏi về hình ảnh được cung cấp và nhận phản hồi văn bản gắn với các chi tiết hiển thị, bố cục, đối tượng và ngữ cảnh.
-
Lập luận từ hình ảnh thành văn bản: Kết hợp hình ảnh với chỉ dẫn bằng ngôn ngữ tự nhiên để giải thích, so sánh, khắc phục sự cố và thực hiện quy trình phân tích.
-
Đầu vào hình ảnh tập trung: Cung cấp đầu vào hình ảnh được cấu hình của tuyến cùng với chỉ dẫn tác vụ rõ ràng, giúp quy trình đặt câu hỏi về hình ảnh dễ dàng tích hợp.
-
Hỗ trợ kiểm tra kỹ thuật: Sử dụng ngữ cảnh trực quan để đánh giá giao diện, diễn giải ảnh chụp màn hình, giải thích sơ đồ, phân loại phản hồi sản phẩm và thực hiện các tác vụ đầu ra văn bản tương tự.
-
Yêu cầu hội thoại có kiểm soát: Kết hợp câu hỏi về hình ảnh với ngữ cảnh tin nhắn có cấu trúc để ứng dụng có thể cung cấp khung tác vụ, yêu cầu trước đó và câu lệnh tiếp nối.
-
Kết quả ưu tiên văn bản: Nhận văn bản được tạo sẵn sàng để đánh giá, hiển thị, định tuyến hoặc sử dụng trong quy trình tiếp theo thay vì xem tuyến này như một điểm cuối tạo hình ảnh.
Cách sử dụng Grok 4.6 Image-to-Text API trên Flaq AI
-
Đầu vào: Một hình ảnh được hỗ trợ cùng với yêu cầu bằng ngôn ngữ tự nhiên mô tả câu hỏi, mục tiêu trích xuất hoặc tác vụ phân tích.
-
Đầu ra: Phản hồi văn bản mô tả, giải thích, so sánh hoặc phân tích nội dung trực quan được cung cấp.
-
Gửi hình ảnh: Sử dụng định dạng yêu cầu Flaq AI đã được cấu hình cho đầu vào hình ảnh trong quy trình ứng dụng của bạn.
-
Khả năng: Phân tích ảnh chụp màn hình, trả lời câu hỏi trực quan, giải thích dựa trên hình ảnh, đánh giá nội dung và trích xuất chi tiết.
Các trường hợp sử dụng phù hợp nhất khi tích hợp Grok 4.6 Image-to-Text API
-
Đánh giá ảnh chụp màn hình và giao diện người dùng: Giải thích giao diện, xác định trạng thái hiển thị, tóm tắt phản hồi hoặc chuyển ảnh chụp màn hình thành mô tả sự cố sẵn sàng cho nhà phát triển.
-
Hỗ trợ sản phẩm và danh mục: Trích xuất chi tiết sản phẩm có thể quan sát, tạo bản nháp thuộc tính và hỗ trợ con người đánh giá nội dung hình ảnh được gửi lên.
-
Phân loại hỗ trợ kỹ thuật: Giúp các nhóm diễn giải ảnh chụp màn hình lỗi, ảnh thiết bị hoặc ảnh thiết lập trước khi chuyển trường hợp đó đến nhân viên vận hành.
-
Giải thích tài liệu và sơ đồ: Chuyển biểu đồ, sơ đồ, trang trình bày và tài liệu tham khảo trực quan thành các nhận xét rõ ràng bằng văn bản và câu hỏi tiếp nối.
-
Vận hành nội dung: Hỗ trợ hàng đợi kiểm duyệt, soạn thảo nội dung trợ năng và quy trình mô tả hình ảnh, trong đó con người vẫn thực hiện bước đánh giá cuối cùng.
Lưu ý Cần đánh giá kết quả hiểu hình ảnh trước khi sử dụng cho các quyết định có tác động lớn, có ý nghĩa then chốt đối với an toàn, pháp lý, y tế hoặc tài chính. Không dựa vào văn bản được tạo để thay thế hoạt động kiểm tra của chuyên gia.
Grok 4.6 Image-to-Text API so với đối thủ: Phân tích so sánh
-
Grok 4.6 Image-to-Text so với Grok 4.5 Image-to-Text
Grok 4.5 cung cấp một lựa chọn đã được sử dụng ổn định cho các quy trình hỏi đáp trực quan. Grok 4.6 thuộc thế hệ mô hình mới hơn dành cho các nhóm đánh giá khả năng lập luận mạnh mẽ hơn đối với yêu cầu dựa trên hình ảnh. -
Grok 4.6 Image-to-Text so với Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash cung cấp một dòng mô hình đa phương thức hiệu quả. Grok 4.6 Image-to-Text cung cấp tuyến Flaq chuyên biệt cho các nhóm muốn kiểm thử khả năng lập luận trực quan của xAI trong quy trình đầu vào hình ảnh, đầu ra văn bản. -
Grok 4.6 Image-to-Text so với GPT 5.6 Terra Image-to-Text
Các mô hình hình ảnh GPT 5.6 Terra thường được sử dụng cho tác vụ đa phương thức nói chung. Grok 4.6 là một phương án thay thế hữu ích khi quy trình coi trọng dòng mô hình chú trọng lập luận và lập trình của xAI bên cạnh khả năng phân tích hình ảnh. -
Grok 4.6 Image-to-Text so với Claude Vision
Các mô hình hình ảnh Claude có thể phù hợp với tác vụ giải thích và tác vụ định hướng tài liệu. Grok 4.6 Image-to-Text mang đến cho nhà phát triển thêm một lựa chọn API cho câu hỏi dựa trên hình ảnh, hoạt động đánh giá và quy trình vận hành. -
Grok 4.6 Image-to-Text so với Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash cân bằng giữa khả năng đa phương thức rộng và vận hành hiệu quả. Grok 4.6 là một ứng viên đáng giá để đánh giá khi yêu cầu trực quan cũng cần đến khả năng lập luận kỹ thuật chi tiết dưới dạng văn bản.