Hướng dẫn Claude Code
Thiết lập model Claude của Flaq AI và khám phá kỹ năng Claude Code
Dùng thử Gemini 3.6 Flash API để chuyển ảnh thành văn bản, hỏi đáp hình ảnh, OCR, phân tích và phản hồi đa phương thức theo luồng qua Google API ổn định của Flaq AI.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.6-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.6-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.6-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Tham số | Giá | Giá gốc | Giảm giá |
|---|
API Gemini 3.6 Flash Image-to-Text cung cấp cho các ứng dụng Flaq AI một tuyến tập trung để chuyển đầu vào trực quan thành văn bản hữu ích. Được xây dựng trên mô hình đa phương thức Gemini 3.6 Flash của Google, tuyến này kết hợp hình ảnh với chỉ dẫn để các nhóm có thể đặt câu hỏi, trích xuất quan sát, giải thích ảnh chụp màn hình và chuẩn bị nội dung trực quan cho các quy trình ở bước sau. Tích hợp được giữ có chủ đích trong phạm vi hẹp: một yêu cầu trực quan tập trung tạo ra văn bản thay vì nội dung đa phương tiện được tạo.
Hiểu Hình ảnh Đa phương thức: Kết hợp hình ảnh và chỉ dẫn bằng ngôn ngữ tự nhiên để tạo nội dung mô tả, câu trả lời và phân tích có cơ sở từ hình ảnh.
Hỏi đáp Hình ảnh Hiệu quả: Sử dụng dòng mô hình Flash cho các tác vụ trực quan phản hồi nhanh như giải thích ảnh chụp màn hình, trích xuất chi tiết sản phẩm và so sánh hình ảnh.
Quy trình Hình ảnh Tập trung: Giữ mỗi yêu cầu tập trung vào một đầu vào hình ảnh cụ thể, giúp tuyến này dễ dàng sử dụng trong các tính năng sản phẩm và hàng đợi đánh giá.
Gửi Hình ảnh Theo Hướng dẫn: Gửi hình ảnh thông qua mẫu yêu cầu Flaq AI đã cấu hình phù hợp với quy trình tải lên và lưu trữ của ứng dụng.
Ngữ cảnh Dựa trên Tin nhắn: Thêm hướng dẫn hệ thống, ý định người dùng và ngữ cảnh hội thoại quanh các câu hỏi trực quan khi tác vụ cần ràng buộc rõ ràng hơn.
Tích hợp Ưu tiên Văn bản: Nhận văn bản phù hợp để hiển thị, đánh giá, định tuyến và tự động hóa mà không xem endpoint như một dịch vụ tạo hình ảnh.
Đầu vào: Một hình ảnh được hỗ trợ đi kèm câu lệnh chỉ rõ tác vụ đặt câu hỏi, mô tả, trích xuất hoặc so sánh cần thực hiện.
Đầu ra: Phản hồi văn bản dựa trên hình ảnh được cung cấp và ngữ cảnh yêu cầu.
Cách Gửi Hình ảnh: Cung cấp hình ảnh theo định dạng yêu cầu Flaq AI đã cấu hình.
Khả năng: Hỏi đáp trực quan, giải thích ảnh chụp màn hình, tóm tắt hình ảnh, trích xuất chi tiết và soạn thảo nội dung dựa trên hình ảnh.
Đánh giá UI và Sản phẩm: Chuyển ảnh chụp màn hình thành mô tả giao diện, bản nháp báo cáo lỗi, ghi chú QA trực quan hoặc phản hồi thiết kế có thể triển khai.
Làm giàu Danh mục: Trích xuất thuộc tính nhìn thấy và soạn mô tả sản phẩm cho các quy trình thương mại và tồn kho có con người xem xét.
Phân loại Hỗ trợ Khách hàng: Diễn giải ảnh chụp màn hình và hình ảnh do người dùng gửi để đề xuất câu hỏi, phản hồi và quyết định định tuyến cho nhóm hỗ trợ.
Hỗ trợ Khả năng Tiếp cận: Tạo bản nháp mô tả hình ảnh và tóm tắt trực quan để biên tập viên có thể xem xét và tinh chỉnh trước khi xuất bản.
Giải thích Tài liệu và Sơ đồ: Giúp người dùng hiểu biểu đồ, sơ đồ, slide và tài liệu tham chiếu trực quan thông qua văn bản rõ ràng được tạo ra.
Lưu ý Tuyến này được cấu hình cho đầu vào hình ảnh tập trung và đầu ra văn bản. Hãy xem xét đầu ra bắt nguồn từ hình ảnh trước khi dùng cho các quyết định quan trọng về an toàn, pháp lý, y tế, tài chính hoặc tuân thủ.
Gemini 3.6 Flash Image-to-Text so với Gemini 3.5 Flash Image-to-Text
Gemini 3.5 Flash cung cấp một lựa chọn quen thuộc cho
các tác vụ image-to-text. Gemini 3.6 Flash là thế hệ mô hình mới hơn dành cho các nhóm muốn có API đa phương thức hiệu quả
với khả năng suy luận và hỗ trợ lập kế hoạch liên quan đến lập trình mạnh hơn.
Gemini 3.6 Flash Image-to-Text so với Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash là mô hình Flash gần đây hơn
cho các quy trình tác nhân và đa phương thức phức tạp. Gemini 3.6 Flash cung cấp một tuyến hiểu hình ảnh cân bằng khi
quy trình image-to-text tập trung là ưu tiên.
Gemini 3.6 Flash Image-to-Text so với Grok 4.6 Image-to-Text
Grok 4.6 là lựa chọn thay thế hữu ích của xAI cho suy luận kỹ thuật
dựa trên hình ảnh. Gemini 3.6 Flash cung cấp dòng mô hình đa phương thức của Google với tích hợp Flaq AI tập trung cho
câu hỏi trực quan và hoạt động nội dung.
Gemini 3.6 Flash Image-to-Text so với GPT 5.6 Terra Image-to-Text
Các mô hình hình ảnh GPT 5.6 Terra hỗ trợ nhiều kịch bản ứng dụng đa phương thức
đa dạng. Gemini 3.6 Flash là lựa chọn đáng cân nhắc khi các nhóm cần một tuyến hiệu quả dựa trên Gemini cho
ảnh chụp màn hình, sản phẩm và đầu ra văn bản dựa trên hình ảnh.
Gemini 3.6 Flash Image-to-Text so với Claude Vision
Các mô hình thị giác Claude có thể rất phù hợp với các tác vụ tài liệu và
giải thích. Gemini 3.6 Flash cung cấp một tùy chọn API sẵn sàng cho production khác để phân tích hình ảnh với ranh giới
image-to-text rõ ràng.
Thiết lập model Claude của Flaq AI và khám phá kỹ năng Claude Code

Thiết lập model GPT của Flaq AI và khám phá kỹ năng Codex
Dùng mô hình LLM của Flaq AI trong Hermes Agent
Sử dụng GLM 5.2, Kimi K3 và DeepSeek v4 trong ZCode
Chạy DeepSeek Harness với các mô hình DeepSeek của Flaq AI
Kết nối các tác nhân AI với công cụ tạo hình ảnh và video của Flaq
Sử dụng GPT 6 Astra và Claude Fable 5.1 trong WorkBuddy