Попробуйте Grok 4.6 API от xAI для преобразования изображений в текст, визуальных вопросов и ответов, OCR, анализа и мультимодального стриминга через единый API Flaq AI.
Связанные модели Grok 4.6
Примеры API
Пример отправки
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Пример отправки
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Пример отправки
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Цены на Grok 4.6 Image to Text
| Параметры | Цена | Исходная цена | Скидка |
|---|
README
API Grok 4.6 Image-to-Text (визуальные рассуждения и анализ)
API Grok 4.6 Image-to-Text сочетает ориентированную на рассуждения текстовую модель xAI с пониманием изображений во Flaq AI. Он позволяет приложениям отправлять целевой визуальный материал вместе с инструкцией, а затем получать текст, который объясняет, извлекает, сравнивает или анализирует содержимое изображения. Эта интеграция API компьютерного зрения Grok создана для процессов, где визуальные данные необходимо преобразовать в практический ответ, техническое наблюдение или структурированный следующий шаг.
Ключевые возможности API Grok 4.6 Image-to-Text
-
Анализ с опорой на изображение: Задавайте вопросы о предоставленном изображении и получайте текстовые ответы, связанные с видимыми деталями, компоновкой, объектами и контекстом.
-
Рассуждения от визуальных данных к тексту: Сочетайте изображение с инструкциями на естественном языке для объяснения, сравнения, устранения неполадок и аналитических рабочих процессов.
-
Целенаправленный ввод изображений: Передавайте настроенный для маршрута графический материал с чёткой инструкцией по задаче, сохраняя простоту интеграции процессов вопросов по изображениям.
-
Помощь в технической проверке: Используйте визуальный контекст для проверки интерфейсов, интерпретации снимков экрана, объяснения диаграмм, первичного разбора отзывов о продукте и аналогичных задач с текстовым выводом.
-
Управляемые диалоговые запросы: Сочетайте вопросы по изображениям со структурированным контекстом сообщений, чтобы приложения могли задавать рамки задачи, передавать предшествующие требования и последующие промпты.
-
Результаты прежде всего в виде текста: Получайте готовый к проверке, отображению, маршрутизации или использованию последующим процессом текст, не рассматривая этот маршрут как конечную точку генерации изображений.
Как использовать API Grok 4.6 Image-to-Text во Flaq AI
-
Ввод: Поддерживаемое изображение вместе с запросом на естественном языке, описывающим вопрос, цель извлечения или задачу анализа.
-
Вывод: Текстовые ответы, которые описывают, объясняют, сравнивают или анализируют предоставленный визуальный контент.
-
Передача изображения: Используйте настроенный формат запроса Flaq AI для ввода изображения в рабочем процессе приложения.
-
Возможности: Анализ снимков экрана, визуальные ответы на вопросы, объяснение с опорой на изображение, проверка контента и извлечение деталей.
Лучшие сценарии интеграции API Grok 4.6 Image-to-Text
-
Проверка снимков экрана и интерфейсов: Объясняйте интерфейсы, определяйте видимые состояния, обобщайте отзывы или преобразуйте снимок экрана в готовое для разработчика описание проблемы.
-
Помощь с товарами и каталогами: Извлекайте наблюдаемые сведения о товарах, создавайте черновики атрибутов и поддерживайте выполняемую человеком проверку визуальных материалов.
-
Первичный анализ обращений в техническую поддержку: Помогайте командам интерпретировать снимки экрана с ошибками, фотографии устройств или изображения процесса настройки до передачи обращения оператору.
-
Объяснение документов и диаграмм: Преобразуйте графики, диаграммы, слайды и визуальные справочные материалы в чёткие текстовые наблюдения и последующие вопросы.
-
Операции с контентом: Поддерживайте очереди модерации, подготовку материалов о доступности и процессы описания изображений, в которых окончательная проверка остаётся за человеком.
Примечание Результаты понимания изображений следует проверять перед использованием для важных, критичных для безопасности, юридических, медицинских или финансовых решений. Не полагайтесь на созданный текст как на замену экспертной проверки.
API Grok 4.6 Image-to-Text и конкуренты: сравнительный анализ
-
Grok 4.6 Image-to-Text и Grok 4.5 Image-to-Text
Grok 4.5 предлагает проверенный вариант для визуальных рабочих процессов ответов на вопросы. Grok 4.6 — более новое поколение модели для команд, оценивающих более сильные рассуждения при запросах с опорой на изображения. -
Grok 4.6 Image-to-Text и Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash предлагает эффективное мультимодальное семейство моделей. Grok 4.6 Image-to-Text предоставляет целевой маршрут Flaq для команд, которые хотят проверить визуальные рассуждения xAI в процессе с визуальным вводом и текстовым выводом. -
Grok 4.6 Image-to-Text и GPT 5.6 Terra Image-to-Text
Визуальные модели GPT 5.6 Terra широко используются для универсальных мультимодальных задач. Grok 4.6 — полезная альтернатива, когда в дополнение к визуальному анализу в рабочем процессе ценится ориентированное на рассуждения и программирование семейство моделей xAI. -
Grok 4.6 Image-to-Text и Claude Vision
Модели Claude Vision хорошо подходят для пояснений и задач, связанных с документами. Grok 4.6 Image-to-Text предоставляет разработчикам ещё один вариант API для вопросов с опорой на изображения, проверок и операционных процессов. -
Grok 4.6 Image-to-Text и Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash сочетает широкие мультимодальные возможности с эффективной работой. Grok 4.6 — сильный кандидат для оценки, когда визуальные запросы также требуют подробных технических рассуждений в текстовой форме.