Essayez gratuitement l'API Grok 4 pour le raisonnement multimodal, les questions-réponses visuelles, l'OCR et la compréhension d'images. Accès xAI stable pour les applications d'IA en production.
Modèles Grok 4 associés
Exemples d'API
Exemple d'envoi
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Exemple d'envoi
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Exemple d'envoi
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
Tarifs de Grok 4 Image to Text
| Paramètres | Prix | Prix d’origine | Remise |
|---|
README
API Grok 4 Image-to-Text rapide et abordable (modèle de compréhension visuelle de xAI)
L'API Grok 4 Image-to-Text sur Flaq AI donne accès au modèle xAI pour la compréhension visuelle, l'analyse d'images et les workflows de raisonnement multimodal. Cette intégration Grok API aide les développeurs à transformer des images importées en descriptions, détails extraits, réponses et synthèses structurées via une route gérée stable. Elle est conçue pour les équipes qui veulent une capacité image-to-text propulsée par xAI sans construire d'infrastructure propre au fournisseur.
Fonctionnalités clés de l'API Grok 4 Image-to-Text
- Compréhension visuelle : Analysez les images importées, captures d'écran, objets, mises en page et détails visuels grâce au raisonnement multimodal du modèle.
- Réponses ancrées dans l'image : Posez des questions ciblées en langage naturel sur une image et recevez des réponses textuelles ciblées.
- Workflows d'extraction pratiques : Convertissez le contenu visuel en descriptions, synthèses, libellés et détails structurés pour les applications.
- Sortie tenant compte de la conversation : Prenez en charge les questions de suivi et la revue visuelle itérative avec un contexte flexible.
- Contrôles adaptés aux développeurs : Orientez la longueur de réponse, le niveau de détail et la direction de la tâche grâce à une configuration pratique sur Flaq AI.
- Intégration xAI gérée : Ajoutez la capacité Grok image-to-text via une route API stable avec un comportement d'entrée et de sortie clair.
Comment utiliser l'API Grok 4 Image-to-Text pour l'analyse visuelle sur Flaq AI
- Entrée : Contenu d'image importé plus instructions en langage naturel décrivant la tâche d'analyse, d'extraction ou de raisonnement.
- Sortie : Descriptions textuelles, détails extraits, raisonnement visuel ou synthèses structurées à partir des images importées.
- Configuration de route : Conçue pour des workflows ciblés de compréhension d'images avec prise en charge d'entrée image propre à la route.
- Configuration : Prend en charge des contrôles de sortie pratiques pour la longueur de réponse, le niveau de détail et la direction de la tâche.
- Capacités : Compréhension d'images, extraction de type OCR, QA visuelle, revue de captures d'écran, inspection de produits et raisonnement multimodal via l'intégration xAI Grok API.
Meilleurs cas d'utilisation pour l'intégration de l'API Grok 4 Image-to-Text
- Analyse de captures d'écran et d'interfaces : Extrayez les détails d'UI, résumez les écrans et documentez les flux produit à partir d'images.
- Revue de produits et catalogues : Générez des descriptions de produits, identifiez des attributs et comparez les différences visuelles.
- QA d'actifs créatifs : Examinez publicités, visuels sociaux, maquettes et exports de design pour les détails de contenu et la cohérence.
- Compréhension d'images documentaires : Analysez formulaires, reçus, diagrammes et supports de référence basés sur image.
- Workflows d'accessibilité : Produisez des descriptions d'images et des synthèses visuelles qui rendent les médias plus faciles à comprendre et à réutiliser.
Remarque Veuillez vous assurer que les prompts, les images importées et les workflows applicatifs respectent les consignes de sécurité et d'utilisation de xAI. En cas d'erreur, vérifiez l'entrée pour détecter du contenu restreint, simplifiez la demande, puis réessayez.
Grok 4 Image-to-Text face aux concurrents : analyse comparative
-
Grok 4 Image-to-Text vs GPT Image-to-Text
Les routes GPT image-to-text offrent un comportement multimodal natif OpenAI. Grok 4 Image-to-Text fournit une route xAI pour la compréhension visuelle et les workflows API gérés. -
Grok 4 Image-to-Text vs Gemini Image-to-Text
Gemini image-to-text est solide pour les utilisateurs de modèles Google et l'analyse visuelle rapide. Grok 4 Image-to-Text donne aux équipes une alternative xAI pour les fonctions produit multimodales. -
Grok 4 Image-to-Text vs Claude File Analysis
Claude file analysis est solide pour le raisonnement attentif sur documents et pièces jointes. Grok 4 Image-to-Text se concentre sur les réponses ancrées dans l'image et les workflows d'extraction visuelle. -
Grok 4 Image-to-Text vs Qwen Vision Workflows
Les workflows de vision Qwen offrent des alternatives de modèles Alibaba. Grok 4 Image-to-Text est utile aux équipes qui veulent une compréhension visuelle propulsée par xAI dans leur combinaison de modèles. -
Grok 4 Image-to-Text vs modèles Llama Vision
Les modèles Llama vision fournissent une flexibilité de déploiement de modèles ouverts. Grok 4 Image-to-Text supprime le travail d'hébergement et donne aux développeurs une route gérée stable.