Claude Code-Guide
Flaq AI Claude-Modelle einrichten und Claude-Code-Skills entdecken
Testen Sie die Grok 4.6 API von xAI für Image-to-Text, visuelle Q&A, OCR, Analysen und multimodale Streaming-Antworten über die stabile einheitliche API von Flaq AI.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'grok-4.6-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'grok-4.6-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parameter | Preis | Ursprünglicher Preis | Rabatt |
|---|
Die Grok 4.6 Image-to-Text API kombiniert das auf Schlussfolgern ausgerichtete Textmodell von xAI mit Bildverständnis auf Flaq AI. Damit können Anwendungen eine gezielte visuelle Eingabe zusammen mit einer Anweisung senden und anschließend Text empfangen, der Bildinhalte erklärt, extrahiert, vergleicht oder analysiert. Diese Integration der Grok Vision API ist für Workflows konzipiert, in denen visuelle Anhaltspunkte in eine umsetzbare Antwort, technische Beobachtung oder einen strukturierten nächsten Schritt überführt werden müssen.
Bildgestützte Analyse: Stellen Sie Fragen zu einem bereitgestellten Bild und erhalten Sie Textantworten, die sich auf sichtbare Details, Layout, Objekte und Kontext beziehen.
Visuelles Schlussfolgern in Textform: Kombinieren Sie ein Bild mit natürlichsprachlichen Anweisungen für Erklärungen, Vergleiche, Fehlerbehebung und analytische Workflows.
Fokussierte Bildeingabe: Stellen Sie die konfigurierte Bildeingabe der Route zusammen mit einer klaren Aufgabenanweisung bereit, damit Bildfrage-Workflows unkompliziert integrierbar bleiben.
Unterstützung bei technischen Prüfungen: Nutzen Sie visuellen Kontext für die Prüfung von Benutzeroberflächen, die Interpretation von Screenshots, die Erklärung von Diagrammen, die Einordnung von Produktfeedback und ähnliche Aufgaben mit Textausgabe.
Kontrollierte Konversationsanfragen: Verbinden Sie Bildfragen mit strukturiertem Nachrichtenkontext, damit Anwendungen Aufgabenrahmen, vorherige Anforderungen und Folge-Prompts bereitstellen können.
Textorientierte Ergebnisse: Erhalten Sie generierten Text, der für Prüfung, Anzeige, Weiterleitung oder Nutzung durch einen nachgelagerten Workflow bereitsteht, statt die Route als Endpunkt zur Bilderzeugung zu behandeln.
Eingabe: Ein unterstütztes Bild zusammen mit einer natürlichsprachlichen Anfrage, die die Frage, das Extraktionsziel oder die Analyseaufgabe beschreibt.
Ausgabe: Textantworten, die den bereitgestellten visuellen Inhalt beschreiben, erklären, vergleichen oder analysieren.
Bildübermittlung: Verwenden Sie das konfigurierte Flaq-AI-Anfrageformat für die Bildeingabe in Ihrem Anwendungsworkflow.
Funktionen: Screenshot-Analyse, visuelle Fragebeantwortung, bildgestützte Erklärung, Inhaltsprüfung und Detailextraktion.
Screenshot- und UI-Prüfung: Erklären Sie Benutzeroberflächen, identifizieren Sie sichtbare Zustände, fassen Sie Feedback zusammen oder verwandeln Sie einen Screenshot in eine entwicklungsfertige Problembeschreibung.
Produkt- und Katalogunterstützung: Extrahieren Sie sichtbare Produktdetails, erstellen Sie Entwürfe für Attribute und unterstützen Sie die menschliche Prüfung visueller Einreichungen.
Erstbewertung im technischen Support: Helfen Sie Teams, Fehler-Screenshots, Gerätefotos oder Einrichtungsbilder zu interpretieren, bevor ein Fall an einen Mitarbeiter weitergeleitet wird.
Erklärung von Dokumenten und Diagrammen: Wandeln Sie Diagramme, Schaubilder, Folien und visuelle Referenzen in klare textliche Beobachtungen und Folgefragen um.
Inhaltsprozesse: Unterstützen Sie Moderationswarteschlangen, Entwürfe zur Barrierefreiheit und Workflows für Bildbeschreibungen, bei denen Menschen die abschließende Prüfung übernehmen.
Hinweis Ergebnisse des Bildverständnisses sollten vor der Verwendung bei weitreichenden, sicherheitskritischen, rechtlichen, medizinischen oder finanziellen Entscheidungen geprüft werden. Verlassen Sie sich nicht auf generierten Text als Ersatz für eine fachkundige Prüfung.
Grok 4.6 Image-to-Text vs. Grok 4.5 Image-to-Text
Grok 4.5 bietet eine etablierte Option für visuelle
Fragebeantwortungs-Workflows. Grok 4.6 ist die neuere Modellgeneration für Teams, die stärkeres Schlussfolgern bei
bildgestützten Anfragen bewerten möchten.
Grok 4.6 Image-to-Text vs. Gemini 3.7 Flash Image-to-Text
Gemini 3.7 Flash bietet eine effiziente multimodale Modellfamilie.
Grok 4.6 Image-to-Text stellt eine fokussierte Flaq-Route für Teams bereit, die das visuelle Schlussfolgern von xAI in einem
Workflow mit visueller Eingabe und Textausgabe testen möchten.
Grok 4.6 Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Die visuellen Modelle von GPT 5.6 Terra werden häufig für allgemeine multimodale Aufgaben eingesetzt.
Grok 4.6 ist eine nützliche Alternative, wenn der Workflow neben visueller Analyse Wert auf die auf Schlussfolgern und Programmieren
ausgerichtete Modellfamilie von xAI legt.
Grok 4.6 Image-to-Text vs. Claude Vision
Claude-Vision-Modelle eignen sich oft gut für Erklärungen und
dokumentorientierte Aufgaben. Grok 4.6 Image-to-Text bietet Entwicklern eine weitere API-Option für bildgestützte Fragen,
Prüfungen und operative Workflows.
Grok 4.6 Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash verbindet breite multimodale Funktionen
mit effizientem Betrieb. Grok 4.6 ist ein starker Kandidat für Bewertungen, wenn visuelle Anfragen zugleich detailliertes
technisches Schlussfolgern in Textform erfordern.
Flaq AI Claude-Modelle einrichten und Claude-Code-Skills entdecken

Flaq AI GPT-Modelle einrichten und Codex-Skills entdecken
Flaq AI LLM-Modelle in Hermes Agent verwenden
Verwenden Sie GLM 5.2, Kimi K3 und DeepSeek v4 in ZCode
DeepSeek Harness mit DeepSeek-Modellen von Flaq AI ausführen
Verbinden Sie KI-Agenten mit den Bild- und Videogenerierungstools von Flaq
GPT 6 Astra und Claude Fable 5.1 in WorkBuddy nutzen