Claude Code-Guide
Flaq AI Claude-Modelle einrichten und Claude-Code-Skills entdecken
Testen Sie die Gemini 3.7 Flash API für Image-to-Text, visuelle Q&A, OCR, Analysen und multimodale Streaming-Antworten über den stabilen Google-API-Zugriff von Flaq AI.
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'gemini-3.7-flash-image-to-text',
messages: [
{
role: 'user',
content: [
{ type: 'text', text: 'Describe the image and extract any visible text.' },
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 2048
})
});
if (!response.ok) {
const errorBody = await response.json().catch(() => null);
throw new Error(errorBody?.error?.message ?? errorBody?.message ?? `HTTP ${response.status}`);
}
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split(/\r?\n\r?\n/);
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split(/\r?\n/).filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'gemini-3.7-flash-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{'type': 'text', 'text': 'Describe the image and extract any visible text.'},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg'
}
},
],
}
],
'stream': True,
'max_tokens': 2048,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash-image-to-text",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe the image and extract any visible text." },
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 2048
}'
| Parameter | Preis | Ursprünglicher Preis | Rabatt |
|---|
Die Gemini 3.7 Flash Image-to-Text API verbindet Flaq-AI-Anwendungen mit Googles neuestem Flash-Modell für schnelles, leistungsfähiges visuelles Verständnis. Senden Sie eine fokussierte Bildeingabe mit einer klaren Anweisung, um Text zu erzeugen, der visuelle Inhalte beschreibt, erklärt, extrahiert oder analysiert. Dieser Zugang verbindet die multimodalen und Reasoning-Stärken von Gemini 3.7 Flash mit einer bewusst fokussierten Eingabegrenze von Flaq AI und eignet sich damit bestens für reaktionsschnelle Produktfunktionen und Prüf-Workflows.
Fortschrittliches visuelles Reasoning: Wandeln Sie bildbezogene Fragen in klare Textantworten um, die den bereitgestellten visuellen Kontext und die Aufgabenanweisung berücksichtigen.
Kostengünstiger multimodaler Workflow: Nutzen Sie eine sehr günstige Flash-Konfiguration für visuelle Analysefunktionen, die leistungsfähige Textausgaben im großen Maßstab benötigen.
Fokussierte Bildanfrage: Richten Sie jede Interaktion auf eine visuelle Eingabe und ein bestimmtes Ziel aus, wodurch Anwendungen klarere und besser prüfbare Ausgaben erzeugen können.
Dokumentierte Bildübertragung: Senden Sie die Bildeingabe über das konfigurierte API-Anfragemuster von Flaq AI.
Unterstützung für Nachrichtenkontext: Kombinieren Sie die visuelle Anfrage mit strukturierten System-, Benutzer- und Assistentennachrichten, wenn die Aufgabe Anweisungen, Kriterien oder Folgekontext erfordert.
Reaktionsschnelle API-Integration: Wählen Sie Streaming oder die Bereitstellung vollständiger Antworten passend zu interaktiven Assistenten, asynchronen Prüfaufträgen und internen Werkzeugen.
Eingabe: Ein unterstütztes Bild mit einem Prompt in natürlicher Sprache, der die gewünschte Beschreibung, Frage, Extraktion oder Analyse definiert.
Ausgabe: Textantworten für benutzerorientierte Erlebnisse, menschliche Prüfung, Content-Workflows und nachgelagerte Automatisierung.
Bildübertragung: Nutzen Sie das konfigurierte Flaq-AI-Anfrageformat für die Bildeingabe.
Funktionen: Bildbezogene Fragenbeantwortung, Screenshot-Interpretation, Extraktion visueller Details, Bildzusammenfassung und Content-Erstellung.
Visuelle Produkterlebnisse: Ergänzen Sie Bildfragen, Unterstützung bei der visuellen Suche und kontextbezogene Erklärungen für benutzerorientierte Anwendungen.
Design- und QA-Prüfung: Erzeugen Sie erste Notizen aus UI-Screenshots, Produktbildern, Diagrammen und visuellem Feedback zur menschlichen Prüfung.
Support-Workflows: Helfen Sie Mitarbeitern, Kundenbilder und Screenshots zu interpretieren, nützliche Details zu erkennen und Antwort- oder Eskalationsentwürfe vorzubereiten.
Commerce- und Katalogprozesse: Extrahieren Sie sichtbare Merkmale, entwerfen Sie Beschreibungen und unterstützen Sie die redaktionelle Prüfung von Produktbildern.
Barrierefreiheits- und Content-Workflows: Erstellen Sie prüfbare Beschreibungsentwürfe und visuelle Zusammenfassungen, damit Redaktionsteams barrierefreie Inhalte vorbereiten können.
Hinweis Der aktuelle Flaq-AI-Zugang ist für fokussierte Bildeingaben und Textausgaben konzipiert. Verwenden Sie generierte Analysen nicht als alleinige Grundlage für folgenreiche Entscheidungen; sorgen Sie für angemessene menschliche Prüfung und Quellenverifizierung.
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.6 Flash Image-to-Text
Gemini 3.6 Flash bietet einen ausgewogenen multimodalen
Zugang für Bildfragen und -operationen. Gemini 3.7 Flash ist das neuere Flash-Modell, wenn die visuelle Aufgabe
auch von fortschrittlicherem mehrstufigem Reasoning profitiert.
Gemini 3.7 Flash Image-to-Text vs. Grok 4.6 Image-to-Text
Grok 4.6 ist eine xAI-Option für bildbezogenes technisches
Reasoning. Gemini 3.7 Flash bietet einen äußerst kostengünstigen Zugang zu einem Google-Modell für visuelle Fragen, Screenshots und
textorientierte Produktfunktionen.
Gemini 3.7 Flash Image-to-Text vs. GPT 5.6 Terra Image-to-Text
Die visuellen Modelle von GPT 5.6 Terra unterstützen vielfältige multimodale Anwendungen.
Gemini 3.7 Flash ist eine überzeugende Alternative, wenn Teams ein effizientes Flash-Modell für fokussierte Bildanalyse und
generierten Text wünschen.
Gemini 3.7 Flash Image-to-Text vs. Claude Vision
Claude-Vision-Modelle können eine starke Wahl für erklärende und
dokumentorientierte Aufgaben sein. Gemini 3.7 Flash bietet eine reaktionsschnelle API für visuelles Verständnis für Teams, die
kostengünstige multimodale Workflows evaluieren.
Gemini 3.7 Flash Image-to-Text vs. Gemini 3.7 Flash Text-to-Text
Text-to-Text ist für Prompts ohne
visuelle Eingabe optimiert. Image-to-Text ist der bessere Zugang, wenn die Antwort sowohl auf einem bereitgestellten Bild als auch auf
schriftlichen Anweisungen basieren muss.
Flaq AI Claude-Modelle einrichten und Claude-Code-Skills entdecken

Flaq AI GPT-Modelle einrichten und Codex-Skills entdecken
Flaq AI LLM-Modelle in Hermes Agent verwenden
Verwenden Sie GLM 5.2, Kimi K3 und DeepSeek v4 in ZCode
DeepSeek Harness mit DeepSeek-Modellen von Flaq AI ausführen
Verbinden Sie KI-Agenten mit den Bild- und Videogenerierungstools von Flaq
GPT 6 Astra und Claude Fable 5.1 in WorkBuddy nutzen