Utilisez l'API Kimi 2.7 Image-to-Text pour la compréhension visuelle, les questions sur image, l'extraction de type OCR et le raisonnement multimodal dans des workflows de production stables.
Modèles Kimi 2.7 associés
Exemples d'API
Exemple d'envoi
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: 'Bearer YOUR_API_KEY',
Accept: 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'kimi-2.7-image-to-text',
messages: [
{
role: 'user',
content: [
{
type: 'text',
text: 'What is roughly shown in this image?'
},
{
type: 'image_url',
image_url: {
url: 'https://example.com/sample-image.jpg'
}
}
]
}
],
stream: true,
max_tokens: 300
})
});
const reader = response.body.getReader();
const decoder = new TextDecoder();
let buffer = '';
let assistantText = '';
while (true) {
const { done, value } = await reader.read();
if (done) break;
buffer += decoder.decode(value, { stream: true });
const frames = buffer.split('\n\n');
buffer = frames.pop() || '';
for (const frame of frames) {
const lines = frame.split('\n').filter(Boolean);
let eventName = 'message';
const dataLines = [];
for (const line of lines) {
if (line.startsWith('event:')) {
eventName = line.slice(6).trim();
} else if (line.startsWith('data:')) {
dataLines.push(line.replace(/^data:\s*/, ''));
}
}
const raw = dataLines.join('\n').trim();
if (raw === '[DONE]') {
console.log('\nFinal text:', assistantText);
continue;
}
let payload;
try {
payload = JSON.parse(raw);
} catch {
continue;
}
if (eventName === 'error' || payload.error) {
const msg = payload.error?.message ?? payload.message ?? 'Chat request failed';
throw new Error(msg);
}
const delta = payload.choices?.[0]?.delta;
if (delta?.content) {
assistantText += delta.content;
console.log(assistantText);
}
}
}
Exemple d'envoi
import json
import requests
response = requests.post(
'https://api.flaq.ai/api/v1/chat/completions',
headers={
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json',
},
json={
'model': 'kimi-2.7-image-to-text',
'messages': [
{
'role': 'user',
'content': [
{
'type': 'text',
'text': 'What is roughly shown in this image?',
},
{
'type': 'image_url',
'image_url': {
'url': 'https://example.com/sample-image.jpg',
},
},
],
}
],
'stream': True,
'max_tokens': 300,
},
stream=True,
)
response.raise_for_status()
event_name = 'message'
assistant_text = ''
for raw_line in response.iter_lines(decode_unicode=True):
if not raw_line:
event_name = 'message'
continue
if raw_line.startswith('event:'):
event_name = raw_line.replace('event:', '', 1).strip()
continue
if raw_line.startswith('data:'):
raw_data = raw_line.replace('data:', '', 1).strip()
if raw_data == '[DONE]':
print('\nFinal text:', assistant_text)
continue
payload = json.loads(raw_data)
if event_name == 'error' or payload.get('error'):
error = payload.get('error') or payload
raise RuntimeError(error.get('message', 'Chat request failed'))
choices = payload.get('choices') or []
if choices:
delta = choices[0].get('delta') or {}
content = delta.get('content')
if content:
assistant_text += content
print(content, end='', flush=True)
Exemple d'envoi
curl -N -X POST "https://api.flaq.ai/api/v1/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Accept: text/event-stream" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-2.7-image-to-text",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is roughly shown in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/sample-image.jpg"
}
}
]
}
],
"stream": true,
"max_tokens": 300
}'
Tarifs de Kimi 2.7 Image to Text
| Paramètres | Prix | Prix d’origine | Remise |
|---|
README
API Kimi 2.7 Image-to-Text stable et abordable (compréhension visuelle Moonshot AI)
L'API Kimi 2.7 Image-to-Text sur Flaq AI donne accès au modèle multimodal de Moonshot AI pour la compréhension visuelle, les questions-réponses sur image, l'extraction de type OCR et les workflows de raisonnement fondés sur l'image. Cette intégration abordable de l'API de vision Kimi aide les développeurs à transformer une entrée image en descriptions textuelles utiles, réponses, résumés et insights structurés. Elle est conçue pour les équipes qui ont besoin d'une analyse d'image stable sans maintenir une infrastructure de vision séparée.
Fonctionnalités clés de l'API Kimi 2.7 Image-to-Text
- Compréhension visuelle : Analysez une entrée image et renvoyez des descriptions, explications et réponses claires grâce à l'intégration de l'API Kimi 2.7.
- Raisonnement fondé sur l'image : Combinez les détails visuels avec les questions utilisateur pour soutenir l'analyse produit, la revue de documents, le feedback créatif et les workflows multimodaux.
- Extraction de type OCR : Extrayez le texte visible, les libellés, le contenu d'interface et les détails d'image pour l'automatisation et le traitement de données en aval.
- Accès API pensé pour les développeurs : Ajoutez des capacités image-vers-texte aux applications via une route Flaq AI stable conçue pour les workflows de production.
- Guidage flexible par prompt : Utilisez des instructions en langage naturel pour demander de courtes légendes, des analyses détaillées, des résumés structurés ou des sorties propres à une tâche.
- Workflows de vision abordables : Créez des fonctions d'analyse visuelle évolutives avec un accès économique au modèle Moonshot AI.
Comment utiliser l'API Kimi 2.7 Image-to-Text pour l'analyse visuelle sur Flaq AI
- Entrée : Entrée image accompagnée de questions en langage naturel ou d'instructions d'analyse.
- Sortie : Réponses textuelles décrivant le contenu visuel, extrayant des informations, répondant à des questions ou résumant les détails de l'image.
- Prise en charge des images : Fonctionne avec les workflows courants d'entrée d'image pour visuels produit, captures d'écran, documents et assets créatifs.
- Capacités : Description d'image, QA visuelle, lecture de type OCR, raisonnement multimodal, analyse de captures d'écran et résumés visuels structurés via l'intégration de l'API Kimi 2.7.
Meilleurs cas d'utilisation pour l'intégration de l'API Kimi 2.7 Image-to-Text
- Analyse de captures d'écran et d'UI : Convertissez des captures d'applications en explications, notes de bugs, observations d'accessibilité et sorties de revue structurées.
- Revue de documents et formulaires : Extrayez les champs visibles, libellés, tableaux et détails de documents depuis des images pour les outils internes et l'automatisation.
- Compréhension d'images e-commerce : Décrivez les produits, identifiez les attributs, résumez les visuels de catalogue et soutenez les workflows de modération ou merchandising.
- Feedback sur assets créatifs : Analysez les compositions, styles visuels, cohérence de marque et créations de campagne avec une sortie guidée par prompt.
- Assistants IA multimodaux : Permettez aux utilisateurs de téléverser des images et de poser des questions en langage naturel dans des produits de support, d'éducation et de productivité.
Remarque Veillez à ce que l'entrée image et les prompts respectent les exigences de sécurité de Moonshot AI et Flaq AI. Si une erreur survient, ajustez l'entrée image ou le prompt, puis réessayez.
Kimi 2.7 Image-to-Text face aux concurrents : analyse comparative
- Kimi 2.7 Image-to-Text face à GPT Image-to-Text
La compréhension d'image de GPT offre une large couverture multimodale. L'API Kimi 2.7 Image-to-Text fournit une alternative Moonshot AI aux équipes qui veulent une analyse visuelle abordable via Flaq AI. - Kimi 2.7 Image-to-Text face à Gemini Image-to-Text
Gemini est solide pour le raisonnement visuel natif de Google. Kimi 2.7 donne aux développeurs une autre route stable pour les descriptions d'image, l'extraction de type OCR et les questions-réponses sur image. - Kimi 2.7 Image-to-Text face à Claude Vision
Claude Vision est utile pour une interprétation attentive des images et documents. Kimi 2.7 se concentre sur les workflows pratiques image-vers-texte pour des intégrations produit évolutives. - Kimi 2.7 Image-to-Text face à Grok Image-to-Text
Grok Image-to-Text fournit le comportement des modèles xAI pour l'analyse visuelle. Kimi 2.7 offre un accès multimodal Moonshot AI aux équipes qui comparent le comportement des fournisseurs et le style de réponse. - Kimi 2.7 Image-to-Text face aux modèles de vision Qwen
Les modèles de vision Qwen sont de solides options Alibaba. L'API Kimi 2.7 Image-to-Text donne aux développeurs une alternative propulsée par Moonshot pour la compréhension visuelle en production.
