API Qwen 3.8 Max
Référence complète de l’API pour les modèles LLM Qwen 3.8 Max d’Alibaba.
Variantes du modèle
Cette API prend en charge deux variantes du modèle Qwen 3.8 Max :
Comparaison rapide
Qwen 3.8 Max Text to Text
Point de terminaison
POST /api/v1/chat/completions
Paramètres de la requête
Requis
Prise en charge des messages
Facultatifs
Exemple de requête
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'qwen-3.8-max-text-to-text',
messages: [
{
role: 'user',
content: 'Explain the concept of attention mechanisms in neural networks.'
}
],
stream: true,
max_tokens: 2048
})
});
Qwen 3.8 Max Web Search
Point de terminaison
POST /api/v1/chat/completions
Paramètres de la requête
Requis
Prise en charge des messages
Facultatifs
Exemple de requête
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'qwen-3.8-max-web-search',
messages: [
{
role: 'user',
content: 'What are the latest developments in quantum computing this year?'
}
],
stream: true,
max_tokens: 2048
})
});
Les modèles LLM Qwen 3.8 Max renvoient des réponses de complétion compatibles avec OpenAI. Avec stream: true, la réponse se présente sous forme d’événements envoyés par le serveur ; avec stream: false, la réponse est un objet JSON unique.
Réponse réussie
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{"role":"assistant"},"finish_reason":null}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{"content":"Here is a concise explanation"},"finish_reason":null}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[],"usage":{"prompt_tokens":12,"completion_tokens":8,"total_tokens":20}}
data: [DONE]
Réponse d’erreur
event: error
data: {"error":{"message":"API requests too frequent, exceeding rate limit","type":"rate_limit_error","code":"1302","param":null}}
Bonnes pratiques
- Utilisez des messages structurés : Envoyez l’historique de la conversation via
messages[] au lieu de regrouper le contexte dans une seule invite.
- Choisissez la bonne variante : Utilisez Text to Text pour les tâches de raisonnement et de génération. Utilisez Web Search lorsque des informations à jour sont nécessaires.
- Traitez les événements SSE : Ajoutez
choices[0].delta.content pour l’affichage en streaming et considérez data: [DONE] comme une fin réussie.
- Envoyez uniquement les entrées prises en charge : Les modèles Qwen 3.8 Max acceptent uniquement du texte et ne prennent pas en charge les fichiers ni les images joints.