API de Qwen 3.8 Max
Referencia completa de la API para los modelos LLM Qwen 3.8 Max de Alibaba.
Variantes del modelo
Esta API admite dos variantes del modelo Qwen 3.8 Max:
Comparación rápida
Qwen 3.8 Max Text to Text
Punto de conexión
POST /api/v1/chat/completions
Parámetros de la solicitud
Obligatorios
Compatibilidad de mensajes
Opcionales
Ejemplo de solicitud
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'qwen-3.8-max-text-to-text',
messages: [
{
role: 'user',
content: 'Explain the concept of attention mechanisms in neural networks.'
}
],
stream: true,
max_tokens: 2048
})
});
Qwen 3.8 Max Web Search
Punto de conexión
POST /api/v1/chat/completions
Parámetros de la solicitud
Obligatorios
Compatibilidad de mensajes
Opcionales
Ejemplo de solicitud
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'qwen-3.8-max-web-search',
messages: [
{
role: 'user',
content: 'What are the latest developments in quantum computing this year?'
}
],
stream: true,
max_tokens: 2048
})
});
Los modelos LLM Qwen 3.8 Max devuelven respuestas de completado compatibles con OpenAI. Con stream: true, la respuesta usa eventos enviados por el servidor; con stream: false, la respuesta es un único objeto JSON.
Respuesta correcta
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{"role":"assistant"},"finish_reason":null}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{"content":"Here is a concise explanation"},"finish_reason":null}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[],"usage":{"prompt_tokens":12,"completion_tokens":8,"total_tokens":20}}
data: [DONE]
Respuesta de error
event: error
data: {"error":{"message":"API requests too frequent, exceeding rate limit","type":"rate_limit_error","code":"1302","param":null}}
Prácticas recomendadas
- Use mensajes estructurados: Envíe el historial de la conversación mediante
messages[] en lugar de concentrar el contexto en un único prompt.
- Elija la variante adecuada: Use Text to Text para tareas de razonamiento y generación. Use Web Search cuando necesite información actualizada.
- Procese los eventos SSE: Añada
choices[0].delta.content para mostrar el contenido en streaming y trate data: [DONE] como una finalización correcta.
- Envíe únicamente entradas compatibles: Los modelos Qwen 3.8 Max solo admiten texto y no son compatibles con archivos adjuntos ni imágenes.