API do Qwen 3.8 Max
Referência completa da API para os modelos LLM Qwen 3.8 Max desenvolvidos pela Alibaba.
Variantes do modelo
Esta API oferece suporte a duas variantes do modelo Qwen 3.8 Max:
Comparação rápida
Qwen 3.8 Max Text to Text
Ponto de acesso
POST /api/v1/chat/completions
Parâmetros da solicitação
Obrigatórios
Suporte a mensagens
Opcionais
Exemplo de solicitação
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'qwen-3.8-max-text-to-text',
messages: [
{
role: 'user',
content: 'Explain the concept of attention mechanisms in neural networks.'
}
],
stream: true,
max_tokens: 2048
})
});
Qwen 3.8 Max Web Search
Ponto de acesso
POST /api/v1/chat/completions
Parâmetros da solicitação
Obrigatórios
Suporte a mensagens
Opcionais
Exemplo de solicitação
const response = await fetch('https://api.flaq.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Authorization': 'Bearer YOUR_API_KEY',
'Accept': 'text/event-stream',
'Content-Type': 'application/json'
},
body: JSON.stringify({
model: 'qwen-3.8-max-web-search',
messages: [
{
role: 'user',
content: 'What are the latest developments in quantum computing this year?'
}
],
stream: true,
max_tokens: 2048
})
});
Formato da resposta
Os modelos LLM Qwen 3.8 Max retornam respostas de conclusão compatíveis com a OpenAI. Com stream: true, a resposta usa Server-Sent Events; com stream: false, a resposta é um único objeto JSON.
Resposta bem-sucedida
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{"role":"assistant"},"finish_reason":null}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{"content":"Here is a concise explanation"},"finish_reason":null}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}
data: {"id":"chatcmpl-...","object":"chat.completion.chunk","created":1710000000,"model":"qwen-3.8-max-text-to-text","choices":[],"usage":{"prompt_tokens":12,"completion_tokens":8,"total_tokens":20}}
data: [DONE]
Resposta de erro
event: error
data: {"error":{"message":"API requests too frequent, exceeding rate limit","type":"rate_limit_error","code":"1302","param":null}}
Práticas recomendadas
- Use mensagens estruturadas: Envie o histórico da conversa por meio de
messages[] em vez de condensar o contexto em um único prompt.
- Escolha a variante correta: Use Text to Text para tarefas de raciocínio e geração. Use Web Search quando precisar de informações atualizadas.
- Processe eventos SSE: Acrescente
choices[0].delta.content para exibição por streaming e trate data: [DONE] como uma conclusão bem-sucedida.
- Envie apenas entradas compatíveis: Os modelos Qwen 3.8 Max aceitam apenas texto e não são compatíveis com anexos de arquivos ou imagens.