Alibaba vient de lancer officiellement Qwen3.8-Max — son modèle phare à 2,4 billions de paramètres — sur la plateforme Qwen, avec des poids open-source attendus autour du 10 août. Il ne s'agit plus d'une simple préversion : le modèle est accessible aux développeurs via les abonnements Token Plan, et il apporte deux capacités qui comptent davantage que le nombre de paramètres affiché : une fenêtre de contexte approchant le million de tokens et une compatibilité native avec les outils que vous utilisez déjà.
Qu'est-ce que Qwen3.8-Max ?
Qwen3.8-Max est un modèle Mixture-of-Experts (MoE) creux à 2,4 billions de paramètres au total. Le MoE signifie que le modèle n'active pas l'intégralité de ses paramètres à chaque token — seul un sous-ensemble s'active lors de chaque passe avant. Alibaba n'a pas divulgué le nombre de paramètres actifs, mais leur propre précédent est éclairant : Qwen3-235B n'active que 22 milliards de paramètres par token. À ratio comparable, Qwen3.8 active probablement entre 100 et 250 milliards de paramètres par passe — une échelle comparable aux modèles frontière, à un coût d'inférence nettement inférieur.
Au-delà des paramètres, c'est le premier modèle multimodal d'Alibaba dépassant 1 billion de paramètres. Il traite nativement du texte, des images, de la vidéo et des documents.
La fenêtre de contexte : 983 000 tokens
Le chiffre qui retient l'attention n'est pas 2,4T — c'est 983 616 tokens de contexte de travail, soit près d'un million de tokens.
Pour comparer :
- GPT-5 : 200 000 tokens
- Claude Fable 5 : environ 500 000 tokens
- Qwen3.8-Max : 983 616 tokens
Concrètement, cette fenêtre peut contenir une codebase entière de taille moyenne, une année de notes de réunion, ou des dizaines de longs documents techniques — simultanément. Pour les workflows agents qui doivent maintenir un état étendu sur de nombreux appels d'outils, c'est un avantage décisif.
Options d'accès aujourd'hui
Qwen3.8-Max est disponible en préversion via trois canaux :
Qwen Token Plan (individuel, mensuel) :
- Lite : 6 $/mois — 700 crédits, limite 5 heures
- Standard : 18 $/mois — 3 000 crédits
- Pro : 68 $/mois — 12 000 crédits
Plans équipe (par siège, mensuel) :
- Standard : 20 $ — 25 000 crédits
- Pro : 75 $ — 100 000 crédits
- Max : 200 $ — 250 000 crédits
En préversion, tous les niveaux fonctionnent à 10 % du tarif standard, avec un tarif réduit au 1/50e entre 22h00 et 08h00 UTC+8. L'identifiant du modèle est qwen3.8-max-preview.
Note importante : le Token Plan interdit le traitement automatisé en arrière-plan et le traitement par lots. Si vous avez besoin de pipelines programmatiques, attendez les poids open-source ou un endpoint API standard.
Intégration avec vos outils existants
Pas besoin de changer d'environnement pour tester Qwen3.8-Max. Le modèle est déjà intégré avec :
- Claude Code — utilisez-le comme backend alternatif pour vos sessions de codage agentique
- Cursor — disponible via le sélecteur de modèle de Cursor
- OpenAI Codex — compatible pour les tâches de génération de code
- OpenCode — l'agent de codage open-source
Qoder d'Alibaba est conçu spécifiquement pour les workflows de développement, tandis que QoderWork cible la productivité bureautique et le traitement de documents.
Modes de raisonnement
Qwen3.8-Max intègre un raisonnement permanent — impossible à désactiver, mais réglable en profondeur :
| Mode | Cas d'usage |
|---|---|
low | Réponses rapides, tâches simples |
high | Équilibre précision/vitesse |
xhigh | Précision maximale (par défaut) |
Le mode xhigh par défaut augmente la latence et la consommation de crédits. Pour les requêtes rapides ou les tâches de génération simples, passer en mode low permet d'étirer considérablement le budget de crédits.
Performances déclarées (avec réserves)
Alibaba affirme que Qwen3.8-Max se classe « second uniquement après Claude Fable 5 » sur les benchmarks. Le tableau de benchmark détaillé, la fiche modèle et la méthodologie n'ont pas encore été publiés — traitez donc cela comme une indication directionnelle, non comme un résultat vérifié.
Ce qui est crédible : le modèle cible le codage, le développement full-stack, l'analyse de données et les workflows bureautiques — la même distribution de tâches sur laquelle Qwen3-235B a excellé.
Poids open-source : ce qui vous attend
La publication complète des poids open-source est attendue autour du 10 août 2026. Les inconnues clés :
- Conditions de licence (usage commercial, restrictions de fine-tuning)
- Configuration matérielle minimale (2,4T en quantization 4-bit ≈ 1,2 To de VRAM/stockage)
- Publication simultanée ou non de variantes quantizées
Alibaba a également confirmé Qwen3.8-27B comme modèle open-source distinct — un modèle dense plus accessible pour l'auto-hébergement, sans nécessiter un téraoctet de mémoire GPU.
Qui devrait essayer maintenant ?
Essayez maintenant si :
- Vous avez besoin d'une fenêtre de contexte supérieure à 500 000 tokens
- Vous utilisez déjà Qoder ou QoderWork dans votre stack
- Vous souhaitez benchmarker vos charges de travail avant la sortie des poids open-source
Attendez si :
- Vous avez besoin d'un accès API programmatique avec tarification par token
- Vous planifiez du fine-tuning ou de la personnalisation du modèle
- Votre cible est le déploiement auto-hébergé
Conclusion
Qwen3.8-Max entre dans le niveau frontière avec un seul chiffre différenciateur : une fenêtre de contexte approchant le million de tokens. Cela seul suffit à le mettre à l'évaluation pour les workflows intensifs en documents ou les larges codebases. L'absence de benchmarks publiés et le statut préversion signifient que l'engagement en crédits reste une expérience — pas une décision de production — mais avec des poids open-source arrivant dans quelques jours, l'écart entre « évaluer » et « déployer » se referme rapidement.
La course à l'IA chinoise ne ralentit pas. Entre les poids ouverts de Kimi K3 à 2,8 billions de paramètres le mois dernier et l'arrivée de Qwen3.8-Max aujourd'hui, les développeurs disposent désormais de plus d'options à l'échelle frontière que jamais. La vraie question n'est pas de savoir si vous devez y prêter attention — c'est comment rester calibré à mesure que le rythme s'accélère.