QR

Flash IA

Panorama des modèles — Septembre 2026

4 septembre 2026

La semaine en bref

Quatre semaines de déploiés, deux semaines entre les sorties. L'efficience MoE explose (770B, 125B) tandis que les propriétaires se synchronisent le 1–3 sept. La vidéo générative franchit un cap avec MiniMax-H3 (2K + audio stéréo natif). L'open-source pousse la fenêtre de contexte à 1M tokens.

Efficience

Qwen3.8-Flash-Next 🏎️ Open
26 août 2026 · 125B MoE / 6B actif · 262k tokens (1M via YaRN)

MoE léger orienté long contexte et multimodal, pré-version de l'architecture Qwen4.

Le ratio 6B actif sur 125B total rend le modèle exécutible sur une seule GPU haut de gamme, un seuil inédit pour cette taille.

GLM-5.3-Flash 💨 Open (MIT)
26 août 2026 · 320B total / 18B actif · Multimodal natif · 1M context

Premier GLM-5 multimodal (texte, image, vidéo) avec poids MIT, détection stealth sous le nom ox-alpha.

L'ouverture MIT à 320BMoE est un coup de poker rare : un concurrent sérieux à GPT-6 à coût réduit, avec vidéo native.

Hy4 Preview 🦉 Open (Apache 2.0)
28 août 2026 · 770B MoE / 49B actif · 1M context · 256 experts

MoE massif de Tencent orienté agent, avec attente décentralisée (DSA) et décodage spéculatif (MTP).

770B avec 49B actifs : le record open actuel. Apache 2.0 + 256 experts = la plus grande ferme d'experts ouverte à ce jour.

Propriétaire

GPT-5.6 Luna 🌙 Fermé
9 juil. 2026 · Tier économique · $1/M input · 1M context — OpenAI

Modèle le plus rapide et économique de la série GPT-5.6, orienté charges de travail intensives et latence faible.

Le ratio performance/coût le plus bas de chez OpenAI : $1/million de tokens en entrée. Le tier Luna complète la famille GPT-5.6 (Sol, Terra, Luna).

GPT-6 Astra 🚀 Fermé
3 sept. 2026 (preview limité) · Sortie publique prévue 5 sept. — OpenAI

Nouveau flagship d'OpenAI, fin des spéculations GPT-5.7 : Astra est bien GPT-6.

Le nom Astra finalise un an de rumeurs. Le déploiement progressif à partir du 3 sept. suggère une capacité de scaling interne massive.

Gemini 3.8 Flash Fermé
2 sept. 2026 · 90.8% Terminal-Bench 2.1 · 3e Flash en 6 semaines — Google

Modèle généraliste le plus intelligent de la gamme Flash, améliorations majeures en code et raisonnement.

90.8% sur Terminal-Bench bat tous les concurrents. Google maintient le même prix que 3.7 tout en poussant les benchmarks.

Gemini 3.8 Flash Cyber 🛡️ Fermé
2 sept. 2026 · Spécialisé vulnérabilités logicielles — Google

Variante spécialisée pour trouver des vulnérabilités et écrire des correctifs autonomes.

Première fois que Google bundle un modèle grand public avec une variante cyber. 2.6x sur Chrome bugs selon les benchmarks.

Claude Fable 5.1 📜 Fermé
1 sept. 2026 · 4x cache reads · 1M context · $10/$50 — Anthropic

Modèle de codage et knowledge work le plus avancé d'Anthropic, avec coupure 75% sur les cache reads.

Le vrai changement : -75% cache reads = -25% coût moyen, -45% sur workflows agents. Le prix reste stable à $10/$50.

Claude Mythos 5.1 🔒 Fermé (sur invite)
1 sept. 2026 · Cyber et bio · Sur invite — Anthropic

Même modèle que Fable 5.1 avec restrictions relaxées pour la cybersécurité et la biologie.

Accès par invitation uniquement (Project Glasswing). Sémantiquement identique à Fable 5.1 mais avec guardrails adaptés au recherche défensive.

Qwen3.8-Max-0902 🐲 Cloud
2 sept. 2026 · 1M context · Amélioration coding — Alibaba

Snapshot amélioré de qwen3.8-max, focus engineering-scale et développement autonome long horizon.

Même prix ($2/$6) que la version précédente. Le nom "0902" indique explicitement la date de snapshot — version stable et versionnable.

Muse Spark 1.3 Cloud (Contributor)
2 sept. 2026 · 1 048 576 tokens · 98.5% MCR — Meta

Modèle multimodal de raisonnement de Meta pour le code et les workflows agents.

98.5% sur MCR. L'offre Contributor à $0.10/mio tokens (payé en données) est le modèle le moins cher de sa classe. 1M tokens natifs.

Prévision & Infrastructure

Chronos-2 📈 Open (Amazon)
Déc. 2025 · 120M paramètres · Encoder-only · Zero-shot — Amazon

Modèle de prévision probabiliste unifiée : univariée, multivariée et covariates exogènes, sans phase d'entraînement.

Déployable on-premise léger (120M params uniquement), optimise planification électrique et budgétaire via in-context learning.

Pas convaincu pour l'instant

Ornith-1.5 🐦 Open (MIT)
19 août 2026 · 397B MoE / 3B actif · 9B dense · OpenAI-style self-scaffolding — DeepReinforce

LLM open-source qui génère son propre programme de formation (data flywheel auto-générée).

Concept prometteur (auto-training) mais maturité expérimentale :谁来 évalue les gains sur benchmarks réels vs hype auto-générée ?

DeepSeek Harness 🔧 Open (MIT)
13 août 2026 · Framework agent "everything-is-a-plugin" — DeepSeek AI

Harness agent open-source avec architecture plug-in : modèles, outils, skills, sessions, sandboxes swapables.

Architecture intéressante mais framework en preview — pas de modèle entraîné derrière. À surveiller, pas à déployer.

Vidéo

MiniMax-H3 (Hailuo 3.0) 🎬 Open (33B)
31 juil. 2026 · 2K · 24fps · 4-15s · Audio stéréo natif — MiniMax/ByteDance

Modèle omni-modal (texte, image, vidéo, audio) en un seul transformer, génération vidéo 2K avec audio synchronisé.

33B paramètres pour 2K vidéo + audio stéréo natif. Le combo 2K+audio natif est le premier open accessible en qualité production. 3 août : weights HF + support ComfyUI.