Référence propriétaire externe, non proposée dans les offres Souver.
Indice Souver de benchmarks
Un indice comparable. 34 évaluations documentées.
L’indice compare les six modèles sur trois benchmarks publics communs. Une matrice étendue conserve les 34 évaluations disponibles sur le code, les agents, le raisonnement et le travail réel, sans mélanger des cohortes incomplètes dans la note principale.
Comparatif
Six modèles, le même échantillon comparable.
Les offres indiquent le périmètre étudié par Souver, pas une promesse de disponibilité publique.
Référence propriétaire externe, non proposée dans les offres Souver.
Souver Frontière · Souver Contrôle
Modèle Qwen Max de 2,4 T de paramètres, publié le 3 août 2026.
Souver Essentiel · Souver Frontière · Souver Contrôle
Modèle retenu pour l’offre Essentiel, également étudié pour Frontière et Contrôle.
Souver Frontière · Souver Contrôle
Modèle à poids ouverts étudié pour les environnements mutualisés ou dédiés sur devis.
Modèle Mistral généraliste le mieux classé dans la cohorte publique retenue.
| Modèle | Indice / 100 | TB 2.1normalisé / 100 | GPQAnormalisé / 100 | HLEnormalisé / 100 | Souveraineté |
|---|---|---|---|---|---|
Référence propriétaire externe, non proposée dans les offres Souver. | 97,930 résultats publics | 95,3 | 98,4 | 100,0 | Non souverain API propriétaire américaine. |
Référence propriétaire externe, non proposée dans les offres Souver. | 96,232 résultats publics | 100,0 | 100,0 | 88,6 | Non souverain API propriétaire américaine. |
Qwen3.8 MaxSouver Souver Frontière · Souver Contrôle Modèle Qwen Max de 2,4 T de paramètres, publié le 3 août 2026. | 92,628 résultats publics | 97,5 | 98,4 | 81,8 | Souverain Poids ouverts annoncés ; exécution souveraine étudiée dans Frontière et Contrôle. |
GLM 5.2Souver Souver Essentiel · Souver Frontière · Souver Contrôle Modèle retenu pour l’offre Essentiel, également étudié pour Frontière et Contrôle. | 86,09 résultats publics | 87,7 | 95,1 | 75,2 | Souverain Prévu dans Souver avec exécution et contrôle des données en France. |
DeepSeek V4 Flash 0731Souver Souver Frontière · Souver Contrôle Modèle à poids ouverts étudié pour les environnements mutualisés ou dédiés sur devis. | 84,79 résultats publics | 88,6 | 96,5 | 69,0 | Souverain Poids ouverts, exécutables par Souver sur une infrastructure française éligible. |
Modèle Mistral généraliste le mieux classé dans la cohorte publique retenue. | 53,59 résultats publics | 57,0 | 79,5 | 24,0 | Souverain Modèle français disponible via une API hébergée en France. |
Chaque indice porte sur les mêmes 3 benchmarks. Les compteurs de résultats publics — de 9 à 32 selon le modèle — décrivent uniquement la profondeur de la matrice documentaire étendue de 34 évaluations ; ils ne modifient pas la note.
Calcul détaillé
Chaque donnée utilisée, modèle par modèle.
1. Trois benchmarks communs
Terminal-Bench 2.1, GPQA Diamond et Humanity’s Last Exam sont publiés pour les six modèles. Eux seuls composent l’indice comparable.
2. Normalisation par benchmark
Le meilleur résultat publié parmi les six modèles vaut 100. Les autres conservent leur proportion. AA-Omniscience est d’abord ramené de −100…100 vers 0…100.
3. Moyenne avec maximum théorique à 100
Les trois scores normalisés ont le même poids. Un modèle qui serait premier sur les trois obtiendrait 100. La matrice de 34 évaluations reste séparée pour ne pas avantager les publications les plus larges.
Faites glisser la matrice pour comparer →
| Benchmark | Claude Fable 5indice 97,9 · 30 résultats publics | GPT-5.6 Solindice 96,2 · 32 résultats publics | Qwen3.8 Maxindice 92,6 · 28 résultats publics | GLM 5.2indice 86,0 · 9 résultats publics | DeepSeek V4 Flash 0731indice 84,7 · 9 résultats publics | Mistral Medium 3.5indice 53,5 · 9 résultats publics |
|---|---|---|---|---|---|---|
| Socle indépendant · 9 benchmarksNeuf évaluations communes du snapshot Artificial Analysis v4.1, de GDPval-AA à AA-LCR. | ||||||
| GDPval-AA v2 Tâches de travail économiquement utiles et livrables professionnels. | 62,2100,0 / 100 | 61,699,0 / 100 | — | 50,581,2 / 100 | 52,985,0 / 100 | 21,634,7 / 100 |
| τ³-Banking Usage agentique d’outils sur des scénarios bancaires multi-étapes. | 26,881,2 / 100 | 33,0100,0 / 100 | — | 26,881,2 / 100 | 31,194,2 / 100 | 14,443,6 / 100 |
| Terminal-Bench 2.1 Résolution de tâches réelles dans un terminal et un environnement logiciel. | 84,695,3 / 100 | 88,8100,0 / 100 | 86,697,5 / 100 | 77,987,7 / 100 | 78,788,6 / 100 | 50,657,0 / 100 |
| SciCode Implémentation de problèmes de programmation scientifique. | 60,2100,0 / 100 | 56,193,2 / 100 | — | 50,583,9 / 100 | 49,982,9 / 100 | 39,665,8 / 100 |
| Humanity’s Last Exam Connaissances et raisonnement sur des problèmes difficiles et multidisciplinaires. | 53,3100,0 / 100 | 47,288,6 / 100 | 43,681,8 / 100 | 40,175,2 / 100 | 36,869,0 / 100 | 12,824,0 / 100 |
| GPQA Diamond Raisonnement scientifique sur des questions de niveau expert. | 92,698,4 / 100 | 94,1100,0 / 100 | 92,698,4 / 100 | 89,595,1 / 100 | 90,896,5 / 100 | 74,879,5 / 100 |
| CritPt Résolution de problèmes avancés de physique. | 28,688,5 / 100 | 32,3100,0 / 100 | — | 20,964,7 / 100 | 16,651,4 / 100 | 0,00,0 / 100 |
| AA-Omniscience Fiabilité des connaissances et pénalisation des hallucinations, sur une échelle de −100 à 100. | 40,2100,0 / 100 | 21,786,8 / 100 | — | 4,074,2 / 100 | -15,760,1 / 100 | -36,345,4 / 100 |
| AA-LCR Raisonnement sur des contextes longs. | 70,095,0 / 100 | 73,7100,0 / 100 | — | 71,396,7 / 100 | 65,789,1 / 100 | 61,082,8 / 100 |
| Extension code et agents · 25 benchmarksVingt-cinq tests bornés supplémentaires publiés par Qwen pour Qwen3.8 Max, Claude Fable 5 et GPT-5.6 Sol. | ||||||
| SWE-bench Pro Correction agentique de dépôts logiciels réels. | 80,0100,0 / 100 | 64,680,7 / 100 | 67,784,6 / 100 | — | — | — |
| DeepSWE 1.1 Tâches d’ingénierie logicielle longues et complexes. | 70,095,9 / 100 | 73,0100,0 / 100 | 56,677,5 / 100 | — | — | — |
| FrontierSWE Problèmes logiciels de niveau frontière. | 88,8100,0 / 100 | — | 73,582,8 / 100 | — | — | — |
| MLS-Bench-Lite Ingénierie de systèmes de machine learning. | 49,9100,0 / 100 | 46,292,6 / 100 | 41,082,2 / 100 | — | — | — |
| PaperBench Reproduction de résultats de recherche à partir d’un article. | 88,895,5 / 100 | 90,597,3 / 100 | 93,0100,0 / 100 | — | — | — |
| AndroidBench Développement et modification d’applications Android. | 84,5100,0 / 100 | 74,087,6 / 100 | 75,188,9 / 100 | — | — | — |
| QwenSWEBench Tâches agentiques de maintenance logicielle. | 86,3100,0 / 100 | 73,585,2 / 100 | 80,793,5 / 100 | — | — | — |
| QwenQoderBench Production de code dans un environnement outillé. | 63,1100,0 / 100 | 53,885,3 / 100 | 58,492,6 / 100 | — | — | — |
| CoWorkBench Travail collaboratif multi-étapes sur des livrables. | 75,9100,0 / 100 | 71,594,2 / 100 | 74,898,6 / 100 | — | — | — |
| WorkSpaceBench Navigation et action dans des espaces de travail complexes. | 68,7100,0 / 100 | 65,695,5 / 100 | 67,798,5 / 100 | — | — | — |
| JobBench Tâches représentatives d’activités professionnelles. | 57,4100,0 / 100 | 45,479,1 / 100 | 53,493,0 / 100 | — | — | — |
| SkillsBench Activation et combinaison de compétences outillées. | 70,996,5 / 100 | 73,5100,0 / 100 | 70,295,5 / 100 | — | — | — |
| Agents’ Last Exam · score Résolution agentique de tâches longues ; composante score publiée. | — | 53,6100,0 / 100 | 52,497,8 / 100 | — | — | — |
| Automation-Bench · Pass@1 Automatisation de workflows avec vérification d’exécution. | 29,198,0 / 100 | 29,7100,0 / 100 | 27,391,9 / 100 | — | — | — |
| Toolathlon Verified · Pass@1 Sélection et enchaînement fiable d’outils. | 77,9100,0 / 100 | 74,996,1 / 100 | 72,593,1 / 100 | — | — | — |
| WideSearch Recherche large et synthèse multi-source. | 81,299,1 / 100 | — | 81,9100,0 / 100 | — | — | — |
| HLE avec outils Humanity’s Last Exam avec accès aux outils. | 64,5100,0 / 100 | 58,089,9 / 100 | 56,287,1 / 100 | — | — | — |
| IFBench Respect d’instructions détaillées et contraintes de sortie. | 63,576,7 / 100 | 72,787,8 / 100 | 82,8100,0 / 100 | — | — | — |
| $OneMillion-Bench · expert Résolution de tâches expertes à forte valeur économique. | 55,9100,0 / 100 | 53,896,2 / 100 | 52,593,9 / 100 | — | — | — |
| HealthBench Raisonnement et qualité de réponse en santé. | — | 55,391,9 / 100 | 60,2100,0 / 100 | — | — | — |
| PLawBench Raisonnement juridique et analyse de documents. | 70,295,9 / 100 | 72,398,8 / 100 | 73,2100,0 / 100 | — | — | — |
| PRBench-Legal Production professionnelle dans le domaine juridique. | 57,6100,0 / 100 | 57,6100,0 / 100 | 57,6100,0 / 100 | — | — | — |
| PRBench-Finance Production professionnelle dans le domaine financier. | 55,895,7 / 100 | 55,595,2 / 100 | 58,3100,0 / 100 | — | — | — |
| MRCR v2 256K · 8 needles Récupération d’informations multiples en contexte long. | — | 93,8100,0 / 100 | 92,999,0 / 100 | — | — | — |
| LongBench v2 Compréhension et raisonnement sur de longs contextes. | — | 67,1100,0 / 100 | 66,398,8 / 100 | — | — | — |
Le billet Qwen publie aussi 55 benchmarks multimodaux, bureautiques, visuels et vidéo. Ils restent hors de cet indice textuel et agentique, tout comme deux scores Elo sans borne fixe et une ligne sans second modèle comparable. Ils demeurent consultables dans la source officielle.
GLM 5.2 · Souver Max face à Mistral
+5,8 %
de score qualité par euro dans ce calcul
Le coût du token ne raconte pas tout.
Cet encart économique séparé reprend la note stricte sur les 9 benchmarks Artificial Analysis. GLM 5.2 obtient 53,3 points pour 3,99 € par million de tokens avec Souver Max, soit 13,36 points par euro. Mistral Medium 3.5 obtient 34,1 points pour 2,70 €, soit 12,63. Le ratio GLM est donc supérieur de 5,8 %.
L’enjeu humain est plus large : un résultat plus robuste au premier passage peut réduire les reformulations, les reprises, les vérifications répétées et les changements de contexte qui créent de la fatigue. Ce gain n’est pas inclus dans le pourcentage ci-dessus ; il doit être suivi avec le taux de réussite au premier passage, le nombre d’itérations et le temps jusqu’à validation.
Lecture et limites
Un repère public, pas un verdict universel.
L’indice principal utilise volontairement les trois mêmes benchmarks pour les six modèles. Le maximum théorique est 100, atteint seulement par un modèle qui serait premier sur chaque test. Les différences de couverture concernent la matrice étendue, pas cette note comparable.
Le socle GLM 5.2, DeepSeek V4 Flash, Mistral Medium 3.5, Claude Fable 5 et GPT-5.6 Sol vient du snapshot indépendant Artificial Analysis v4.1. L’extension Qwen3.8 est un tableau publié par Qwen et compare Qwen3.8 Max à Claude Fable 5 et GPT-5.6 Sol. Les 25 tests de cette extension restent visibles mais n’entrent pas dans l’indice, car ils ne couvrent pas les six modèles avec un protocole commun.
Qwen annonce l’ouverture des poids de Qwen3.8 Max après la publication. La colonne souveraineté décrit la possibilité d’une exécution sous contrôle Souver ; elle ne promet pas une offre activable immédiatement.