Cinq modèles en trois semaines : le benchmark de l'été
Entre le 8 et le 24 juillet 2026, cinq modèles de premier plan sont sortis. Voici ce qui change réellement pour une PME, ce qui ne change rien, et comment choisir sans y passer vos soirées.
Ce qui est sorti, et quand
Le premier semestre avait déjà été chargé : GPT-5.5 le 23 avril, Claude Opus 4.8 fin mai, Claude Sonnet 5 le 30 juin. Juillet a concentré cinq sorties majeures en dix-sept jours.
| Date | Modèle | Ce qu'il apporte |
|---|---|---|
| 8 juillet | Grok 4.5 | Montée en gamme sur le raisonnement général |
| 9 juillet | GPT-5.6 | Le meilleur rapport intelligence sur prix du lot |
| 16 juillet | Kimi K3 | Contexte très long et poids ouverts |
| 21 juillet | Gemini 3.6 Flash | Efficacité : 17 % de jetons de sortie en moins que la version précédente, jusqu'à 65 % sur certains tests de code |
| 24 juillet | Claude Opus 5 | Haut de gamme sur le raisonnement long et le code |
Le fait marquant n'est pas la performance, c'est le prix
Le classement de tête a peu bougé. En revanche, l'écart de tarif entre modèles de niveau comparable s'est creusé de manière spectaculaire.
Sur l'indice de référence utilisé par Artificial Analysis, GPT-5.6 Sol obtient un score de 59 contre 60 pour Claude Fable 5. Autrement dit, une différence à peine mesurable. Le prix, lui, est environ trois fois inférieur.
Un point d'écart sur un classement, trois fois moins cher à l'usage. C'est là que se joue la vraie décision, pas dans le classement.
Pour une entreprise qui traite quelques centaines de documents par mois, l'écart absolu reste modeste. Pour une automatisation qui tourne en continu, sur des milliers d'appels, un facteur trois transforme un projet non rentable en projet rentable.
Quel modèle pour quel usage
Plutôt qu'un classement général qui ne veut rien dire, voici comment nous orientons nos clients selon le besoin réel.
| Votre besoin | Modèles pertinents |
|---|---|
| Raisonnement exigeant, analyse juridique ou financière, développement | GPT-5.6 Sol, Claude Opus 5 |
| Boucles d'agents à fort volume, où le coût et le temps de réponse comptent | Gemini 3.6 Flash |
| Traitement de documents très longs, ou besoin de poids ouverts pour un hébergement maîtrisé | Kimi K3 |
| Usages courants : rédaction, classification, extraction, réponses sur base documentaire | Presque tous conviennent, choisissez sur le prix et la conformité |
Ce dernier point mérite d'être souligné, parce qu'il concerne la majorité des projets que nous voyons. Pour trier des e-mails, extraire des informations d'une facture ou répondre à partir de vos documents internes, tous les modèles de cette liste font le travail. Payer le plus cher n'apporte rien.
Comment tester sérieusement, en une demi-journée
Les classements publics mesurent une moyenne sur des tâches génériques. Votre activité n'est pas une moyenne. Voici le protocole que nous appliquons, il ne demande aucune compétence technique particulière.
- Rassemblez vingt à trente cas réels tirés de votre activité, avec pour chacun la réponse que vous jugez correcte.
- Faites tourner deux ou trois modèles sur exactement les mêmes entrées, avec exactement les mêmes consignes.
- Comptez les réponses justes, notez le temps de réponse et le coût total du test.
- Conservez ce jeu de tests. Il vous servira à réévaluer à chaque nouvelle sortie, sans repartir de zéro.
Le bon rythme de changement
Changer de modèle n'est pas gratuit. Il faut retester les sorties, ajuster les consignes, vérifier que rien ne casse en production. À raison de cinq sorties par mois, courir après chaque nouveauté revient à ne jamais rien stabiliser.
Nous recommandons une réévaluation trimestrielle, sur deux critères mesurables : la qualité des sorties sur votre propre jeu de tests, et le coût par traitement. Si aucun des deux ne s'améliore franchement, restez où vous êtes.
Et gardez la règle d'architecture qui rend tout cela indolore : dans un workflow bien conçu, le modèle est déclaré à un seul endroit. En changer devient une modification de quelques minutes, testable et réversible. C'est cette souplesse, et non le choix du modèle du mois, qui fait la différence sur trois ans.