Un nouveau classement vient de bousculer les comparatifs de modèles d’IA. Le HighWalk Benchmark, test indépendant focalisé sur la maintenance de documentation technique, place Grok 4.5 d’xAI en tête d’une liste incluant Claude Opus 5, GPT 5.6 Terra et Claude Sonnet 5.
Ce que mesure HighWalk
Le principe du benchmark est précis : les modèles reçoivent 46 commits réels du framework PHP Laravel et doivent mettre à jour les spécifications techniques correspondantes. Le test pénalise à la fois les erreurs factuelles et l’inefficacité opérationnelle. La notation finale pondère 80 % sur la qualité et 20 % sur l’efficacité de fonctionnement.
C’est un benchmark différent des classiques MMLU, HumanEval ou ARC. Il s’attaque à un usage concret : maintenir la documentation d’un projet logiciel en synchronisation avec l’évolution du code. Un problème quotidien pour les équipes de développement.
Le classement complet
Le classement final (qualité + efficacité combinées) : Grok 4.5 en configuration haute (1er), Claude Opus 5 haute (2e), GPT 5.6 Terra medium (3e), Claude Sonnet 5 haute (4e), GLM 5.2 xhigh (5e). Suivent DeepSeek V4 Pro, Claude Fable 5, des variantes GPT 5.6 et Claude Opus 4.8.
Un résultat notable : Claude Opus 5 obtient la meilleure note de qualité brute et zéro échec critique. Grok 4.5 le dépasse sur le classement combiné grâce à son efficacité opérationnelle supérieure. GLM 5.2 prend la première place parmi les modèles open-weight, confirmant sa montée en puissance depuis son lancement par Zhipu AI.
Grok 4.5, lancé début juillet
Grok 4.5 a été mis à disposition du public le 8 juillet 2026 par xAI, désormais filiale de SpaceX depuis la fusion finalisée en mai. Le modèle est présenté comme la meilleure release d’xAI à ce jour pour le code, les tâches agentiques et le travail de connaissance. Il a été entraîné en forte collaboration avec Cursor, la plateforme de code assisté par IA.
La même semaine où Grok 4.5 décroche ce classement, le modèle a été intégré à GitHub Copilot. La coïncidence est relevée par plusieurs observateurs : Grok ne se contente pas de gagner des benchmarks, il entre dans les outils que les développeurs utilisent au quotidien. Les benchmarks font les titres, mais c’est la distribution dans les IDEs qui forge les habitudes.
Le débat sur les benchmarks spécialisés
La multiplication des benchmarks thématiques pose une question de fond : ces classements reflètent-ils des capacités générales, ou simplement une optimisation sur des données proches de l’entraînement ? Sur HighWalk, le scepticisme porte sur le fait que les commits Laravel sont publiquement accessibles et auraient pu figurer dans les données d’entraînement.
Le contexte de fond reste inchangé : la course aux modèles avance vite. Claude Opus 5, lancé le 24 juillet, montre des performances de premier rang sur plusieurs axes simultanément. Grok 4.5, avec un prix d’entrée de 2 dollars par million de tokens en entrée, représente une option efficace rapport qualité-coût dans le top 5 mondial.
