Grok 4.6 holt bei Coding zu Sol auf

Grok 4.6 rattrape Sol sur le code

xAI a publié Grok 4.6, un réentraînement de Grok 4.5 axé sur la programmation et les tâches longues. Dans les comparatifs indépendants, il atteint pour la première fois le niveau de GPT-5.6 Sol. Sur ChatX, il coûte environ un tiers de ce prix. Cet article montre les chiffres, explique la particularité du raisonnement et indique quand le plus petit Grok 4.3 reste le meilleur choix.

Grok 4.5 face à 4.6 en chiffres

Grok 4.6 n’est pas une nouvelle génération de modèles. C’est un entraînement plus long de Grok 4.5 avec des données choisies pour le raisonnement, le développement logiciel et les sujets techniques. Les progrès se mesurent dans plusieurs tests :

Test Grok 4.5 Grok 4.6 Ce qui est mesuré
Artificial Analysis Intelligence Index 56 61 score global issu de dix tests
DeepSWE 54,0 % 65,9 % tâches logicielles menées en autonomie
FrontierCode 56,6 % 61,3 % problèmes de programmation difficiles
CursorBench 66,7 % 69,9 % modifications de code dans de vrais projets
GDPval 1 526 1 753 travail intellectuel professionnel

Le plus grand bond concerne DeepSWE, c’est-à-dire les tâches que le modèle traite seul sur de nombreuses étapes. C’est précisément là que Grok 4.5 était faible.

Où se situe Grok 4.6

Dans l’Intelligence Index, Grok 4.6 fait jeu égal avec GPT-5.6 Sol. Il n’atteint pas GPT-6 Astra, Claude Opus 5.5 ou Fable 5.1, mais pour beaucoup de tâches l’écart reste assez faible pour justifier la différence de prix. D’après les tarifs des fournisseurs, la sortie de Grok 4.6 coûte environ un tiers de celle de Sol et également environ un tiers de celle d’Opus 5.5. ChatX facture selon ces mêmes tarifs, donc à longueur de réponse égale ce rapport vaut aussi pour tes tokens.

Grok 4.6 devient ainsi intéressant pour toutes celles et ceux qui utilisaient Sol pour programmer ou pour des recherches techniques. Sur les textes qui demandent du style et du ton, Sol garde l’avantage. Sur le code, le développement web et les analyses en plusieurs étapes, la différence est à peine visible dans nos comparaisons.

Le modèle réfléchit toujours

Grok 4.6 est un modèle de raisonnement pur. Il réfléchit avant chaque réponse, en profondeur basse, moyenne ou haute, mais toujours. Sur ChatX, ce modèle propose donc exactement ces trois niveaux. Il n’y a pas de « Désactivé », car xAI ne permet pas de couper le raisonnement sur la 4.6. Les étapes de réflexion restent invisibles, mais elles comptent comme tokens de sortie et pèsent sur la consommation.

Pour des questions courtes, cela signifie un peu plus d’attente et quelques tokens de plus qu’avec un modèle qui répond directement. Pour la plupart des tâches, « Basse » suffit. « Haute » vaut le coup sur des bugs retors ou des tâches à plusieurs solutions possibles.

Grok 4.6 ou Grok 4.3

  • Grok 4.3 : répond sans étapes de réflexion, coûte moins de la moitié de Grok 4.6 et reste accessible aux invités sur ChatX. Avec un million de tokens, sa fenêtre de contexte est deux fois plus grande. Le bon choix pour les traductions, les textes courts, les résumés et les questions à réponse unique.
  • Grok 4.6 : pour les utilisateurs inscrits, avec compréhension des images et profondeur de réflexion réglable. Le bon choix pour la programmation, le développement web, les questions techniques et tout ce qui demande plusieurs étapes.
  • Le test : une tâche que Grok 4.3 résout différemment au deuxième essai qu’au premier est une tâche pour Grok 4.6.

Avec Grok 4.6, l’offre de xAI devient pour la première fois une vraie alternative pour le travail, à condition d’accepter que le modèle réfléchisse toujours avant de répondre.


Posted

in

by

Tags: