← Toutes les éditions

IA encore des autodafés en 2026

Édition N°27 · 17 août 2026Par Nicolas Peytavin
Écouter cette édition · Version audio00:00 / 00:00
  • 1,2×
  • 1,5×
Le graphique
CursorBench : ce que coûte vraiment une tâche accomplie

Cursor évalue les agents sur des tâches réelles, ambiguës et multi-fichiers, puis rapporte le score obtenu au coût moyen par tâche. Le graphique se lit d'un coup d'œil : la courbe de Fable 5 doit grimper jusqu'aux 18 dollars la tâche pour atteindre les 70 %, là où Grok 4.6 y arrive pour quelques dollars à peine. Opus 5 tient une position intermédiaire confortable, et tout le peloton se tasse dans la partie droite, sous les 3 dollars, à quelques points seulement du sommet. Le vrai critère, quand on paie la note tous les mois, se lit à l'horizontale.

Nuage de points CursorBench 3.2 : score de chaque famille de modeles en fonction du cout moyen par tache. Chaque courbe relie les differents niveaux de raisonnement d'un meme modele.
Comment le lireChaque courbe relie les niveaux de raisonnement d'un même modèle. Monter en puissance fait grimper le score, et le coût avec. La pente dit tout : plus elle est plate, plus les points gagnés se paient cher.
L'axe piègeL'horizontale se lit à l'envers : le plus cher à gauche, le gratuit tout à droite. Un modèle placé en haut à droite est donc la meilleure affaire, pas l'inverse.
Méthode et sourceCoût calculé à partir des tarifs publics au million de jetons, appliqués aux jetons réellement consommés. Les écarts de quelques dixièmes de point ne sont pas nécessairement significatifs. CursorBench 3.2, Cursor, relevé du 17 août 2026.