Chez Glean, nous pensons depuis longtemps que privilégier l’intelligence de façon isolée, sans tenir compte des coûts, est une mauvaise approche. Avec un paysage des modèles en évolution constante, courir après l’intelligence de pointe uniquement est une démarche coûteuse. À la place, il est bien plus important de comprendre les compromis que différents modèles font entre coût et performance, et d’utiliser cette compréhension pour mettre la bonne intelligence sur le bon cas d’usage.
Nous avons mené deux analyses complémentaires pour le démontrer. D’abord, nous avons évalué en interne Glean Assistant, avec l’auto routing activé, face à Claude Cowork, exécutant son modèle recommandé pour le travail au quotidien, Claude Sonnet 5, sur plus de 180 tâches d’entreprise. Glean a réduit les coûts de tokens de 81% et a été choisi comme réponse préférée 78% du temps. Claude Cowork a coûté en moyenne 2,98 $ par tâche Glean s’est établi à 0,58 $.
Ensuite, nous avons construit une analyse de frontière de Pareto qui cartographie les compromis coût/performance à travers le paysage plus large des modèles sur des tâches d’entreprise, et cette analyse aide à éclairer la manière dont Glean prend des décisions d’auto routing. Avec l’auto routing, Glean associe les tâches aux modèles et à leurs niveaux de raisonnement selon l’effort et les capacités requis.

Le yo-yo des tokens en 2026
Tokenmaxxing était en vogue début 2026, les entreprises suivant qui brûlait le plus de tokens comme métrique de productivité. Le retour à la réalité a été rapide : Uber a révélé avoir épuisé l’intégralité de son budget 2026 pour le code assisté par l’IA en seulement quatre mois, et ServiceNow a rapporté le même sort quelques semaines plus tard, son DSI qualifiant cela de « vraiment dur à résoudre ». Alors que de nouveaux modèles de pointe continuaient d’arriver et que le développement agentique entrait davantage dans le mainstream, les entreprises sont arrivées à la même conclusion : parier sur un seul modèle de pointe, sans discipline sur la manière dont il est réellement utilisé, est une habitude coûteuse.
Le mois dernier a apporté un bouleversement dans le paysage des modèles. De nouveaux modèles open comme GLM 5.2, Kimi K3 et DeepSeek V4 Flash sont arrivés à des niveaux de prix plus bas, aux côtés des propres baisses de prix d’OpenAI sur GPT-5.6 Luna et Terra en juillet. Et les entreprises ont réagi : beaucoup ont intégré davantage de modèles open dans leur mix, et les plateformes d’inférence et de service de modèles qui les prennent en charge voient leur part de marché augmenter en conséquence.
Analyse de frontière de Pareto : évaluer ensemble le coût et la qualité
Avec un tel écart entre coût et capacité, nous avons mené une analyse distincte pour voir comment ces modèles se positionnent en intelligence relative au coût, cette fois sur un ensemble plus large de 1 000 tâches d’entreprise, couvrant 37 modèles et des configurations d’effort de raisonnement, dans un environnement de production. Cette analyse nous donne la granularité nécessaire pour voir comment différents types de tâches se comportent selon les modèles, et pour utiliser ces conclusions afin d’optimiser les décisions de routage.
Pour donner du sens à ce compromis, nous nous sommes tournés vers la frontière de Pareto : l’ensemble des modèles offrant le meilleur compromis possible entre performance et coût. Un modèle est Pareto optimal si aucune autre option n’offre de meilleures performances à son niveau de prix, ou, de manière équivalente, si aucun modèle moins cher n’est disponible à son niveau de performance. Représentés sous forme de courbe, les modèles peu coûteux et moins capables se situent en bas à gauche, les modèles coûteux et très capables en haut à droite, et la ligne entre les deux trace la frontière optimale.

L’analyse de Glean est unique, car la plupart des frontières de Pareto sont généralement construites à partir de jeux de données publics et ne sont pas adaptées aux complexités et à la diversité du travail en entreprise. La frontière de Pareto de Glean est calculée sur la base d’une évaluation sécurisée du trafic de production en entreprise, au moyen de méthodes qui ne rendent visibles aux évaluateurs que des statistiques agrégées.
Pour construire le graphique de la frontière de Pareto, Glean a évalué les réponses des modèles en confrontation directe, requête par requête, à l’aide d’un juge agentique axé sur la justesse, l’exécution de la tâche et l’état de préparation du résultat. Notre protocole de comparaison a combiné un tournoi toutes-rondes parmi les 11 familles de modèles à leurs niveaux de raisonnement par défaut, avec des comparaisons entre niveaux de raisonnement adjacents au sein de chaque famille, soit 81 confrontations de paires de modèles au total. Nous avons utilisé la méthodologie de Bradley–Terry, une technique statistique standard permettant de transformer des résultats en face-à-face en une note relative unique, pour calculer le score qualité Glean. Le score représente la performance attendue d’un modèle en termes de préférence face au champ de référence : un score de 60 signifie que le modèle est censé l’emporter sur la qualité dans 60% des tâches lors d’une confrontation directe face à un concurrent choisi aléatoirement, les égalités étant réparties équitablement dans cette analyse. Des scores plus élevés sont meilleurs, un score de 50 indiquant le milieu de la distribution de qualité.
Ce que nous avons constaté :
- GPT-5.6 Luna (xhigh) se situe sur la frontière, avec un score de 55 au score qualité Glean tout en restant très efficace en coût à 0,0819 $.
- GLM 5.2 (high), pour les passionnés de modèles open source, est légèrement meilleur que GPT-5.6 Luna (xhigh) avec un score de 57, mais à un coût plus élevé de 0,3489 $.
- Claude Opus 5 (high) se situe également sur la frontière, avec un score de 67, à un coût nettement plus élevé de 2,9605 $.
- Kimi K3 (high) représente un compromis intermédiaire plus équilibré, avec des gains de qualité significatifs par rapport à GPT-5.6 Luna à un score de 63 et un coût de 0,8995 $.
- Gemini 3.7 Flash (high) en est un autre exemple, avec un score de 61 et un coût de 0,4748.
Cette analyse montre que la frontière n’est pas dominée par un seul fournisseur, et que l’écart de coût entre Luna 5.6 (xhigh) et le modèle le plus cher situé sur la frontière, Opus 5 (high), est de 36x pour un gain de 22% sur le score qualité. De plus, il existe un certain nombre de modèles, Kimi K3 et Gemini 3.7 Flash (high), capables d’obtenir des gains de qualité par rapport à GPT-5.6 Luna (xhigh), tout en coûtant 3 à 6x moins cher qu’Opus 5 (high).
Ces enseignements montrent qu’il n’existe pas de modèle unique « meilleur » et qu’il y a une plage optimale, raison pour laquelle le choix de modèle et l’auto routing peuvent atteindre la qualité pour une fraction du coût. Les évaluations de frontière de Pareto rejoignent des milliers d’évaluations que Glean exécute chaque trimestre pour éclairer les décisions de routage.
Comment fonctionne l’auto routing de Glean
Le routage automatique est l’approche de Glean pour associer le bon modèle, au bon niveau de raisonnement, à la tâche à accomplir, afin qu’aucun utilisateur n’ait besoin d’être expert en modèles ou de se demander lequel choisir. Nous envisageons le routage sous deux angles. Le premier est la sélection de modèle : lequel des plus de 40 modèles ouverts et de pointe disponibles est le mieux adapté à une tâche donnée. Le second est le routage de l’effort : à quel point le modèle doit « réfléchir », en utilisant le niveau de raisonnement comme levier.
Pour déterminer le niveau de raisonnement optimal au moment de l’exécution, Glean utilise un petit modèle spécialiste, Glean Waldo, post-entraîné sur NVIDIA Nemotron 3 Nano. Une fois que Waldo a déterminé le niveau de raisonnement, il peut, si nécessaire, passer la main à un modèle spécialiste pour accomplir la tâche. Nous avons constaté, par exemple, que Claude Opus 4.8 excelle dans la création d’artefacts visuels le harness passe donc à Opus 4.8 en fonction de sa compréhension de la tâche.
Analyse de benchmark : Glean versus Claude Cowork sur le travail interservices
Glean propose un coût par tâche inférieur, sur la base de deux métriques d’entrée. La première est le coût moyen pondéré de chaque token, sur l’ensemble des modèles utilisés par le routage automatique. La seconde est le nombre de tokens utilisés. Glean a utilisé moins de tokens, 1,3 million contre 4,4 millions pour Claude Cowork, soit une réduction de 70 %. Au total, c’est ce qui a fait baisser le coût moyen chez Glean à 0,58 $ par tâche, contre 2,98 $ pour Cowork.

La raison pour laquelle nous avons obtenu une réduction de 70 % de l’utilisation des tokens repose sur des choix d’architecture dans Glean :
- Fondations de contexte d’entreprise : Glean part d’une vue unifiée, préindexée et classée des informations de l’entreprise, tandis que l’approche MCP fédérée de Claude Cowork doit interroger chaque système individuellement, sur-récupérant souvent des résultats et consommant des tokens pour normaliser les données, résoudre les conflits et répéter des boucles de raisonnement dont il ne devrait pas avoir besoin.
- Conception du harness : Glean conserve les sorties d’outils et l’état intermédiaire dans des fichiers sandbox au lieu de tout recharger à chaque fois dans la fenêtre de contexte du modèle. Il charge progressivement uniquement les outils, compétences et schémas dont une tâche a besoin, tandis que des sous-agents isolés gardent aussi le contexte non lié en dehors de la boucle principale de raisonnement.
Analyse de benchmark : Glean atteint une qualité supérieure à Claude Cowork à moindre coût
L’efficacité des coûts n’a d’importance que si la sortie est exploitable, et c’est là que la qualité entre en jeu. Glean a été préféré 78 % du temps à Claude Cowork sur plus de 180 requêtes, en remportant :
- Préférence globale : quelle réponse ils utiliseraient réellement au travail
- Exactitude : quelle réponse était la plus factuellement exacte, логiquement solide et ancrée dans des sources actuelles
- Exhaustivité : quelle réponse allait le plus loin pour satisfaire la demande et laissait moins de travail inachevé
- Qualité d’interaction : quel système nécessitait moins de guidage, de corrections, de relances, d’attente ou de sauvetage manuel

La préférence pour Glean s’est confirmée dans chaque département évalué, notamment les ventes, l’ingénierie, le marketing, les RH et people, le produit, la finance, ainsi que le support et la réussite client. Les tâches sélectionnées pour l’ensemble d’évaluation se sont inspirées de la manière dont les clients utilisent Glean aujourd’hui, bien que toutes les requêtes aient été générées de manière synthétique afin de protéger la confidentialité des utilisateurs. Les tâches ont été examinées par des experts du domaine dans chaque area, avec des membres des équipes commerciales vérifiant les tâches de vente, des marketeurs vérifiant les tâches marketing, etc., afin de s’assurer qu’elles étaient représentatives de leur travail.

L’avantage de Glean s’est également maintenu selon les types de tâches. L’ensemble d’évaluation couvrait tout le spectre du travail en entreprise : rédaction et amélioration de contenu (y compris des artefacts comme des présentations, des feuilles de calcul et du HTML, de plus en plus centraux pour les cas d’usage de coworking en entreprise), résumé et synthèse de sources, analyse de données, localisation de ressources, automatisation de workflows, et compréhension de sujets complexes.

Analyse de benchmark : les réponses préférées de Glean aident à lutter contre le botsitting
Nous avons également constaté que les réponses préférées de Glean réduisent le botsitting, ce travail largement non budgété que les employés assument pour rendre l’IA utilisable en lui fournissant du contexte, en supervisant les sorties et en corrigeant les erreurs. Des recherches menées par le Glean's Work AI Institute, auprès de 6 000 travailleurs numériques à temps plein, ont montré que les employés passent 6,4 heures par semaine à faire du botsitting, soit plus de temps que celui passé à utiliser l’IA pour produire réellement du travail. Les retours de nos évaluateurs ont fait ressortir des schémas d’échec qui génèrent ce type de travail de correction :
- Des tâches mal comprises
- Des sorties difficiles à lire ou à partager
- Des rôles ou du contexte de compte manquants
- Des preuves incomplètes ou obsolètes
- Des conclusions non étayées, voire incorrectes
Chacun de ces points est une petite taxe pour la personne qui utilise la sortie : précisément le travail que le Work AI Institute quantifie comme du botsitting. Lorsqu’un système démarre avec le bon contexte déjà en place, il a besoin de moins de corrections de ce type, et les employés récupèrent les heures qui, sinon, seraient consacrées à gérer l’IA.
Analyse de benchmark : méthodologie d’évaluation
L’évaluation interne reposait sur des requêtes synthétiques accédant aux propres données de production de Glean, avec des évaluateurs notant plus de 180 réponses sur une échelle de préférence à 5 points, en comparant Glean Assistant et Claude Cowork côte à côte. Pour l’accès aux données d’entreprise, Glean a utilisé ses connecteurs natifs et basés sur MCP, tandis que Claude Cowork a été configuré avec des connecteurs MCP standard couvrant Google Drive, Gmail, Google Calendar, Slack, Atlassian Rovo, Linear, Intercom et Sigma, ainsi que des serveurs MCP locaux pour Salesforce, GitHub et GCP. Glean a été exécuté avec le routage automatique activé Claude Cowork a été maintenu constant sur Claude Sonnet 5 avec un raisonnement élevé, la recommandation d’Anthropic
niveau de raisonnement qui équilibre qualité et rapidité.L’essor de la frontière de Pareto et l’évaluation des modèles selon le rapport coût-performance
L’essor de la frontière de Pareto marque le recul de l’intelligence maximale comme stratégie par défaut pour l’IA en entreprise. Les entreprises n’ont plus besoin de choisir entre ce que coûte l’IA et ce qu’elle délivre, et miser sur un seul modèle de pointe, sans discipline sur la manière dont il est réellement utilisé, n’est pas une habitude durable. Les résultats de Glean en apportent la preuve : associer un routage à travers un paysage de modèles en évolution rapide à un contexte d’entreprise réduit les coûts en tokens de 81 %, tandis que les sorties elles-mêmes sont préférées 78 % du temps. Glean s’engage à aider les entreprises à réduire drastiquement les coûts en tokens afin qu’elles puissent considérablement élargir le travail qu’elles confient à l’IA.
Rejoignez-nous à Glean:GO pour en savoir plus sur ces résultats.









