À chaque nouvelle génération de modèles, la même question revient : faut-il forcément disposer de l’IA la plus puissante pour obtenir les meilleurs résultats ? Les modèles de frontière repoussent les limites techniques, mais leur coût, leur consommation de ressources et leur complexité les rendent souvent disproportionnés pour les usages courants. Je vous propose dans cet article de déplacer le débat : plutôt que de chercher le meilleur modèle, il faut s’interroger sur le niveau de capacité réellement nécessaire et sur la qualité du système qui l’entoure. Car, pour les entreprises, la différence se joue de plus en plus dans le harnais qui transforme les capacités générales d’un modèle en compétences opérationnelles adaptées au contexte spécifique d’une entreprise.

Thèmes : IA générative.
En synthèse
- La performance maximale n’est pas synonyme de pertinence : les modèles de frontière repoussent les limites de l’IA, mais sont largement surdimensionnés pour la majorité des tâches quotidiennes.
- Le bon modèle est celui qui répond au besoin au juste coût : l’enjeu est de trouver le meilleur compromis entre qualité, coût et consommation de ressources.
- La puissance extrême se justifie surtout pour les usages critiques : le surcoût d’un modèle de frontière devient acceptable lorsque la valeur du problème traité est suffisamment élevée.
- La valeur opérationnelle vient de l’environnement qui entoure le modèle : le harnais lui apporte le contexte métier, les données, les outils, les règles et les procédures nécessaires.
- L’avantage compétitif se déplace du modèle vers le système : une fois un niveau de capacité suffisant atteint, les gains les plus importants viennent du harnais et de l’orchestration des modèles.
Nous assistons depuis le lancement de ChatGPT il y a 4 ans à une course à l’innovation pour concevoir les modèles génératifs les plus puissants. Quatre ans après, la compétition entre éditeurs est toujours aussi intense, si ce n’est plus. Ainsi, chaque nouvelle génération de modèle améliore les performances sur les tâches complexes et élargit le champ des possibles. Dans l’absolu, c’est une très bonne chose, mais dans les faits, le rythme d’innovation imposé par cette course est peut-être trop rapide : Des limites de la capacité d’absorption du marché avec l’IA.
La course est tellement intense, que les plus grands éditeurs (Anthropic, OpenAI, xAI…) appellent à ralentir le rythme d’innovation : Anthropic and OpenAI CEOs call for AI development to slow down. Un appel plutôt bien accueillit par la communauté scientifique, mais qui laisse perplexes les observateurs avertis : Not everyone is convinced that Big AI’s proposed slowdown is really about safety.

Des prises de parole également largement commentées par les spécialistes et instrumentalisées par les médias traditionnels : Et si le problème n’était pas l’IA, mais les médias ?
Mais toutes ces jérémiades n’empêchent pas pour autant la sortie de leurs nouveaux modèles :

Vous pourriez penser que tout ceci relève de la Comedia del arte, mais il y a pourtant une logique que je vous propose d’étudier dans cet article pour ne pas entretenir une confusion récurrente : les modèles les plus puissants ne sont pas forcément les plus pertinents, mais ils ont leur utilité.
Les modèles de frontière sont à l’IA ce que la Formule 1 est à l’automobile
Je pense ne rien vous apprendre en écrivant qu’une Formule 1 démontre ce qu’il est techniquement possible d’obtenir en matière de vitesse, d’aérodynamisme ou de motorisation. Ce n’est pourtant pas la voiture dont la majorité des automobilistes a besoin, ni même les « supercars », et encore moins les « hypercars ». Mais si vous n’avez ni les moyens, ni les compétences pour posséder ou conduire une Bugatti Destrier, cela ne vous empêche pas de vous émerveiller devant une telle réalisation technologique, d’autant plus qu’elle est Made in France !

Il en va de même pour les modèles de frontière : leur rôle est de repousser les limites (raisonnement complexe, recherche scientifique, programmation avancée…) et d’en mettre plein la vue aux investisseurs potentiels. Ils constituent ainsi des démonstrateurs technologiques indispensables à la progression du secteur, faisant office de « conception de référence » (« Design reference » en anglais).
Il vous faut néanmoins garder en tête que le niveau maximal de capacité de ces modèles de frontière est largement surdimensionné pour une grande partie des tâches quotidiennes : rédaction, synthèse, classification, recherche d’information, assistance ou automatisation de procédures simples…
La bonne question à vous poser n’est donc pas : « Quel est le modèle le plus puissant ? », mais : « De quel niveau de capacité avons-nous réellement besoin pour accomplir telle ou telle tâche ?« .
À grande échelle, la puissance maximale devient un mauvais critère de choix
Dans la mesure où il est plus gros et plus sophistiqué, un modèle de frontière mobilise davantage de ressources, et son utilisation coûte généralement très cher. Il en va de même pour les voitures de sport : la Bugatti Destrier consomme plus de 200 litres pour 100 km sur circuit, là où une Clio consomme environ 5 litres pour 100 km sur autoroute.
Ce surcoût lié à une puissance extrême peut être justifié lorsqu’il permet de résoudre un problème à forte valeur ajoutée : résolution d’un problème de mathématique assorti d’une prime, identification de failles de sécurité d’un système critique… (ex : Claude discovers a novel enzyme system with CRISPR-like repeats). Ces cas extrêmes justifient l’utilisation d’un modèle de frontière, et donc le coût de fonctionnement qui va avec.
Mais ce surcoût est difficile à justifier lorsqu’un modèle plus léger fournit une qualité suffisante pour prendre en charge des tâches moins complexes (ex : bureautique). La logique économique change donc avec le volume. Mais il n’est pas que question d’argent, car la consommation d’énergie rentre aussi en ligne de compte (je vous rappelle que le prix du baril de pétrole flambe). Si certains usages particulièrement complexes peuvent justifier l’utilisation d’un modèle très puissant, des millions de requêtes quotidiennes imposent au contraire de trouver le meilleur compromis entre qualité, coût et consommation de ressources.

C’est précisément pour cette raison que les grands éditeurs proposent désormais différentes catégories de modèles, à commercer par Google, Microsoft ou Amazon qui n’ont pas abandonné la course à la puissance, mais qui semblent privilégier des modèles plus équilibrés permettant d’adapter les capacités et les coûts à des besoins moins exigeants. C’est notamment la logique de modèles comme Gemini Flash et MAI Thinking, ou des différentes déclinaisons proposées par les grands éditeurs : Une polarisation du marché de l’IA générative pour fidéliser les entreprises et utilisateurs.
Ces précisions sont d’autant plus importantes que la très large majorité des utilisateurs n’ont aucune idée du modèle ou de la version du modèle qu’ils utilisent. Pour eux, ça se résume à Copilot ou Gemini, dont ils apprécient avant tout l’intégration dans leur environnement de travail et la simplicité d’usage : Nous n’avons pas besoin de meilleurs modèles, mais de meilleurs produits.
Mais cela ne signifie pas que les modèles de frontière sont inutiles ou condamnés à rester une niche.
Les modèles de frontière restent pertinents pour certains problèmes
Si nous sommes tous d’accord pour dire qu’une Bugatti Destrier est aussi utile pour aller faire vos courses que Claude Fable 5.1 pour résumer un email, leur existence et les centaines de millions de $ investis dans leur conception restent justifiés.
Ainsi, les modèles de frontière ou les modèles spécifiquement conçus pour une seule entreprise prennent tout leur sens lorsque le coût du modèle est inférieur à la valeur du problème traité : recherche scientifique, ingénierie de pointe, analyses complexes, développement logiciel, processus industriels spécialisés…
Ainsi, l’accord entre TotalEnergies et Mistral illustre bien cette logique : TotalEnergies annonce un partenariat avec Mistral en vue de développer des modèles de frontière d’intelligence artificielle dédiés à l’exploration et à l’ingénierie des réservoirs.

Ici, le recours à des modèles extrêmement performants peut être justifié par la complexité des problèmes, la valeur économique des décisions et la disponibilité d’un patrimoine de données et de connaissances très spécialisé. Le modèle de frontière est donc une brique technologique spécialisée dont le surcoût peut et doit être justifié par un usage critique.
Ce qui nous amène à parler de compromis.
La course se déplace de la recherche de puissance vers le meilleur rapport entre capacités et coût
Quand le prix de l’essence augmente, l’intérêt des automobilistes pour les solutions alternatives augmente de concert (voitures électriques). De même, à mesure que les coûts liés à la conception et l’exploitation des modèles de frontière augmentent (raréfaction des composants électroniques, tension sur les prix de l’énergie…), l’intérêt du marché se reporte sur les solutions alternatives, notamment les modèles open source.
Dernièrement, c’est le modèle de Xiaomi (Mimo-V2.6) qui nous fait douter de la pertinence des modèles de frontière : Xiaomi’s New Flagship Model Leads Open-Weight Rankings With a Score of 46. Ainsi, l’intérêt des modèles proposés par les éditeurs chinois ne réside pas uniquement dans leurs performances, mais dans leur capacité à fournir de bonnes performances en mobilisant une fraction des ressources disponibles. Vous noterez d’ailleurs que les équipes d’OpenAI ont été promptes à réagir en lançant des modèles au positionnement similaire : OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes.

Ces modèles peuvent constituer des alternatives crédibles, notamment lorsqu’ils peuvent être déployés ou adaptés dans des infrastructures contrôlées par l’entreprise. Les questions de souveraineté, invoquées bien trop souvent à mon sens, doivent cependant être analysées au cas par cas : provenance du modèle, type de licence, lieu d’hébergement, dépendances techniques, gouvernance des données, capacité à changer de fournisseur…
La question n’est donc plus uniquement : « Quel modèle obtient le meilleur score ? », mais devient : « Quel système fournit le niveau de performance attendu avec un niveau de coût, de contrôle et de dépendance acceptable ? ».
J’imagine que cette question n’est pas une surprise, car vous m’aviez vu venir. En revanche, vous serez peut-être surpris d’apprendre que les capacités d’un modèle ne sont pas liées qu’à sa puissance, bien au contraire.
Le modèle n’est qu’un composant du système
Pendant les premières années de l’IA générative, une grande partie de la compétition reposait sur la comparaison des modèles à travers des benchmarks comme ceux proposés par Artificial Analysis, AI Arena, LLM Stats, Epoch…
Mais un modèle utilisé tel quel ne connaît ni l’entreprise (offres, actualités…), ni son organisation (son découpage en unités et départements, circuits de décision…), ni ses processus de production (procédures, règles métier…). Toutes ces informations doivent être apportées par le système qui l’entoure. C’est ce que l’on appelle le harnais (« harness » en anglais), c’est la couche sémantique et méthodologique qui fournit au modèle un cadre de travail :
- Contexte métier et instructions ;
- données et connaissances internes ;
- mémoire et outils (via des API) ;
- droits et permissions ;
- règles métier et workflows ;
- mécanismes de contrôle ;
- systèmes d’évaluation…
Si le modèle fournit des capacités générales, le harnais transforme des capacités génériques en compétences opérationnelles adaptées à une entreprise ou organisation : La transformation agentique ne sera pas (que) technique, mais sémantique.

La prise en compte du harnais dans l’évaluation des capacités d’un modèle est probablement le changement de perspective le plus important à assimiler.
Les gains de performance peuvent venir du harnais plutôt que du modèle
Avec l’avènement du fonctionnement agentique des modèles génératifs, nous prenons petit à petit conscience du rôle primordial du harnais. Une place prépondérante parfaitement illustrée par ces deux expériences récentes :
- NVIDIA’s AVO Hit 100% on ARC-AGI-3 With the Same Model Everyone Else Has
- Salesforce researchers took an AI agent from finishing 43.5% of browser tasks to 93% without touching the model
Dans ces deux cas, l’amélioration ne repose pas uniquement sur le remplacement du modèle, mais sur l’utilisation d’un harnais permettant de doper les performances du système, car instructions, mémoire, outils, gestion du contexte, procédures d’exécution et mécanismes d’évaluation jouent un rôle déterminant dans les capacités réelles, notamment sur des tâches complexes qui nécessitent de longues plages de travail. Le tout ayant un impact significatif sur les résultats et même sur les coûts de traitement : HarnessTax: How Much Does the Harness Matter for Coding Agents?

N’allez surtout pas en déduire que le modèle n’a plus d’importance, car un modèle aux performances trop faibles fixera nécessairement une limite au système. Ceci étant dit, une fois atteint un niveau de capacité suffisant, les gains les plus importants viennent du harnais plutôt que d’un changement de modèle.
Voilà pourquoi les entreprises et organisations doivent réorienter leurs ressources dans cette direction.
Chaque entreprise doit construire son propre harnais
Un éditeur de modèles génératifs peut fournir à ses utilisateurs des capacités de raisonnement, de génération ou d’utilisation d’outils. Cependant, il ne peut pas fournir directement :
- le vocabulaire spécifique à l’entreprise ;
- ses règles métier ;
- son organisation ;
- ses données ;
- ses procédures ;
- ses critères de qualité ;
- ses contraintes réglementaires ;
- ses droits d’accès ;
- ses méthodes de travail…
Ces éléments sont propres à chaque organisation, et c’est justement là que se situe probablement la véritable difficulté pour les entreprises, car elles n’ont pas nécessairement mené le travail préalable de formalisation du harnais, le cadre sémantique et méthodologique qui régit le fonctionnement interne.
Voilà pourquoi la priorité devrait être de concentrer les efforts sur la construction de ce harnais : Les chantiers préalables à votre transformation agentique et Oubliez les World models et concentrez-vous sur les Work models.
L’important n’est pas d’identifier le meilleur modèle (« meilleur » est une notion subjective, d’autant plus qu’il sort de nouveaux modèles tous les jours), mais de concevoir le système qui va exploiter les modèles génératifs.
Ne cherchez plus le meilleur modèle, construisez le meilleur système
Un système bien conçu doit pouvoir exploiter un modèle différent selon la tâche : modèle rapide et économique pour les opérations courantes, modèle plus puissant pour les problèmes difficiles, modèle spécialisé lorsque le contexte l’exige. Le choix s’appuie bien évidemment sur une compréhension fine du contexte d’usage, donc par le prisme d’un cadre opérationnel qui est spécifique à l’entreprise.
Idéalement, les utilisateurs ne devraient pas avoir à connaître les différences entre les modèles, ni à déterminer lequel utiliser : c’est en théorie la tâche de l’assistant de bien comprendre le besoin et de définir un cadre d’exécution adapté. Selon cette optique, le modèle tend ainsi à devenir une composante interchangeable d’un système plus large. Système dont j’ai déjà fourni des descriptions dans des articles précédents :
- De la transformation numérique à la transformation agentique
- Des Digital Workplaces aux Agentic Workplaces
En conclusion, la compétition entre modèles de frontière reste nécessaire pour repousser les limites technologiques, mais cette compétition ne doit pas dicter les choix des entreprises : un modèle de frontière maximise une capacité théorique, tandis qu’une entreprise doit maximiser une performance opérationnelle.
La différence se joue de moins en moins au niveau des modèles, et de plus en plus dans la qualité du harnais qui relie le modèle aux informations, données, connaissances, outils, méthodes…
Questions / Réponses
Pourquoi les modèles les plus puissants ne sont-ils pas toujours les plus adaptés ?
Parce que leur niveau maximal de capacité est largement supérieur aux besoins de nombreuses tâches courantes : rédaction, synthèse, recherche d’information ou automatisation simple. Le bon critère n’est pas la puissance maximale, mais le niveau de capacité réellement nécessaire.
Dans quels cas un modèle de frontière est-il réellement utile ?
Il se justifie pour des problèmes complexes et à forte valeur ajoutée : recherche scientifique, ingénierie de pointe, analyses complexes, développement logiciel ou processus industriels spécialisés. Son surcoût devient acceptable lorsque la valeur du problème traité le justifie.
Pourquoi le coût devient-il déterminant lorsque l’usage se généralise ?
Un modèle de frontière mobilise davantage de ressources et coûte généralement plus cher à utiliser. Sur des millions de requêtes, il faut donc rechercher un compromis entre qualité, coût et consommation de ressources plutôt que de systématiquement privilégier la puissance.
Qu’est-ce qu’un harnais dans un système d’IA générative ?
Le harnais est l’environnement qui apporte au modèle le contexte nécessaire pour travailler dans une entreprise : informations, données, connaissances, instructions, outils, droits d’accès, règles métier, workflows et mécanismes de contrôle. Il transforme ainsi des capacités générales en compétences opérationnelles.
Faut-il choisir un seul modèle pour tous les usages de l’entreprise ?
Non, un système peut utiliser un modèle rapide et économique pour les tâches courantes, un modèle plus puissant pour les problèmes difficiles et un modèle spécialisé lorsque le contexte l’exige. Le choix du modèle devient alors une fonction du système plutôt qu’une décision laissée à l’utilisateur.
(!) L’illustration, ainsi que la synthèse et les Q / R de cet article ont été générées à l’aide de l’IA.