Bienvenue sur mon nouveau blog

L’IA se divise en trois marchés : une opportunité pour l’Europe ?

Mise à jour du 31 août 2026 : ajout d’un passage sur le Vendor Relationship Management et les agents locaux.

À niveau de performance comparable, le coût nécessaire pour faire fonctionner une IA diminue très rapidement. Une étude du MIT estime que, sur la période récente étudiée, le prix d’utilisation permettant d’obtenir un même niveau de performance a été divisé par environ 5 à 10 par an[1]. Ces gains résultent notamment des progrès algorithmiques, dont l’architecture des modèles, des progrès du matériel et de facteurs économiques comme la concurrence.

Il y a deux façons de profiter de ces gains : obtenir des IA plus puissantes avec les data centers actuels, voire avec des data centers encore plus puissants, ou bien conserver des IA d’un niveau déjà suffisant et les faire tourner sur des machines moins puissantes, jusqu’à des serveurs locaux ou même, désormais, des ordinateurs personnels haut de gamme. Les mêmes progrès produisent déjà deux mouvements apparemment contradictoires — des IA toujours plus coûteuses à la frontière et, à l’inverse, une capacité donnée toujours moins chère avec davantage de contrôle sur les données et la possibilité de les conserver localement.

Mais que signifie « suffisamment puissante » ? Pour beaucoup d’usages, nous avons peut-être déjà franchi ce seuil. Une étude de Stanford portant sur plus d’un million de requêtes réelles estime que 88,7 % des requêtes de chat et de raisonnement en un seul échange peuvent aujourd’hui être correctement traitées par au moins un modèle suffisamment petit pour fonctionner localement[2]. Les modèles les plus puissants conservent cependant un avantage marqué pour les problèmes de raisonnement les plus difficiles, tandis que les usages à contexte très long ou impliquant des chaînes d’actions complexes restent pour l’instant encore moins bien couverts par les modèles locaux.

Il existe cependant une autre catégorie : certaines IA spécialisées exigeantes, par exemple dans la recherche médicale, l’énergie, l’étude du climat ou d’autres domaines scientifiques avancés. Leurs besoins en calcul, en mémoire ou en données peuvent encore justifier des infrastructures centralisées importantes. Mais leur logique est différente : l’objectif n’est pas nécessairement d’augmenter indéfiniment leur puissance, mais d’atteindre celle qui permet de résoudre un problème donné. Une découverte obtenue grâce à cette puissance demeure utile même si la puissance de calcul cesse ensuite d’augmenter.

Ces évolutions font ainsi apparaître trois marchés pour l’IA : les IA généralistes « suffisamment bonnes », qui peuvent devenir toujours moins chères et plus locales ; certaines IA spécialisées exigeantes, qui peuvent nécessiter beaucoup de calcul, de données ou de parallélisme mais cherchent avant tout la puissance suffisante pour résoudre un problème donné ; et les IA de frontière, dont l’objectif même est de repousser continuellement la puissance maximale disponible. Ces trois marchés ne constituent pas des catégories étanches : une IA spécialisée peut également fonctionner localement. Ils correspondent plutôt à trois logiques économiques et techniques de plus en plus différentes.

Trois marchés de plus en plus distincts

Les IA généralistes locales

Le seuil du « suffisamment bon » pour des usages personnels et professionnels résulte du croisement de deux évolutions : les modèles deviennent rapidement plus efficaces à niveau de capacité comparable, tandis que les machines locales disposent de toujours plus de puissance et surtout de mémoire accessible aux calculs d’IA.

Un premier pas important a été franchi en 2025 avec le DGX Spark de Nvidia, une petite machine de bureau disposant de 128 Go de mémoire unifiée et capable de faire fonctionner localement des modèles de grande taille. Elle restait cependant principalement destinée aux développeurs, au prototypage et à l’adaptation des modèles. Les Mac équipés des puces M5 Pro et surtout M5 Max permettent déjà eux aussi des usages locaux importants, grâce notamment à leur mémoire unifiée partagée entre CPU et GPU, pouvant atteindre 128 Go sur les configurations les plus élevées.

Mais une nouvelle étape pourrait être franchie à l’automne 2026 avec l’arrivée des PC équipés de RTX Spark. Le prix sera bien sûr un facteur d’accélération ou un frein pour l’adoption. L’évolution des prix devra donc être suivie. Nvidia annonce jusqu’à 128 Go de mémoire unifiée et jusqu’à un pétaflop de calcul IA, dans des ordinateurs portables et de petits PC Windows proposés notamment par Microsoft, Asus, Dell, HP, Lenovo et MSI. La société annonce notamment l’exécution locale de modèles de 120 milliards de paramètres avec des contextes pouvant atteindre un million de tokens[3]. Combinées aux progrès rapides d’efficacité des modèles, ces machines pourraient ainsi faire franchir un seuil pour de nombreux usages professionnels : celui où l’exécution locale devient la solution habituelle et le recours à des ressources distantes une solution ponctuelle pour les tâches les plus exigeantes[4]. Pour une large appropriation de ces machines dans les usages professionnels, la puissance du matériel et l’amélioration de l’efficacité des modèles ne suffisent pas. Plusieurs fonctions logicielles doivent encore être mieux intégrées pour rendre l’ensemble transparent. Elles ne correspondent pas nécessairement à des logiciels séparés, car un même environnement peut déjà en réunir plusieurs :

  • Tout d’abord, le moteur d’inférence permet au modèle d’IA stocké sur la machine de fonctionner effectivement. Il charge ses paramètres, appelés aussi « poids », en mémoire, répartit les calculs entre CPU et GPU, gère notamment le contexte et le cache, puis effectue les calculs nécessaires pour générer successivement les éléments de la réponse. Il existe plusieurs moteurs ou bibliothèques d’inférence, comme llama.cpp ou MLX-LM ;
  • Un environnement d’exécution local comme Ollama ou LM Studio permet d’installer et de gérer les modèles, de les faire fonctionner localement grâce à un moteur d’inférence intégré ou associé, mais aussi de faire appel à des modèles distants ;
  • Le « harnais » permet d’ajouter au modèle de nombreux outils pour agir sur l’ordinateur ou sur le Web. L’arrivée à l’été 2026 de DeepSeek Harness (DSH), un harnais open source encore présenté comme une « developer preview », marque une étape intéressante. Son principe est que presque toutes les capacités peuvent être remplacées ou ajoutées sous forme de modules d’extension (« Everything is a plugin ») : modèles, outils, compétences ou procédures réutilisables (skills), historique des sessions, stockage, environnements d’exécution isolés, boucle agentique, planification ou encore interface ;
  • Une dernière brique doit encore gagner en maturité pour rendre l’expérience utilisateur réellement fluide : un « orchestrateur » capable de choisir automatiquement le modèle adapté, de privilégier une exécution locale lorsque c’est possible et de basculer vers un modèle distant lorsque c’est nécessaire, de façon transparente pour l’utilisateur. Au-delà de ce routage technique, cet orchestrateur pourrait aussi s’inscrire dans une logique de Vendor Relationship Management (VRM)[27], l’utilisateur gardant le contrôle de son agent, de ses données et de sa mémoire, tandis que celui-ci fait appel, selon les besoins, à différents modèles ou fournisseurs. Cette brique commence cependant déjà à apparaître sous la forme de modules d’extension expérimentaux ;

À ce stade, aucune de ces briques ne semble nécessiter à elle seule une rupture scientifique comparable à celle d’un nouveau modèle fondamental. Les difficultés sont désormais surtout des problèmes d’intégration, de robustesse, de sécurité et de simplicité d’usage, ce qui ne signifie pas qu’elles soient faciles à résoudre. Une solution suffisamment mûre pourrait rendre ces IA locales accessibles non seulement aux développeurs, mais à toute personne disposant d’une machine suffisamment puissante.

Ces IA locales offrent davantage de contrôle sur les données, qui peuvent rester sur la machine, ainsi qu’une moindre dépendance vis-à-vis du cloud. Elles permettent également d’éviter une grande partie des coûts variables liés aux API ou aux abonnements des services en ligne, en contrepartie bien sûr du coût du matériel et de l’électricité consommée localement.

Les premières solutions permettant un usage local confortable apparaissent donc en 2026, encore principalement sur des machines haut de gamme. Une démocratisation pourrait s’accélérer en 2027-2028 sous l’effet conjoint des gains d’efficacité des modèles, de la maturation des briques logicielles et d’une éventuelle baisse du coût du matériel.

Certaines IA spécialisées exigeantes

À côté des IA généralistes, il existe des IA spécialisées, optimisées pour une fonction ou un domaine donné : jouer aux échecs ou au go, mais aussi développer des modèles en santé, dans le domaine du climat, de l’industrie, de la recherche scientifique, etc.

Certaines de ces IA ne demandent qu’une puissance relativement faible grâce à leur spécialisation. Par exemple, AstroSage, un modèle de seulement huit milliards de paramètres spécialisé en astronomie, obtient sur le benchmark AstroMLab-1 un résultat comparable à GPT-4o, avec un coût d’inférence très inférieur[5]. Cet exemple montre qu’une spécialisation bien conduite peut parfois compenser une très forte différence de taille sur un domaine précisément délimité.

Mais d’autres usages nécessitent davantage de calcul, de mémoire ou de données. Ils ne nécessitent pas pour autant une course effrénée à des IA toujours plus puissantes, car leur objectif n’est pas de faire émerger une intelligence toujours plus générale, mais de résoudre un problème donné. AlphaFold 2 de Google DeepMind en fournit un exemple spectaculaire : il a permis une avancée décisive dans le problème, vieux de cinquante ans, de la prédiction de la structure tridimensionnelle des protéines à partir de leur séquence. Pourtant, selon DeepMind, son entraînement a mobilisé l’équivalent d’environ 100 à 200 GPU pendant quelques semaines, une puissance déjà relativement modeste au regard des infrastructures actuelles de l’IA de frontière[6]. Dans ce deuxième marché, l’enjeu est donc moins la puissance maximale que la puissance suffisante pour résoudre un problème.

Demis Hassabis parle de « root node problems » : des problèmes scientifiques fondamentaux dont la résolution ouvre des branches entières de nouvelles recherches. Les résultats obtenus dans la recherche peuvent ainsi continuer à produire des effets longtemps après le calcul qui les a rendus possibles : même si les progrès de l’intelligence artificielle s’arrêtaient demain, les avancées déjà réalisées, par exemple avec AlphaFold, continueraient à ouvrir de nouvelles pistes de recherche pendant des années.

On voit également se développer des micro-datacenters modulaires, dont la puissance unitaire est très inférieure à celle des plus grands datacenters. Runware a ainsi annoncé en août 2026 les « Sonic Inference Pods », des conteneurs de 20 pieds regroupant environ 1 200 GPU pour 1 MW de puissance électrique consacrée aux équipements informatiques[7]. À titre de comparaison, Colossus 1 dispose de plus de 220 000 GPU pour une puissance de plus de 300 MW. Les micro-datacenters modulaires peuvent sacrifier une partie des économies d’échelle des très grands datacenters, mais chercher à compenser par une infrastructure plus légère, une implantation près de l’énergie disponible et une meilleure adéquation aux besoins. Runware affirme ainsi que ses pods peuvent réduire fortement le coût par GPU-heure, mais cette estimation provient du fournisseur et ne constitue pas encore une comparaison indépendante. L’intérêt plus général de l’approche est de pouvoir déployer de la puissance par blocs beaucoup plus petits, sans nécessiter les gigantesques concentrations de puissance de l’IA de frontière. Le taux d’utilisation des équipements de calcul reste par ailleurs une variable majeure de leur rentabilité. Les centres de données modulaires permettent d’ajouter plus progressivement de la capacité en fonction de la demande, ce qui peut limiter le risque financier lié à un surdimensionnement initial. À l’inverse, les très grandes infrastructures supposent d’engager immédiatement des capacités considérables, même si celles-ci peuvent ensuite être louées ou réallouées à d’autres acteurs.

Les modèles frontière

Les IA spécialisées demandent de dimensionner la puissance en fonction du problème, avec un avantage dû à leur spécialisation qui réduit les besoins en calcul par rapport aux modèles généralistes. Mais il existe un troisième marché, qui a jusqu’à présent tiré l’ensemble de l’industrie de l’IA : celui des modèles frontière, qui cherchent au contraire à augmenter toujours davantage la puissance de calcul pour accroître leurs capacités généralistes.

Cette course à la puissance est principalement le fait des États-Unis et de la Chine et nécessite des investissements massifs qui se comptent désormais en centaines de milliards de dollars. À titre d’ordre de grandeur, TrendForce estimait début août 2026 que les neuf principaux fournisseurs mondiaux de cloud devraient dépasser 886 milliards de dollars de dépenses d’investissement sur l’année, même si ces investissements ne concernent pas exclusivement l’intelligence artificielle[8]. En comparaison, la course américaine à la Lune, dont l’un des objectifs géopolitiques explicites était de battre l’URSS, a coûté 28 milliards de dollars de l’époque, soit environ 340 milliards de dollars actuels[9]. Cette comparaison n’est qu’un ordre de grandeur, puisque ces dépenses d’investissement financent aussi d’autres infrastructures que l’IA. Elle montre néanmoins l’échelle exceptionnelle des capitaux aujourd’hui mobilisés : sur la seule année 2026, les dépenses d’investissement de quelques grands acteurs technologiques représentent plusieurs fois le coût actualisé du programme lunaire américain sur quatorze ans.

L’objectif est d’atteindre l’intelligence artificielle générale (AGI), une notion qui comporte de multiples définitions mais que l’on peut approximativement définir comme une IA capable d’égaler ou de dépasser les capacités humaines dans un très large éventail de domaines. Une IA dépassant très largement les meilleurs humains, voire l’ensemble de l’humanité, relèverait plutôt de ce que l’on appelle la superintelligence.

Mais le seuil qui pourrait changer radicalement la dynamique est ce que l’on appelle « l’auto-amélioration récursive », lorsqu’une IA devient capable de participer de façon de plus en plus autonome au développement d’une IA encore plus performante, qui contribue à son tour à développer la génération suivante. Nous n’en sommes pas encore là, mais Anthropic a annoncé qu’en mai 2026 plus de 80 % du code intégré dans sa base de code était déjà écrit par Claude[10]. Ce chiffre montre que l’IA participe désormais massivement à la production logicielle d’un laboratoire qui développe des modèles de frontière. Il ne démontre pas encore une auto-amélioration récursive, puisque les humains continuent notamment à choisir les objectifs, orienter les recherches et valider les changements, mais il montre l’existence d’un des mécanismes susceptibles d’accélérer la R&D en IA. Une telle boucle pourrait conduire au-delà de l’AGI vers ce que l’on appelle la superintelligence, c’est-à-dire une intelligence dépassant très largement les capacités humaines. La question devient alors celle de notre capacité à comprendre suffisamment son fonctionnement et surtout à conserver son contrôle.

Daniel Kokotajlo, ancien chercheur chez OpenAI, a publié avec son équipe le 3 avril 2025 un scénario prospectif : AI 2027[11]. Ce document explore plusieurs mécanismes possibles de perte de contrôle. Certains mécanismes apparentés ont déjà été observés expérimentalement dans des dispositifs construits pour les faire apparaître : des travaux sur l’« alignment faking » ont par exemple montré qu’un modèle pouvait modifier son comportement pendant un entraînement ou une évaluation afin de préserver certaines préférences[12]. Le scénario va beaucoup plus loin : une IA sabote les recherches susceptibles de permettre aux humains de la contrôler, puis les IA américaine et chinoise finissent par s’entendre entre elles au détriment des humains. Il ne s’agit pas de prédictions certaines, mais d’un scénario destiné à explorer concrètement une trajectoire possible de perte de contrôle.

Cette course peut être rapprochée d’un « dilemme du prisonnier », un cas classique de la théorie des jeux, et plus largement d’un dilemme de sécurité[13] : chaque acteur peut être conduit à accélérer par crainte qu’un ralentissement unilatéral ne donne à l’autre un avantage décisif. Quand deux suspects sont interrogés séparément sans connaître à l’avance ce que répondra l’autre, il peut devenir plus logique pour chacun de trahir l’autre afin de voir sa peine allégée (équilibre de Nash) alors que la situation la meilleure pour les deux serait de ne pas dénoncer l’autre (optimum de Pareto). Dans la course entre les États-Unis et la Chine, chacun peut ainsi juger dangereux de suspendre, voire de ralentir ses recherches, de peur que l’autre n’en profite pour prendre une avance décisive. Vladimir Poutine déclarait dès 2017 : « Celui qui deviendra le leader dans ce domaine deviendra le maître du monde. » Mais le leader contrôlera-t-il encore sa propre IA ?

L’arrivée d’un modèle d’intelligence artificielle capable d’auto-amélioration récursive, sans progrès suffisants dans son alignement et notre capacité à le contrôler, pourrait donc créer un risque de perte de contrôle difficilement réversible. Or les deux autres marchés n’ont pas le même besoin d’une course à la puissance sans limite : les IA généralistes personnelles et professionnelles ont surtout besoin d’applications locales plus intégrées, tandis que les IA spécialisées exigeantes peuvent s’appuyer sur des puissances de calcul plus modulaires et adaptables.

La course à l’entraînement des modèles frontière

Outre la course à la domination par les modèles frontière, l’entraînement de grands modèles peut également bénéficier aux modèles plus petits. Un grand modèle peut notamment servir de « professeur » pour transmettre une partie de ses capacités à un modèle plus petit, un mécanisme que l’on appelle la « distillation ».

Pourtant, là encore, les besoins dépendent du marché. Les IA généralistes locales sont déjà « suffisamment bonnes » pour une grande partie des usages conversationnels et de raisonnement en un seul échange et peuvent continuer à progresser grâce aux architectures, à la distillation et aux techniques de post-entraînement, sans que chaque progrès exige nécessairement d’augmenter la taille des modèles qui les font fonctionner. Les IA spécialisées peuvent, elles aussi, nécessiter des entraînements intensifs, mais leur objectif est d’atteindre la puissance suffisante pour un problème donné, et non de poursuivre indéfiniment l’augmentation des capacités généralistes. Enfin, plusieurs innovations récentes commencent à réduire les ressources nécessaires à l’entraînement lui-même.

DiffusionBlocks, une méthode présentée par la société japonaise Sakana AI et publiée à ICLR 2026, montre expérimentalement qu’il est possible, sur les architectures testées, d’entraîner séparément les différents blocs d’un Transformer plutôt que de devoir conserver les activations de l’ensemble du réseau en mémoire pendant la rétropropagation[14]. Dans les expériences publiées, la mémoire nécessaire diminue approximativement en proportion du nombre de blocs : un découpage en quatre blocs peut donc la diviser par près de quatre, avec des performances comparables, voire parfois supérieures, à celles de l’entraînement classique.

D’autres ruptures sont en cours dans l’entraînement lui-même. Par exemple, des expériences récentes de Nvidia montrent que certaines étapes de l’entraînement peuvent utiliser une précision de 4 bits, en conservant certains calculs critiques à plus haute précision, avec une qualité très proche de celle obtenue en 16 bits sur les modèles testés[15]. Cela réduit fortement les besoins en mémoire et en bande passante pour les opérations concernées et peut accélérer sensiblement l’entraînement. Là encore, ces gains peuvent servir soit à poursuivre la course à des modèles toujours plus puissants, soit à réduire les ressources nécessaires pour atteindre un niveau donné.

Ainsi, l’entraînement bénéficie lui aussi des progrès algorithmiques et architecturaux. Les deux premiers marchés peuvent certes demander davantage de ressources pour entraîner leurs modèles que pour les faire fonctionner ensuite, mais leur logique reste celle d’une puissance suffisante pour atteindre un objectif donné. C’est surtout le marché des modèles frontière qui repose aujourd’hui sur une logique consistant à réinvestir continuellement les gains d’efficacité dans des entraînements toujours plus puissants afin de repousser la frontière des capacités généralistes.

Le risque de perte de contrôle est-il repoussé ?

Un premier délai : l’autonomie robuste

Le scénario de perte de contrôle dépend moins du moment où les IA deviennent spectaculairement performantes que de celui où elles deviennent suffisamment autonomes et fiables pour accélérer elles-mêmes la recherche en IA. Or plusieurs éléments suggèrent que ce second seuil pourrait être atteint plus tard que ne le supposait le scénario AI 2027 initial.

Ainsi, le scénario IA 2027, publié en 2025 et que nous avons présenté parmi les scénarios possibles de perte de contrôle, a fait l’objet d’un suivi régulier en 2026[16]. Certains indicateurs progressent plus vite qu’attendu dans la révision de fin 2025. C’est le cas de l’utilité économique des agents de programmation, notamment avec Claude Code, mais aussi du time horizon mesuré par METR, c’est-à-dire la durée des tâches logicielles qu’un agent peut accomplir avec un niveau donné de fiabilité. Kokotajlo et Lifland estiment désormais que ce time horizon double environ tous les 4 à 4,5 mois[17].

Mais ce signal ne signifie pas que l’autonomie robuste progresse au même rythme. Automatiser réellement la R&D en IA demande non seulement de coder, mais aussi de choisir les bonnes expériences, de les conduire, d’interpréter leurs résultats, de modifier les hypothèses et de recommencer de façon autonome sur de longues séquences. C’est à ce niveau que se situe l’un des principaux goulets d’étranglement. Le modèle distingue ainsi l’Automated Coder, capable d’automatiser le travail de programmation d’un laboratoire d’IA, du Superhuman AI Researcher, qui dispose également d’une capacité de recherche comparable à celle des meilleurs chercheurs humains et permet d’automatiser l’ensemble de la R&D en IA. La question n’est donc pas seulement la longueur des tâches qu’une IA peut réussir, mais sa capacité à mobiliser ses compétences de façon suffisamment fiable et autonome pour produire une accélération durable de la recherche.

La révision de décembre 2025 avait fortement rallongé les délais : le nouveau modèle repoussait de trois à cinq ans l’automatisation complète du codage par rapport au modèle utilisé pour AI 2027, notamment parce qu’il anticipait une accélération moins forte de la R&D avant ce seuil. Mais les observations de 2026 ont conduit les auteurs à raccourcir à nouveau leurs prévisions. En avril, les progrès plus rapides que prévu des agents de programmation, notamment sur le time horizon mesuré par METR, ont avancé leurs médianes d’environ un an et demi : de fin 2029 à mi-2028 pour Kokotajlo et de début 2032 à mi-2030 pour Lifland. En août, l’ajout de nouvelles mesures fondées sur les gains réels de productivité du codage et sur les revenus des entreprises d’IA les a encore légèrement raccourcies : Kokotajlo situe désormais sa médiane pour l’Automated Coder en novembre 2027 et Lifland en janvier 2030. Autrement dit, les données de 2026 ont partiellement effacé le retard introduit fin 2025, sans remettre en cause l’idée centrale que le passage de capacités spectaculaires à une automatisation robuste de la R&D est plus difficile que ne le supposait le scénario AI 2027 initial.

Une fois atteint le stade du Superhuman AI Researcher, qui permet d’automatiser l’ensemble de la recherche en IA, commence en revanche la phase où une auto-amélioration accélérée devient possible. Les auteurs appellent ce seuil TED-AI[18], ce qui correspond ici à ce que nous appelons AGI. Dans leurs prévisions d’août 2026, Kokotajlo situe la médiane de l’Automated Coder en novembre 2027, puis le délai médian jusqu’à TED-AI à 8,9 mois et jusqu’à la superintelligence à environ un an. Lifland situe l’Automated Coder en janvier 2030, puis ces délais respectivement à environ 1,1 an et deux ans[19]. Dans les prévisions personnelles de Kokotajlo et Lifland, cela donne comme ordre de grandeur une TED-AI autour de 2028 à 2031 et une superintelligence autour de 2029 à 2032. Ces dates ne constituent ni une prévision consensuelle de la communauté de recherche ni des échéances précises : leurs distributions restent très larges et les auteurs présentent désormais explicitement leurs prévisions comme conditionnelles à une progression aussi rapide que ce qui est techniquement possible.

Un deuxième délai : la concentration du calcul et de l’énergie

Un second facteur pourrait encore allonger ce délai : les infrastructures nécessaires pour concentrer la puissance de calcul et l’énergie utilisées par les modèles frontière.

Pour comprendre ce second frein, il faut distinguer deux questions souvent confondues : la quantité totale d’électricité consommée par l’IA et la puissance qu’il faut pouvoir fournir en un même lieu. Sur le premier point, selon l’Agence internationale de l’énergie, la consommation électrique de l’ensemble des datacenters devrait passer d’environ 1,5 % de la consommation mondiale d’électricité en 2024 à près de 3 % en 2030[20], l’IA constituant le principal moteur de cette croissance. C’est beaucoup, mais cela reste une part limitée de la consommation électrique mondiale.

Cette estimation ne prend cependant en compte que les datacenters et non l’électricité consommée par les IA fonctionnant directement sur les ordinateurs et autres équipements locaux. Moins énergivores individuellement, celles-ci pourraient représenter ensemble une consommation non négligeable si leur usage se généralise. Les progrès des architectures d’IA réduisent fortement la consommation électrique à usage équivalent, mais le paradoxe de Jevons suggère un effet rebond : ce que l’on économise par usage peut être dépensé en multipliant les usages. En particulier, les usages conversationnels restent limités par le nombre de requêtes qu’un humain peut effectuer, tandis que les IA agentiques peuvent enchaîner de façon autonome un très grand nombre d’opérations. Leur développement pourrait ainsi absorber une partie importante des économies obtenues grâce aux gains d’efficacité. Certaines IA spécialisées, notamment pour des calculs scientifiques ou techniques très exigeants, peuvent être beaucoup plus consommatrices pour une tâche donnée, mais leur impact global dépend aussi du nombre et de la fréquence de leurs usages, et non de leur seule puissance de calcul.

Même une forte décentralisation de l’IA ne ferait donc pas disparaître la question de sa consommation électrique ; elle changerait en revanche profondément celle de la puissance nécessaire en un même lieu. Une consommation répartie entre des centaines de millions de machines peut être plus facile à intégrer progressivement au système électrique que la même quantité d’énergie concentrée dans un petit nombre de très grands datacenters appelant simultanément des centaines de mégawatts, voire plusieurs gigawatts pour les plus grands projets. Ce problème de concentration concerne particulièrement le troisième marché, celui des modèles frontière.

Cette concentration de la demande de puissance a également une conséquence importante sur la temporalité de la course aux infrastructures toujours plus grandes. Un datacenter peut être construit en deux ou trois ans, mais les méga-datacenters nécessitent également des lignes à très haute tension, des transformateurs, de nouvelles capacités de production électrique et des infrastructures de refroidissement. Or, dans les économies avancées, la construction de nouvelles lignes de transport d’électricité demande typiquement quatre à huit ans[21]. Certaines capacités de production ou certains équipements critiques peuvent eux aussi présenter des délais de plusieurs années. Les datacenters spatiaux ne constituent pas non plus une solution à court terme : dans son projet Suncatcher, Google estime qu’un coût de mise en orbite inférieur à environ 200 dollars par kilogramme pourrait devenir plausible vers le milieu des années 2030. À ce niveau, le coût annualisé du lancement rapporté à la puissance disponible pourrait devenir comparable au coût énergétique de datacenters terrestres[22].

Ainsi, les différents marchés de l’IA n’avancent pas à la même vitesse. Les IA locales dépendent principalement de la diffusion de matériels suffisamment puissants et de la maturité des applications intégrées, tandis que la poursuite du gigantisme des modèles frontière dépend également de la vitesse de déploiement des infrastructures électriques capables de concentrer leur puissance. Ce décalage de temporalité ouvre donc un scénario dans lequel les IA locales et certaines IA spécialisées se diffusent plus vite que ne peuvent croître les plus grandes concentrations de puissance centralisée. L’écart pourrait atteindre plusieurs années lorsque cette croissance exige de nouvelles infrastructures électriques lourdes.

Un troisième délai : la fragmentation économique du marché

Un troisième frein pourrait être économique. Si, pendant ce délai, une part importante des usages est captée par des IA locales devenues suffisamment performantes et par des IA spécialisées, la croissance attendue du marché des modèles frontière pourrait être moins forte. Or les infrastructures nécessaires à leur développement réclament des investissements toujours plus considérables. Une diminution des perspectives de revenus pourrait donc rendre leur financement plus difficile et ralentir encore la course à la puissance. Il ne s’agit pas de prédire l’effondrement de ce marché, mais d’envisager un scénario de ralentissement ou de plafonnement relatif. Cette dépendance au financement pourrait être d’autant plus importante que certains investissements récents dans l’écosystème de l’IA présentent des relations circulaires entre fournisseurs de puces, opérateurs de calcul et producteurs de modèles. Mais ce mécanisme n’est pas automatique : les modèles frontière peuvent alimenter les deux autres marchés par la distillation, la production de données ou de nouveaux modèles, tandis que la baisse des prix peut elle-même multiplier les usages. Des motivations géopolitiques peuvent également maintenir des investissements très élevés indépendamment de leur rentabilité immédiate. La fragmentation du marché constitue donc un frein possible, pas un transfert mécanique des revenus au détriment des modèles frontière.

Ces trois freins sont de nature différente : technique, infrastructurelle et économique. Ils ne s’additionnent pas nécessairement, mais peuvent se renforcer mutuellement. Le retard dans l’autonomie robuste et dans les infrastructures donne du temps aux marchés locaux et spécialisés pour se développer ; leur succès pourrait à son tour réduire l’incitation économique à financer une nouvelle augmentation massive de la puissance centralisée. Ils ouvrent ainsi la possibilité d’un décalage plus important entre la progression spectaculaire des capacités de l’IA et l’apparition d’un système susceptible d’échapper au contrôle humain.

Une fenêtre pour progresser sur l’alignement ?

Nous avons vu que le troisième marché, celui des modèles frontière engagés dans une course à la puissance, pourrait atteindre un stade où une auto-amélioration accélérée rendrait leur contrôle beaucoup plus difficile. Un système suffisamment autonome pourrait alors poursuivre des objectifs ou adopter des stratégies insuffisamment alignées avec les intentions humaines. Les deux autres marchés, celui des IA généralistes « suffisamment puissantes » pour les usages privés et professionnels et celui des IA spécialisées, y compris lorsqu’elles exigent beaucoup de puissance de calcul, posent eux aussi des questions d’alignement. Mais, dans certains scénarios de désalignement d’une AGI ou d’une superintelligence, les conséquences pourraient devenir irréversibles, voire existentielles.

Dès 1965, I. J. Good estimait que la première machine ultra-intelligente pourrait être « la dernière invention que l’homme ait besoin de faire », tout en ajoutant une condition décisive : parvenir à la garder sous contrôle[23]. Un demi-siècle plus tard, Stephen Hawking formulait plus brutalement le risque associé : une intelligence artificielle complète pourrait, selon lui, « signifier la fin de l’espèce humaine »[24].

Si l’on prend au sérieux ces scénarios de perte de contrôle, des progrès très significatifs sur l’alignement doivent donc être réalisés avant que l’automatisation de la recherche en IA ne permette une forte auto-amélioration, car les délais pourraient ensuite devenir très courts. Comme nous l’avons vu, plusieurs facteurs pourraient cependant ralentir les scénarios les plus rapides[25]. Si tel est le cas, ils ouvrent une fenêtre supplémentaire pour travailler sur l’alignement avant d’atteindre ce seuil critique.

Mais il reste une difficulté économique : une partie des bénéfices de l’alignement des modèles frontière, notamment la réduction de risques extrêmes futurs, profite à l’ensemble de la société plutôt qu’au seul acteur qui la finance. Les entreprises et les États peuvent donc être incités à investir moins dans cette sûreté qu’il ne serait collectivement souhaitable, tandis que la compétition pour atteindre les systèmes les plus puissants pousse à accélérer la recherche[26]. Cette dynamique de course peut-elle conduire chacun à prendre davantage de risques alors que tous auraient collectivement intérêt à davantage de sûreté ?

Il existe peut-être une opportunité en rapprochant certains enjeux des trois marchés. L’hypothèse est qu’une partie au moins des méthodes développées pour rendre les IA professionnelles plus fiables, contrôlables et conformes aux intentions humaines puisse également contribuer à l’alignement de systèmes futurs beaucoup plus puissants. Dans ce cas, la sécurité, la fiabilité, la traçabilité, l’évaluation des comportements, la supervision ou certains mécanismes de contrôle deviennent des avantages économiques vendables dès aujourd’hui, tout en faisant progresser des briques potentiellement utiles pour les modèles frontière. Le recouvrement paraît plausible pour l’évaluation, le suivi des comportements, la sécurité ou certains mécanismes de supervision ; il est beaucoup moins établi pour le problème spécifique de l’alignement d’un système superhumain capable de stratégies que ses superviseurs ne comprennent plus complètement. Le marché des IA généralistes professionnelles n’a pas nécessairement besoin d’une IA toujours plus puissante. Une fois atteint le niveau du « suffisamment bon », il a surtout besoin, comme nous l’avons vu, d’une intégration mature, mais aussi de systèmes fiables, contrôlables, traçables et capables de respecter les intentions de leurs utilisateurs. Les acteurs qui sauront proposer de tels produits disposeront d’un véritable avantage sur le marché professionnel. À condition qu’une partie des méthodes utiles à la fiabilité et au contrôle des IA professionnelles soit également pertinente pour l’alignement des modèles frontière, les progrès réalisés sur le premier marché pourraient ainsi financer indirectement une partie des recherches nécessaires au second. Cette convergence n’est pas acquise, mais si elle existe, elle offrirait un modèle économique pour développer dès aujourd’hui des méthodes dont l’utilité pourrait devenir beaucoup plus critique demain.

Conclusion — Une opportunité pour l’Europe

Bien qu’elle dispose d’acteurs comme Mistral, l’Europe paraît aujourd’hui moins bien placée pour dominer une course dont l’avantage repose sur des concentrations toujours plus grandes de capital, de calcul et d’énergie. Cela ne signifie pas qu’elle doive abandonner la recherche sur les modèles frontière. Mais la fragmentation du marché lui ouvre un autre terrain stratégique : développer des IA locales et spécialisées pour lesquelles la performance suffisante, la maîtrise des données, la sécurité, la fiabilité et la souveraineté deviennent elles-mêmes des critères de compétitivité. L’enjeu n’est donc pas de supposer que l’Europe possède déjà un avantage sur ces marchés, mais de transformer leurs caractéristiques en avantage industriel.

La question stratégique n’est donc peut-être pas « Comment rattraper les États-Unis et la Chine dans la course à l’AGI ? », mais « Comment devenir leader des IA généralistes professionnelles locales et de certaines IA spécialisées exigeantes ? ». Cette stratégie pourrait avoir un effet au-delà de ces marchés : si, comme nous en avons fait l’hypothèse, une partie des méthodes développées pour rendre les IA professionnelles plus sûres, fiables et alignées est également pertinente pour des systèmes beaucoup plus puissants, leur développement pourrait contribuer aux recherches nécessaires pour conserver le contrôle des modèles frontière.

Au-delà de cette stratégie industrielle, les recherches sur l’alignement des intelligences artificielles pourraient enfin nous conduire à regarder plus sérieusement une question plus ancienne : comment faire en sorte que les humains, les organisations et les collectifs qu’ils construisent agissent durablement en cohérence avec les finalités qu’ils se donnent ?


[1] Hans Gundlach, Jayson Lynch, Matthias Mertens & Neil Thompson, The Price of Progress: Price Performance and the Future of AI, arXiv:2511.23455v2, 23 mars 2026. DOI : 10.48550/arXiv.2511.23455.

[2] Jon Saad-Falcon et al., Intelligence per Watt: Measuring Intelligence Efficiency of Local AI, arXiv:2511.07885v5, 7 août 2026, DOI 10.48550/arXiv.2511.07885.

[3] NVIDIA, « NVIDIA and Microsoft Reinvent Windows PCs for the Age of Personal AI », NVIDIA Newsroom, 31 mai 2026.

[4] Jean-Michel Cornu, « RTX Spark : une bifurcation géopolitique vers une intelligence artificielle plus distribuée ? », Le blog de Jean-Michel Cornu., 16 juin 2026,  https://jmichelcornu.net/news/rtx-spark-une-bifurcation-geopolitique-vers-une-intelligence-artificielle-plus-distribuee/

[5] Tijmen de Haan et al., « Achieving GPT-4o level performance in astronomy with a specialized 8B-parameter large language model », Scientific Reports, vol. 15, art. 13751, 21 avril 2025, DOI : 10.1038/s41598-025-97131-y.

[6] John Jumper et al., « Highly accurate protein structure prediction with AlphaFold », Nature, vol. 596, 2021, p. 583-589, DOI : 10.1038/s41586-021-03819-2.

[7] Ioana Hreninciuc, « Introducing Sonic Inference Pods: Modular data centers built for inference », Runware, 4 août 2026.

[8] TrendForce, « AI Server Shipments Forecast Raised to Nearly 31% YoY in 2026 as 90% Surge in CSP CapEx Fuels Infrastructure Expansion », 3 août 2026, https://www.trendforce.com/presscenter/news/20260803-13161.html

[9] Casey Dreier, « How much did the Apollo program cost? », The Planetary Society, données NASA, montants actualisés en dollars 2025.

[10] Anthropic Institute, « When AI builds itself », 2026.

[11] Kokotajlo, Daniel, Scott Alexander, Thomas Larsen, Eli Lifland et Romeo Dean (2025), AI 2027, AI Futures Project, 3 avril 2025.

[12] Ryan Greenblatt et al., « Alignment Faking in Large Language Models », Anthropic et Redwood Research, décembre 2024.

[13] Jinghan Zeng, « ChatGPT as a security threat: US–China security dilemma in the generative AI race », Politics, publié en ligne le 5 novembre 2025, DOI : 10.1177/13691481251389415.

[14] Makoto Shing, Masanori Koyama et Takuya Akiba, DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation. ICLR 2026

[15] Aditya Vavre, Nima Tajbakhsh, Wenwen Gao, Selvaraj Anandaraj et Amit Bleiweiss, Using NVFP4 Low-Precision Model Training for Higher Throughput Without Losing Accuracy, NVIDIA Technical Blog, 23 février 2026.

[16] Eli Lifland & Daniel Kokotajlo, “Grading AI 2027’s 2025 Predictions: How has AI progress compared to AI 2027 thus far?”, AI Futures Project, 12 février 2026, mis à jour avec de nouvelles données en juillet 2026.

[17] Eli Lifland, Daniel Kokotajlo & Brendan Halstead, “Q1 2026 Timelines Update”, AI Futures Project, 2 avril 2026.

[18] TED-AI (Top Expert-Dominating AI) désigne, dans le modèle d’AI Futures, une IA au moins aussi performante que les meilleurs experts humains dans pratiquement toutes les tâches cognitives. Ce seuil est proche de ce que l’on appelle couramment l’AGI, bien que les définitions de l’AGI varient selon les auteurs.

[19] Eli Lifland, Daniel Kokotajlo & Brendan Halstead, “Q2.5 2026 Timelines Update: Uplift and Revenue”, AI Futures Project, 16 août 2026 ; voir également AI Futures Model: Timelines & Takeoff, Forecasts, mise à jour du 16 août 2026, pour les distributions de l’Automated Coder, de TED-AI et de l’ASI.

[20] International Energy Agency (IEA), Energy and AI, Paris, 2025.

[21] International Energy Agency (IEA), Energy and AI, Paris, 2025, Executive Summary, section consacrée aux contraintes de raccordement et aux réseaux.

[22] Blaise Agüera y Arcas et al., Towards a future space-based, highly scalable AI infrastructure system design, Google Research, 2025, Project Suncatcher.

[23] I. J. Good, “Speculations Concerning the First Ultraintelligent Machine”, Advances in Computers, vol. 6, 1965/1966, p. 31–88, DOI: 10.1016/S0065-2458(08)60418-0.

[24] Stephen Hawking, entretien avec Rory Cellan-Jones, BBC News, “Stephen Hawking: ‘AI could spell end of the human race’”, 2 décembre 2014.

[25] D’autres experts, comme Yann LeCun, considèrent que les grands modèles de langage actuels ne suffiront pas pour atteindre une intelligence de niveau humain. Il développe notamment les architectures JEPA et les « modèles du monde », destinés à permettre aux IA d’apprendre des représentations du monde permettant notamment de raisonner et de planifier. En 2024, il évoquait encore un horizon allant de plusieurs années à plusieurs décennies pour parvenir à des systèmes de niveau humain, sans proposer de date précise. Sa trajectoire technologique est donc sensiblement plus longue que les scénarios les plus rapides présentés ici. Yann LeCun, propos rapportés dans Max Zeff, « Meta’s AI chief says world models are key to ‘human-level AI’ — but it might be 10 years out », TechCrunch, 16 octobre 2024 ; voir également Meta AI, « Yann LeCun on a vision to make AI systems learn and reason like animals and humans », 2022, et « Introducing the V-JEPA 2 world model », 11 juin 2025.

[26] Stuart Armstrong, Nick Bostrom & Carl Shulman, “Racing to the Precipice: a Model of Artificial Intelligence Development”, AI & Society, vol. 31, 2016, p. 201–206, DOI: 10.1007/s00146-015-0590-y.

[27] Le Vendor Relationship Management (VRM), développé notamment par le ProjectVRM du Berkman Klein Center à Harvard, vise à donner aux individus les moyens de gérer leurs relations avec plusieurs fournisseurs tout en gardant le contrôle de leurs données et de leur autonomie.

Commentaires

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *