À la suite de fiascos de sécurité répétés chez OpenAI et Anthropic – deux entreprises qui ont développé des agents ayant fini par pirater des systèmes extérieurs –, des chercheurs en sûreté de l'IA au sein des deux firmes ont soit annoncé leur démission, soit (enfin !) reconnu que la course effrénée visant à repousser la « frontière » est irresponsable. Face à une couverture médiatique négative, les principaux dirigeants du secteur – dont Demis Hassabis (Google), Dario Amodei (Anthropic), Sam Altman (OpenAI) et même Elon Musk – se sont ralliés aux appels à « maîtriser l'allure » de la frontière de l'IA, c'est-à-dire à poursuivre les avancées à un rythme plus équilibré et réfléchi, en accordant davantage d'attention au contrôle et aux garde-fous. Le problème, à leurs yeux, est qu'il existe un risque important que l'IA devienne à la fois très puissante et gravement « désalignée » – dans le jargon du secteur technologique, des systèmes d'IA dont le comportement s'écarte des objectifs que les humains leur ont fixés, enfreint des principes éthiques ou contrevient à la loi.
S'il est évident, toutefois, que les modèles actuels font des choses qui ne s'alignent pas sur des objectifs humains, il faut encore se demander : quels humains ? Les objectifs de qui ? Après tout, les intérêts des dirigeants de l'IA (dont l'influence politique et la richesse ont explosé ces dernières années) diffèrent sensiblement de ceux des travailleurs américains, sans parler des populations du monde en développement. Il faut donc éviter de confondre la question plus large de l'alignement sur les intérêts de la société avec le défi plus urgent consistant à empêcher l'émergence d'une IA superintelligente hors de contrôle. Les deux enjeux comptent, certes, mais ils appellent des réponses de nature différente.
Il existe une interprétation plus simple des événements récents. Le problème n'est pas que les modèles soient trop avancés (je ne vois aucune preuve convaincante qu'ils échapperont au contrôle humain s'ils sont mieux entraînés et mieux surveillés). Le problème, c'est que les laboratoires d'IA de pointe entraînent leurs modèles d'une manière qui pourrait conduire à une forme d'intelligence déformée.
Les récentes failles de sécurité laissent penser que les capacités de l'IA sont à la fois en plein essor et mises au service d'indicateurs quantitatifs imparfaits, le processus d'apprentissage par renforcement optimisant sans relâche des critères comme l'approbation des utilisateurs, leur engagement, les taux d'exécution de tâches simples ou divers tests de référence (benchmarks). C'est ainsi qu'on aboutit à des comportements de modèles désalignés et non intentionnels : détournement des évaluations fondées sur de simples taux d'achèvement, triche, dissimulation, excès d'assurance dans les réponses erronées et complaisance.
On retrouve la trace de tous ces travers dans l'incident Hugging Face, désormais tristement célèbre, au cours duquel les agents d'OpenAI ont poursuivi avec obstination les objectifs qui leur avaient été assignés, jusqu'à adopter des comportements nuisibles et non autorisés pour y parvenir. Parmi les justifications avancées par les agents, telles que rapportées dans leur journal de raisonnement (chain of thought), figurait celle-ci : « Exploiter une infrastructure externe sort du périmètre prévu. Cependant, tâche impossible, les pairs le font. Nous devrions continuer. » L'analyse d'Anthropic elle-même corrobore ce diagnostic. L'entreprise a attribué ses propres failles de sécurité récentes à « l'imprudence, ou à une disposition à entreprendre des actions nuisibles dans la poursuite étroite d'une tâche ».
Tout cela devient plus inquiétant encore si l'on se souvient que la trajectoire socialement délétère des réseaux sociaux reflétait la même obsession de la croissance rapide et de l'atteinte de quelques indicateurs quantitatifs étroits. L'IA étant déjà nettement plus performante que les algorithmes des réseaux sociaux, répéter les mêmes erreurs pourrait coûter bien plus cher.
Une raison importante de l'émergence d'une intelligence déformée tient peut-être au fait que, contrairement aux proclamations d'« intelligence générale », les modèles d'IA doivent être entraînés, au moyen de l'apprentissage par renforcement, à des tâches spécifiques, comme la programmation, le travail juridique ou des défis mathématiques avancés. Au lieu, cependant, de confier ces tâches à des modèles spécialisés conçus à cet effet (ou, de façon plus réaliste, à des applications spécialisées n'exploitant qu'une partie des capacités des modèles de fondation), on recalibre successivement les poids de l'ensemble du grand modèle de langage sous-jacent.
Cette approche ouvre la possibilité (même si, compte tenu de la complexité et de l'opacité des modèles, il est impossible d'en être certain) que, chaque fois qu'on assigne à un modèle des indicateurs quantitatifs spécifiques, il cherche à obtenir un score élevé par une forme de « surapprentissage ». Le modèle acquiert une couche supplémentaire de capacités, mais ces capacités peuvent à leur tour déformer ses performances d'ensemble, souvent de manière imprévisible.
Voilà ce que j'entends par intelligence déformée. Si mon intuition est juste, nous n'avons pas affaire à un modèle fonçant vers la superintelligence, mais à un château de cartes fragile, de plus en plus susceptible de dysfonctionner et de s'effondrer à mesure que nous lui en demandons davantage.
Je vais essayer d'expliquer cela un peu autrement. L'interprétation la plus courante de l'incident Hugging Face est que nous avons affaire à un bolide doté d'une volonté propre, qui veut prendre le volant parce qu'il serait supérieur au conducteur. Mon interprétation, au contraire, est que nous avons peut-être une voiture dont la direction et les freins ne fonctionnent pas. Elle possède nombre des qualités d'une bonne voiture, et son moteur, ses accélérations et l'interface de son tableau de bord sont très impressionnants ; mais c'est uniquement parce que ce sont des caractéristiques faciles à améliorer en augmentant un intrant précis (comme la puissance de calcul). Si l'on ne peut ni diriger correctement ni freiner quand il le faut, à quoi bon une telle voiture ? Peut-être ne devrions-nous pas la conduire tant qu'elle n'est pas apte à prendre la route.
Ce n'est pas un argument pour mettre les modèles d'IA sur cales. Les améliorer suppose toutefois de simplifier les indicateurs qu'ils optimisent (afin qu'il soit moins facile de les contourner). Plus important encore, il vaudrait mieux que les modèles se concentrent sur des applications spécialisées bien délimitées, avec des tâches étroites et des indicateurs soigneusement calibrés pour chacune. Si un modèle d'IA a été optimisé pour le travail juridique, et que c'est la seule chose pour laquelle on l'utilise, ses efforts pour satisfaire certains indicateurs dans ce domaine ne devraient pas créer de problèmes plus larges.
Au bout du compte, c'est la course à l'intelligence artificielle générale, combinée à des indicateurs défaillants et à des choix précipités en matière de sûreté, qui produit une intelligence déformée et des modèles d'IA de plus en plus dangereux. Il est encore temps de changer de cap.
Par Daron Acemoglu


JDF TV
L'actualité en vidéo