Affichage des articles dont le libellé est IA. Afficher tous les articles
Affichage des articles dont le libellé est IA. Afficher tous les articles

lundi 7 juillet 2025

The Urgency of Interpretability - Dario Amodei

John Martin - Manfred et la sorcière des Alpes
 

Un autre article très récent (avril 2025) de Dario Amodei, le patron d'Anthropic. Encore une fois, je précise que je n'ai pas d'opinion tranchée sur l'avenir des IA et des LLM. Quel que soit l'avenir de ces technologies, c'est passionnant, comme une injection de SF dans le quotidien. Sur ces mêmes questions, voir AI 2027 et Machines of Loving Grace.

Dans le fabuleux monde des grands modèles de language (LLM), l'interprétabilité consiste à comprendre le fonctionnement interne de ces systèmes. C'est potentiellement un enjeu considérable, car avec la compréhension vient non seulement la possibilité du contrôle, mais aussi de nouvelles opportunités de recherche et de développement.

Dario Amodei souligne que ce manque de compréhension est assez inédit dans l'histoire de la technologie informatique.

If an ordinary software program does something—for example, a character in a video game says a line of dialogue, or my food delivery app allows me to tip my driver—it does those things because a human specifically programmed them in.  Generative AI is not like that at all.  When a generative AI system does something, like summarize a financial document, we have no idea, at a specific or precise level, why it makes the choices it does—why it chooses certain words over others, or why it occasionally makes a mistake despite usually being accurate.  As my friend and co-founder Chris Olah is fond of saying, generative AI systems are grown more than they are built—their internal mechanisms are “emergent” rather than directly designed.  It’s a bit like growing a plant or a bacterial colony: we set the high-level conditions that direct and shape growth, but the exact structure which emerges is unpredictable and difficult to understand or explain.  Looking inside these systems, what we see are vast matrices of billions of numbers

Cette nature émergente rend difficile la prédiction des comportements des IA. 

Au-delà des questions de sécurité, Dario Amodei mentionne que l'interprétabilité permettrait de déterminer si les IA sont de simples pattern-matchers ou des créatures possédant ce qui s'approche d'une conscience. Personnellement, je ne suis pas certain que la frontière soit claire entre les deux : quand un humain converse, les mots ne sont pas choisis par une conscience décidante ; dans une certaine mesure, les mots apparaissent, sont générés, selon des enchainements logiques, probabilistiques. Il en va de même pour la pensée.

La discipline qui consiste à tenter d'ouvrir la boite noire que sont les réseaux de neurones artificiels s'appelle spécifiquement interprétabilité mécaniste. L'auteur en retrace brièvement l'histoire, avant d'évoquer les pistes actuelles qui permettent au domaine de progresser. Je cite quelques passages.

We quickly discovered that while some neurons were immediately interpretable, the vast majority were an incoherent pastiche of many different words and concepts.  We referred to this phenomenon as superposition,  and we quickly realized that the models likely contained billions of concepts, but in a hopelessly mixed-up fashion that we couldn’t make any sense of. The model uses superposition because this allows it to express more concepts than it has neurons, enabling it to learn more.  If superposition seems tangled and difficult to understand, that’s because, as ever, the learning and operation of AI models are not optimized in the slightest to be legible to humans.
The concepts that these combinations of neurons could express were far more subtle than those of the single-layer neural network: they included the concept of “literally or figuratively hedging or hesitating”, and the concept of “genres of music that express discontent”.  We called these concepts features, and used the sparse autoencoder method to map them in models of all sizes, including modern state-of-the-art models.  For example, we were able to find over 30 million features in a medium-sized commercial model (Claude 3 Sonnet).  Additionally, we employed a method called autointerpretability—which uses an AI system itself to analyze interpretability features—to scale the process of not just finding the features, but listing and identifying what they mean in human terms.
Finding and identifying 30 million features is a significant step forward, but we believe there may actually be a billion or more concepts in even a small model, so we’ve found only a small fraction of what is probably there, and work in this direction is ongoing.  Bigger models, like those used in Anthropic’s most capable products, are more complicated still. 
Once a feature is found, we can do more than just observe it in action—we can increase or decrease its importance in the neural network’s processing. The MRI of interpretability can help us develop and refine interventions—almost like zapping a precise part of someone’s brain. Most memorably, we used this method to create “Golden Gate Claude”, a version of one of Anthropic’s models where the “Golden Gate Bridge” feature was artificially amplified, causing the model to become obsessed with the bridge, bringing it up even in unrelated conversations.
L'objectif le plus important de l'interprétabilité étant probablement de pouvoir faire un scan des modèles afin de détecter des "maladies" (des mésalignements) et pouvoir les corriger. 

Une simple phrase pour résumer :
We are thus in a race between interpretability and model intelligence.  

vendredi 27 juin 2025

Machines of Loving Grace - Dario Amodei

John Martin - Les plaines du Paradis
 

Dario Amodei est le CEO d'Anthropic, société fondée après son départ d'OpenAI en 2021. Dans cet essai publié fin 2024, il développe une vision optimiste d'un avenir proche modelé par l'avènement de l'IA puissante, pour reprendre son terme. En somme, selon lui, l'IA puissante permettrait de condenser 100 ans de progrès techniques en 5 à 10 ans.

Il est très tentant de simplement balayer ces propos en n'y voyant rien d'autre que de l'auto-promotion. Ce serait raisonnable. Ceci dit, si jamais on accepte la possibilité du postulat de départ (l'inclusion d'une future IA puissante dans les affaires humaines), j'ai trouvé ses perspectives plutôt sensées et mesurées. Il y a un biais d'optimisme, certainement, mais j'ai apprécié la façon dont il sépare les potentialités de l'IA en deux blocs. D'un côté, il y a la pure science, et ses applications pour le bien-être matériel humain, notamment via la médecine. L'optimisme semble très raisonnable sur ces questions (si on accepte qu'une accélération massive de la croissance n'accélère pas de même le choc avec des limites physiques indépassables). Malgré les doutes idéologiques ou les rejets purement obscurantistes, les humains ont tendance, globalement, à accepter les avancées technologiques qui les arrangent. Ensuite, il y a les questions sociales et sociétales. Là, c'est plus délicat. Dario Amodei confronte ces problèmes sans trop les esquiver :

Unfortunately, I see no strong reason to believe AI will preferentially or structurally advance democracy and peace, in the same way that I think it will structurally advance human health and alleviate poverty. Human conflict is adversarial and AI can in principle help both the “good guys” and the “bad guys”. If anything, some structural factors seem worrying: AI seems likely to enable much better propaganda and surveillance, both major tools in the autocrat’s toolkit. It’s therefore up to us as individual actors to tilt things in the right direction: if we want AI to favor democracy and individual rights, we are going to have to fight for that outcome. I feel even more strongly about this than I do about international inequality: the triumph of liberal democracy and political stability is not guaranteed, perhaps not even likely, and will require great sacrifice and commitment on all of our parts, as it often has in the past. 

Revenons un peu vers les questions purement scientifiques. Le concept de « liberté biologique » m'a beaucoup rappelé la façon dont les membres de la Culture, la société galactique d'abondance développée par Ian Banks, peuvent librement changer de sexe ou synthétiser toutes sortes de drogues directement dans leur corps. D'ailleurs, Iain Banks est clairement une influence majeure, il est fortement cité en conclusion.

De même, l'idée que l'état de base de l'humain moyen pourrait être grandement amélioré. Pourquoi refuser d'augmenter l'occurrence de moments de révélation, d'inspiration, de beauté, d'amour, de paix, etc. ? J'ai retrouvé là un mouvement vers l'impératif hédonistique (bouquin captivant que je recommande chaudement). 

Sur les questions de neuroscience, à peu près tous les problèmes humains seraient compris et soignés, mais je note surtout le rôle potentiel des réseaux neuronaux artificiels. Leur compréhension est un enjeu majeur dans la course après l'alignement des IA, mais l'idée ici est qu'il est bien plus facile de réaliser expériences et observations sur des réseaux neuronaux artificiels que sur leur équivalent charnel, et les gains scientifiques réalisés dans l'artificiel serviraient dans le charnel.

Un concept fascinant : la leçon amère. En gros, historiquement, les chercheurs en IA ont eu tendance à chercher à reproduire les mécanismes de la pensée humaine — ou du moins leurs interprétations nécessairement limitées de la pensée humaine — pour créer des IA. Cette piste, bien que satisfaisante intellectuellement, s'est toujours heurtée à des impasses. Ce qui a prouvé son efficacité, c'est d'exploiter la loi de Moore : la capacité de calcul augmente drastiquement avec le temps, et aucune des tentatives pour répliquer les mécanismes de pensée humaine ne peut rivaliser avec ce développement de la puissance de calcul brute, et l'utilisation de cette puissance de calcul pour permettre au système d'apprendre par lui-même.

The bitter lesson is based on the historical observations that 1) AI researchers have often tried to build knowledge into their agents, 2) this always helps in the short term, and is personally satisfying to the researcher, but 3) in the long run it plateaus and even inhibits further progress, and 4) breakthrough progress eventually arrives by an opposing approach based on scaling computation by search and learning. The eventual success is tinged with bitterness, and often incompletely digested, because it is success over a favored, human-centric approach. 

Une superbe phrase pour résumer cette perspective : « We want AI agents that can discover like we can, not which contain what we have discovered. » 

Dans le cadre légal, l'IA puissante pourrait améliorer grandement l'application de la justice, pas forcément en remplaçant les humains et leurs biais, mais en fournissant aux humains une image aussi parfaite que possible de l'objectivité pure, une simple connaissance de la réalité. 

Le dernier gros morceau, exploré encore une fois par Iain Banks et de nombreux autres auteurs de SF, concerne la question du sens. J'apprécie que Dario Amodei mentionne que le sens vient avant tout du contact humain. Il y aurait tant à dire sur les perspectives qui s'ouvrent ainsi via l'IA puissante, mais il admet aussi que c'est incroyablement difficile à prédire. Après tout, les valeurs humaines ont considérablement changé et évolué dans les millénaires passés. Le fait est que Deep Blue n'a pas empêché les humains de toujours jouer aux échecs.

In any case I think meaning comes mostly from human relationships and connection, not from economic labor. People do want a sense of accomplishment, even a sense of competition, and in a post-AI world it will be perfectly possible to spend years attempting some very difficult task with a complex strategy, similar to what people do today when they embark on research projects, try to become Hollywood actors, or found companies. The facts that (a) an AI somewhere could in principle do this task better, and (b) this task is no longer an economically rewarded element of a global economy, don’t seem to me to matter very much.

Pour finir, j'ai trouvé au milieu de toutes ces grandes idées l'ébauche d'un produit aisément marketable à court terme : un "coach AI" qui connaitrait chaque personne mieux qu'elle même, étudierait nos interactions et fournirait de l'aide au quotidien. C'est, entre autres choses, ce qu'essaient de produire les grosses boites d'IA ces temps-ci, notamment en fantasmant sur un nouvel objet physique qui serait encore plus révolutionnaire (et rentable) que le smartphone.