Histoire de l’IA · 6 min de lecture

Frederick Jelinek et IBM : le jour où la statistique a battu la grammaire

Dans les années 1970, une équipe d’IBM a cessé d’écrire des règles de grammaire pour estimer des probabilités sur des données. Son chef, Frederick Jelinek, avait voulu devenir linguiste. Sa méthode a donné le « modèle de langage » dont descendent les LLM.

Portrait de Frederick Jelinek, photographie d’archive
Frederick Jelinek. Centre IBM de Yorktown Heights, 2008 : photo Simon Greig, CC BY 2.0

Quand on m’explique qu’un LLM « prédit le mot suivant », je pense à un groupe d’ingénieurs d’IBM qui, dans les années 1970, a cessé d’écrire des règles de grammaire pour compter des mots. Leur chef s’appelait Frederick Jelinek. Il avait voulu devenir linguiste.

On le connaît pour une boutade sur les linguistes. Son histoire est surtout celle d’une méthode qui a gagné parce qu’elle mesurait ses erreurs.

Un ingénieur qui voulait devenir linguiste

Bedřich Jelínek naît en 1932 en Tchécoslovaquie. Selon Jan Hajič, sa famille vit à Kladno, près de Prague ; son père meurt à Theresienstadt à la fin de la guerre. Après le coup communiste de 1948, sa mère émigre avec lui à New York. Il entre ensuite au MIT et y obtient en 1962 un doctorat en théorie de l’information, la discipline fondée par Claude Shannon.

Le détail que je préfère vient de son propre récit, publié en 2009 dans la revue Computational Linguistics (« The Dawn of Statistical ASR and MT »). Au début des années 1960, sa femme Milena suit des cours de linguistique au MIT, dont plusieurs donnés par Noam Chomsky. Jelinek l’accompagne et a, écrit-il, « l’idée folle » de passer de la théorie de l’information à la linguistique. Son directeur de thèse, Robert Fano, s’y oppose. À Cornell, le linguiste Charles Hockett lui propose de collaborer, puis préfère composer des opéras. Jelinek reste dix ans en théorie de l’information.

1972 : IBM se lance dans la parole continue

En 1972, il passe l’été chez IBM, à Yorktown Heights, et prend la direction du nouveau groupe de reconnaissance de la parole continue. La raison du projet était prosaïque : IBM craignait que les ordinateurs deviennent assez puissants pour tous les besoins, et la parole promettait de consommer beaucoup de calcul.

La direction estime que le groupe aura besoin de linguistes et en détache trois. Quand il faut modéliser l’anglais naturel, l’un d’eux, Stan Petrick, rassure l’équipe : « Ne vous inquiétez pas, je vais juste faire une petite grammaire. » Selon Jelinek, il ne l’a jamais faite.

Ce choix va à contre-courant : en 1969, rappelle Mark Liberman, John Pierce, des Bell Labs, comparait la reconnaissance de la parole aux projets pour « transformer l’eau en essence ».

La méthode : un canal bruité et des probabilités

L’équipe d’IBM formule la reconnaissance de la parole comme un problème de transmission. Un locuteur veut dire une suite de mots ; le signal acoustique en est une version brouillée ; la machine doit retrouver la suite de mots la plus probable. Elle cherche la phrase qui maximise le produit de deux probabilités, ce qui donne trois briques :

  1. Le modèle acoustique : la probabilité d’observer ce signal si telle phrase a été prononcée.
  2. Le modèle de langage : la probabilité, avant d’entendre quoi que ce soit, que le locuteur dise cette phrase.
  3. La recherche : un algorithme qui parcourt les phrases possibles pour trouver la meilleure.

Jelinek précise que les termes « modèle acoustique », « modèle de langage » et « perplexité » ont été inventés chez IBM. Vers 1978, pour un système de dictée de 5 000 mots baptisé Tangora, l’équipe modélise l’anglais par des trigrammes, sur une suggestion de John Cocke : la probabilité de chaque mot dépend des deux mots qui le précèdent. Ces probabilités sont estimées sur des textes, pas fixées à la main.

La boutade, et ce qu’elle dit vraiment

La phrase circule sous la forme « Every time I fire a linguist, the performance of the speech recognizer goes up ». Je n’ai trouvé aucune source primaire pour cette formulation exacte. Voici ce qui est documenté :

  • En 2004, dans sa conférence « Some of my Best Friends are Linguists » au congrès LREC, Jelinek affiche lui-même la phrase « Whenever I fire a linguist our system performance improves ». Il l’attribue à sa présentation lors d’un atelier sur l’évaluation des systèmes de traitement du langage, à Wayne, en Pennsylvanie, en décembre 1988.
  • Le compte rendu de cet atelier, publié en 1990, confirme qu’il y a présenté une méthode d’évaluation, mais ne rapporte pas la phrase.
  • D’autres témoins donnent d’autres versions. Roger Moore la situe à un atelier de 1985, avec « phonetician/linguist ». La dédicace des actes du congrès ACL 2011 parle d’un linguiste qui « quitte le groupe ».

La même présentation de 2004 donne le fond de l’affaire. Sur la première tâche d’IBM, un modèle acoustique dont les statistiques étaient estimées par des experts atteignait 35 % de précision. Le même modèle, avec des statistiques estimées automatiquement sur les données, atteignait 75 %. Jelinek ajoute :

My colleagues and I always hoped that linguistics will eventually allow us to strike gold

La boutade ne visait pas la linguistique. Elle visait les paramètres fixés à la main, sans mesure.

De la parole à la traduction, puis aux LLM

En 1987, l’équipe applique la même formule à la traduction automatique. Le français joue le rôle du signal brouillé, l’anglais celui du message d’origine. Les données : les débats bilingues du Parlement canadien. L’article de 1990 signé par Peter Brown, Jelinek et six collègues décrit environ trois millions de paires de phrases extraites de ces débats. Sur 73 phrases de test, 48 % des traductions produites sont jugées acceptables. Jelinek raconte qu’une première soumission à la conférence Coling 1988 avait été refusée, avec ce commentaire d’un relecteur : « The crude force of computers is not science. »

Le système de traduction qui en sort s’appelle Candide. Sur un test interne de 100 phrases courtes, sa version de 1992 en traduit 45 correctement, celle de 1993, 62.

Le lien avec les LLM est direct. Un modèle de langage, au sens d’IBM, estime la probabilité du mot suivant sachant les précédents. En 2008, à Brno, Jelinek le résume encore ainsi devant sa diapositive. Les LLM font la même opération, avec des réseaux de neurones et des milliers de mots de contexte au lieu de deux. Le manuel de Jurafsky et Martin situe d’ailleurs une des racines des LLM dans ce même laboratoire.

Ce que ça change pour une organisation

La victoire de la statistique n’a pas reposé sur une idée plus brillante. Mark Liberman l’écrit dans sa nécrologie : l’apport le plus durable de Jelinek est une façon de travailler, la comparaison de méthodes concurrentes selon des critères chiffrés définis à l’avance, sur les mêmes données d’entraînement et de test. Dans mes missions, j’en tire trois règles.

Rassembler les vrais exemples avant de choisir un outil

IBM a progressé quand elle a remplacé des estimations d’experts par des données. Pour une PME, ce sont les e-mails, demandes clients, devis et tickets réellement reçus. Rassemblez-en un échantillon représentatif, avec la bonne réponse attendue.

Fixer la mesure d’erreur avant de comparer

Taux de bonnes réponses, taux d’erreur, temps de traitement : choisissez la mesure avant de tester, puis appliquez-la à chaque solution sur les mêmes exemples. Sinon, on compare des démonstrations. J’ai détaillé une grille de ce type dans mesurer un assistant IA de support client.

Garder l’expertise métier, au bon endroit

Jelinek n’a jamais renoncé aux linguistes. Il comptait sur eux pour créer des ressources annotées, pas pour régler les paramètres à la main. Dans une PME, c’est pareil : l’expert métier définit les cas, les bonnes réponses et les exceptions. La mesure dit ensuite quelle méthode fonctionne.

Ce que je retiens

La phrase sur les linguistes est restée parce qu’elle est drôle. La leçon est ailleurs : une équipe qui mesure son erreur sur de vrais exemples finit par battre une équipe qui a de meilleures idées mais ne mesure pas. Les LLM sont nés de cette discipline. Les projets IA qui tiennent en entreprise aussi.

Dans la même série

Les autres épisodes des « ancêtres des LLM », par ordre chronologique :

Questions fréquentes

Jelinek a-t-il vraiment dit « Every time I fire a linguist… » ?

La formulation exacte n’est pas établie. En 2004, il affiche lui-même la phrase « Whenever I fire a linguist our system performance improves » et la rattache à un atelier de décembre 1988 à Wayne, en Pennsylvanie. D’autres témoins citent des variantes et d’autres dates.

Qu’est-ce qu’un modèle de langage au sens d’IBM ?

C’est la probabilité qu’un locuteur prononce une suite de mots donnée. IBM l’estime d’abord avec des trigrammes : chaque mot dépend des deux précédents. Le terme a été inventé dans le groupe de Jelinek ; il désigne aujourd’hui les LLM.

Quel est le lien avec la traduction automatique ?

À partir de 1987, l’équipe applique la même formule à la traduction du français vers l’anglais, en apprenant sur les débats bilingues du Parlement canadien. Il en sort l’article fondateur de 1990 puis le système Candide.