Une expérience interactive · d'après Shannon 1948
Le langage est
prévisible.
En 1948, Claude Shannon montre que l'information se mesure, en bits, et que le langage humain — plein de règles, de grammaire et d'habitudes — en contient bien moins qu'il n'y paraît. Le reste est redondance.
Ici, rien n'est simulé. Un vrai modèle statistique est entraîné devant vous sur un corpus, évalué sur un texte qu'il n'a jamais vu, puis utilisé pour compresser, corriger le bruit et prédire le mot suivant — exactement ce que fait un modèle de langage moderne, en plus petit.
L'incertitude, mesurée en bits par lettre
Tout le parcours tient dans cet écart : ce que la structure de la langue vous fait économiser.
Les 11 étapes
Chapitre 1 · §6 du papier
L'information, c'est de la surprise
Un événement certain n'apprend rien ; un événement improbable apprend beaucoup. Shannon reprend l'idée de Hartley et en fait une mesure : l'information apportée par un événement de probabilité p vaut
Faites varier la probabilité
bits d'information
La courbe de l'information
Exemples concrets
Pourquoi un logarithme ?
Shannon donne trois raisons (§ introduction). La décisive : l'information doit être additive. Deux tirages indépendants apportent la somme de leurs informations, alors que leurs probabilités se multiplient.
Seul le logarithme transforme un produit en somme. Le choix de la base 2 fixe l'unité : le bit, mot proposé par J. W. Tukey et employé ici pour la première fois dans un article scientifique.
Chapitre 2 · §6, théorème 2
L'entropie : la surprise moyenne
Si l'on répète l'expérience, l'information moyenne par symbole vaut
Shannon démontre (théorème 2) que c'est la seule mesure possible si l'on exige trois propriétés élémentaires. Écrivez un texte : son entropie se calcule en direct.
Votre texte
Distribution des lettres de votre texte
Le cas à deux issues
figure 7 du papierUne pièce de probabilité p : l'incertitude est maximale à p = 1/2 et nulle aux extrémités.
Entropie
bits / caractèreShannon appelle entropie relative le rapport H / Hmax, et redondance son complément à 1.
Comparaison
Les trois axiomes (théorème 2)
Chapitre 3 · §9, théorème 9
L'entropie est une limite physique
L'entropie n'est pas une métaphore : c'est le nombre de bits qu'il faut, et qu'il suffit, pour transmettre un message. Le théorème 9 encadre la longueur moyenne L̄ du meilleur code :
Vérifions-le en construisant de vrais codes, puis en compressant réellement un texte.
L'exemple du §10
A B C D · p = ½ ¼ ⅛ ⅛Shannon donne ce code dans le papier. Il atteint exactement H = 7/4 bit : les longueurs sont les −log₂ p.
Code de Huffman sur les lettres
Construit sur les fréquences réelles du corpus. Les lettres courantes reçoivent des mots de code courts.
Compression réelle par le modèle
Codage arithmétique piloté par le modèle n-gramme, puis décodage et vérification bit à bit.
Pourquoi cela fonctionne — théorème 3
équipartition asymptotiquePresque toutes les suites longues produites par la source ont la même probabilité 2−NH. Elles forment l'ensemble typique ; il suffit de les numéroter. Chaque point est une suite tirée du modèle.
Chapitre 4
Chaque langue a sa signature
Coder un texte français avec un code optimisé pour l'anglais coûte des bits en trop. Ce surcoût, c'est la divergence de Kullback–Leibler — une distance entre langues exprimée en bits :
Texte à identifier
Votre texte vs profil de référence
Matrice des entropies croisées
Bits/lettre nécessaires pour coder la langue de la ligne avec le code de la colonne. La diagonale est le minimum : c'est l'entropie propre de chaque langue.
Langue détectée
Coût du codage
Bits par lettre pour coder VOTRE texte avec le code de chaque langue. Le moins cher gagne.
Chapitre 5 · §7, théorème 6
Le contexte fait fondre l'incertitude
Shannon définit Fₙ, l'incertitude sur une lettre quand on connaît les n−1 précédentes, et démontre qu'elle décroît vers l'entropie vraie de la langue :
Combien de lettres de contexte ?
Lettre suivante la plus probable
Cliquez une lettre pour l'accepter et continuer.
Fₙ mesurée
L'écart entre les deux courbes est du surapprentissage : sur le texte d'entraînement, le modèle récite.
Carte de prévisibilité — caractère par caractère
Survolez une case pour voir ce que le modèle avait prédit.
Chapitre 6 · §3
Quand le charabia devient du langage
La démonstration la plus frappante du papier : tirer des lettres au hasard selon des statistiques d'ordre croissant. Shannon procédait en ouvrant un livre au hasard pour relever la lettre qui suivait. Nous faisons exactement la même chose, en automatique.
Nos approximations
Les échantillons publiés par Shannon en 1948
§3 — anglaisÀ comparer avec les nôtres, produits par le même procédé soixante-quinze ans plus tard.
Chapitre 7
Prédire le symbole suivant
Voici le geste exact d'un modèle de langage : estimer P(suivant | contexte), en tirer un symbole, l'ajouter au contexte, recommencer. Rien d'autre. Toute la question est de savoir d'où vient cette probabilité.
Avec … mots de corpus, un trigramme seul est aveugle : … des trigrammes y apparaissent deux fois. On combine donc quatre sources d'information, dont les poids sont appris — pas choisis.
Écrivez — tout se recalcule à chaque frappe
La lettre suivante — le socle du modèle
Le mot suivant
Chaque barre est colorée selon l'expert qui a porté ce candidat.
Les quatre experts
Ce que chacun proposerait seul, et le crédit que le réglage lui accorde.
La machine écrit toute seule
Même boucle, mêmes réglages de décodage que dans un modèle de langage.
Prévisibilité de votre texte
↺ mot déjà employé plus haut — le cache le rend meilleur marché. Bordure violette : mot absent du corpus.
Ce que chaque expert apporte vraiment
Étude d'ablation : on ajoute une composante à la fois et on mesure.
Chapitre 8 · Shannon 1951
À votre tour : l'expérience de 1951
Trois ans après le papier fondateur, Shannon mesure l'entropie de l'anglais en faisant deviner à des humains la lettre suivante d'un texte caché. Le nombre d'essais nécessaires encadre l'entropie :
Texte caché
Devinez la lettre suivante
essai 1Vous contre la machine
Performance
deviné du premier coup
Entropie encadrée
Bornes calculées à partir de vos essais.
Shannon obtenait 0,6 à 1,3 bit/lettre pour l'anglais, contre 4,75 pour un alphabet aléatoire.
Essais nécessaires
Chapitre 9 · Partie II, §12
La redondance protège l'information
Jusqu'ici la redondance semblait un gaspillage. Elle est en réalité ce qui rend la communication possible dans un monde bruité. Shannon quantifie l'information perdue par l'équivocation, et la définit comme la capacité du canal :
Transmission bruitée
Chaque lettre est remplacée au hasard avec probabilité p. Le décodeur ne connaît que la langue.
Capacité du canal
Ce qui reste transmissible malgré le bruit. À p = 0 on transmet log₂ V bits ; quand le bruit rend la sortie indépendante de l'entrée, la capacité s'annule.
L'expérience de l'effacement
Shannon (§7) : « si l'on peut restaurer un texte dont on a supprimé la moitié des lettres, la redondance dépasse 50 % ». Vérifions.
Chapitre 10
Du n-gramme à l'intelligence artificielle
Un modèle de langage moderne fait exactement ce que vous venez de voir : minimiser les bits de surprise du symbole suivant. La différence n'est pas de nature, elle est d'échelle — et cette échelle se mesure.
L'échelle des entropies — où en est-on ?
Tout le parcours tient dans ce graphique : chaque barre est le coût réel d'une lettre de texte, mesuré sur du texte inédit. Les trois premières sont calculées ici même, les deux dernières viennent de Shannon (1951) et des modèles de langage actuels.
Plus de données, moins de bits
Entropie sur texte inédit en fonction de la taille du corpus d'apprentissage. Chaque point est un modèle réentraîné en direct. La forme de cette courbe est celle des lois d'échelle des modèles de langage.
Plus de contexte, moins de bits
Le gain s'épuise vite pour un n-gramme : au-delà de quelques lettres, il n'a plus assez d'exemples. C'est précisément la limite que les réseaux de neurones ont franchie.
Le même exercice, confié à une IA
Un vrai modèle de langage reçoit la même phrase. Sa réponse est mise en regard de celle de notre n-gramme, mot pour mot.
Même objectif
L'entraînement d'un LLM minimise l'entropie croisée du token suivant : la quantité exacte que vous avez mesurée au chapitre 5.
Autre échelle
Notre modèle compte des n-grammes sur … caractères. Un LLM généralise sur des milliers de milliards, avec un contexte de dizaines de milliers de tokens.
Même métrique
La perplexité qui classe les modèles aujourd'hui n'est rien d'autre que 2^H, l'entropie de Shannon changée d'unité.
Chapitre 11
Une idée, d'innombrables applications
De la surprise d'un événement isolé jusqu'aux modèles de langage, tout découle d'une seule décision : mesurer l'information en bits.
Ce que ce parcours a mesuré
« La redondance de l'anglais ordinaire, en ne considérant pas de structure statistique au-delà d'environ huit lettres, est approximativement de 50 %. »
— C. E. Shannon, A Mathematical Theory of Communication, §7, 1948
