Mots et langagesDans le dialogue d’impression, choisissez « Enregistrer au format PDF » comme destination.
Retour

Théorie des langages · C1 Fondements · Chapitre 1 · 5 h

Mots et langages

Alphabet, mot, longueur, mot vide ; concaténation, préfixe, suffixe, facteur ; le langage comme ensemble de mots ; union, concaténation, étoile de Kleene ; dénombrer les mots.

Un compilateur, un moteur de recherche, un validateur de formulaire, un correcteur orthographique : tous partagent une même question, posée des milliards de fois par seconde. Une suite de caractères appartient-elle à un ensemble décrit à l'avance — les programmes C corrects, les adresses de courriel valides, les nombres bien formés ?

Répondre à cette question, c'est tout le cours. Mais avant de décider si un mot appartient à un langage, il faut définir avec une précision totale ce qu'est un mot, ce qu'est un langage, et ce qu'on a le droit d'en faire. Ce premier chapitre pose ce vocabulaire. Il paraît élémentaire ; il ne l'est pas, et la moitié des erreurs de l'année viennent d'une définition mal assimilée ici — en particulier celle du mot vide.

Alphabet, mot, longueur

Un alphabet, noté Σ\Sigma, est un ensemble fini et non vide de symboles. Ce ne sont pas forcément des lettres : Σ={a,b}\Sigma = \{a, b\}, Σ={0,1}\Sigma = \{0, 1\}, l'ensemble des caractères ASCII, ou même un ensemble de mots entiers d'un langage de programmation traités comme des symboles uniques.

Un mot (ou chaîne) sur Σ\Sigma est une suite finie de symboles de Σ\Sigma. Sur Σ={a,b}\Sigma = \{a, b\}, abba et aaa sont des mots ; abc n'en est pas un, car c n'appartient pas à l'alphabet.

La longueur d'un mot uu, notée u|u|, est le nombre de symboles qui le composent : abba=4|abba| = 4. On peut aussi compter les occurrences d'un symbole donné : abbaa=2|abba|_a = 2.

Le cas particulier qui décide de tout : le mot vide, noté ε\varepsilon. C'est le mot de longueur zéro, ε=0|\varepsilon| = 0. Trois pièges à désamorcer immédiatement :

Préfixe, suffixe, facteur

Trois façons de « prendre un morceau » d'un mot ww :

NotionDéfinitionExemples sur abba
Préfixeun début de ww : w=uvw = u \cdot v, on garde uuε\varepsilon, a, ab, abb, abba
Suffixeune fin de wwε\varepsilon, a, ba, bba, abba
Facteurun morceau contigu, n'importe oùtous les précédents, plus b, bb

Remarquez que ε\varepsilon et ww lui-même sont toujours à la fois préfixe, suffixe et facteur de ww. Ce ne sont pas des cas dégénérés qu'on écarte : les définitions les incluent, et les preuves du cours s'appuient sur cette inclusion.

La concaténation

L'opération de base sur les mots est la concaténation : mettre bout à bout. On la note par un point, souvent omis :

uv=uvpar exempleabba=abba.u \cdot v = uv \qquad \text{par exemple} \quad ab \cdot ba = abba.

Deux propriétés structurent tout le reste, et méritent d'être énoncées comme telles.

Elle est associative : (uv)w=u(vw)(u \cdot v) \cdot w = u \cdot (v \cdot w). On peut donc écrire uvwuvw sans parenthèses.

Elle admet un élément neutre, et c'est ε\varepsilon : uε=εu=uu \cdot \varepsilon = \varepsilon \cdot u = u. C'est ici que le mot vide gagne son utilité — il joue pour la concaténation le rôle que zéro joue pour l'addition. Sans lui, la théorie serait pleine de cas particuliers.

En revanche, la concaténation n'est pas commutative : abbaab \neq ba en général. L'ordre des symboles est l'information portée par un mot.

Enfin, les longueurs s'ajoutent : uv=u+v|u \cdot v| = |u| + |v|. Cette égalité si simple est la clé des preuves par récurrence sur la longueur du chapitre suivant.

Quiz · 1 question

Parmi ces affirmations sur le mot vide ε sur l'alphabet Σ = {a, b}, laquelle est correcte ?

  • ε est identique à l'ensemble vide ∅mot vs ensemble
  • ε est un mot de longueur 0, et il vérifie u·ε = u pour tout mot ulongueur 0 et élément neutre
  • ε n'est pas un mot, c'est l'absence de motexistence

Réponse : ε est bel et bien un mot — le seul de longueur 0 — et il est l'élément neutre de la concaténation : u·ε = ε·u = u, exactement comme 0 pour l'addition. Il ne faut pas le confondre avec l'ensemble vide ∅, qui est un ensemble sans élément, alors que ε est un objet (un mot). Dire que ε « n'est pas un mot » interdirait de l'accepter dans un automate, ce qui casserait la moitié des constructions du cours.

Σ* : l'ensemble de tous les mots

On note Σ\Sigma^* l'ensemble de tous les mots que l'on peut former sur Σ\Sigma, y compris ε\varepsilon. C'est le terrain de jeu du cours entier.

Σ\Sigma^* est infini — il n'y a pas de mot le plus long — mais il est dénombrable : on peut énumérer ses éléments sans en oublier aucun, en les rangeant par longueur croissante. Sur Σ={a,b}\Sigma = \{a, b\} :

longueur 0 : εlongueur 1 : a, blongueur 2 : aa, ab, ba, bblongueur 3 : aaa, aab, aba, abb, baa, bab, bba, bbb...

Le comptage suit une logique simple : chaque mot de longueur nn s'obtient en plaçant l'une des Σ|\Sigma| lettres devant un mot de longueur n1n-1. Il y a donc exactement Σn|\Sigma|^n mots de longueur nn — 1, 2, 4, 8 sur un alphabet de deux lettres, comme dans la liste ci-dessus. Vous retrouverez cette formule par vous-même dans l'exercice, en la construisant plutôt qu'en la récitant.

Un langage est un ensemble de mots

Voici la définition centrale, et elle est d'une simplicité désarmante :

Un langage LL sur Σ\Sigma est un sous-ensemble de Σ\Sigma^*, c'est-à-dire LΣL \subseteq \Sigma^*.

Rien de plus. Un langage est un ensemble de mots — fini ou infini. Quelques exemples sur Σ={a,b}\Sigma = \{a, b\} :

Notez encore la distinction, cruciale et régulièrement ratée en examen : {ε}\{\varepsilon\} et \emptyset sont deux langages différents. Le premier contient un mot (le mot vide) ; le second n'en contient aucun. C'est la même différence qu'entre une boîte contenant une feuille blanche et une boîte vide.

Les opérations sur les langages

Comme les langages sont des ensembles, on hérite des opérations ensemblistes, plus deux opérations propres aux mots.

L'union L1L2L_1 \cup L_2, l'intersection L1L2L_1 \cap L_2 et le complément L=ΣL\overline{L} = \Sigma^* \setminus L sont les opérations ensemblistes habituelles.

La concaténation de langages étend celle des mots à tout l'ensemble :

L1L2={uvuL1, vL2}.L_1 \cdot L_2 = \{\, u \cdot v \mid u \in L_1,\ v \in L_2 \,\}.

On prend chaque mot du premier, chaque mot du second, on les colle. Si L1={a,ab}L_1 = \{a, ab\} et L2={b,c}L_2 = \{b, c\}, alors L1L2={ab,ac,abb,abc}L_1 \cdot L_2 = \{ab, ac, abb, abc\}.

Enfin, l'opération reine de la théorie, l'étoile de Kleene :

L={ε}LL2L3L^* = \{\varepsilon\} \cup L \cup L^2 \cup L^3 \cup \cdots

LnL^n est la concaténation de LL avec lui-même nn fois. Autrement dit, LL^* contient tous les mots obtenus en concaténant zéro, un ou plusieurs mots de LL. Le « zéro » est capital : εL\varepsilon \in L^* toujours, même si εL\varepsilon \notin L. C'est encore le mot vide qui se glisse dans la définition, et l'oublier fausse la moitié des exercices sur les expressions régulières du chapitre 5. La notation Σ\Sigma^* que vous employez depuis le début n'est d'ailleurs rien d'autre que l'étoile de Kleene appliquée à l'alphabet vu comme un langage de mots d'une lettre.

Quiz · 1 question

Soit L = {ab}. Lequel de ces mots n'appartient PAS à L* ?

  • ε (le mot vide)zéro copie de ab
  • abababtrois copies de ab
  • abales symboles vont-ils par paires ab ?

Réponse : L* contient tous les mots formés en concaténant zéro, un ou plusieurs exemplaires de ab : ε (zéro copie), ab, abab, ababab… Le mot vide en fait toujours partie, même si ε ∉ L. En revanche aba ne s'écrit pas comme une suite de blocs « ab » — il faudrait un a final orphelin. Il n'appartient donc pas à L*. Retenez que l'étoile inclut toujours ε, mais n'autorise que des concaténations entières de mots de L.

À vous

L'exercice est votre premier contact avec ces objets, en code. Vous implémentez les opérations de base — longueur, concaténation, préfixe — puis vous énumérez tous les mots de longueur nn sur un alphabet donné, et vous vérifiez que leur nombre vaut bien Σn|\Sigma|^n.

Le but n'est pas la programmation mais la définition : en écrivant concatener(u, ε), on comprend une fois pour toutes pourquoi ε\varepsilon est l'élément neutre, et en comptant les mots, on construit la formule au lieu de l'apprendre.

Exercice de code

Implémentez les opérations de base sur les mots (longueur, concaténation, préfixe), puis énumérez tous les mots de longueur n sur un alphabet donné. Vérifiez que leur nombre vaut |Σ|^n — et retrouvez pourquoi.

Point de départ

// Un mot est une suite finie de symboles pris dans un alphabet. En code, on
// le représente par une chaîne, et l'alphabet par un tableau de symboles.
const SIGMA = ["a", "b"];        // alphabet à 2 lettres
const MOT_VIDE = "";             // le mot vide, noté ε en cours (longueur 0)

// ── À VOUS (1) : les opérations de base ─────────────────────────────────────
function longueur(u) {
  return 0; // à compléter
}
function concatener(u, v) {
  return ""; // à compléter — attention : concatener(u, MOT_VIDE) doit rendre u
}
function estPrefixe(u, w) {
  // u est-il un préfixe de w ? (w commence-t-il par u ?)
  return false; // à compléter
}

// ── À VOUS (2) : dénombrer ──────────────────────────────────────────────────
// motsDeLongueur(n) doit rendre TOUS les mots de longueur n sur SIGMA.
// Combien y en a-t-il ? Vérifiez que |resultat| = |SIGMA|^n.
function motsDeLongueur(n) {
  return []; // à compléter (récursion ou boucle)
}

// ── Vérification ────────────────────────────────────────────────────────────
console.log("longueur('abba') =", longueur("abba"), "(attendu 4)");
console.log("concatener('ab','ba') =", concatener("ab", "ba"), "(attendu abba)");
console.log("concatener('ab', ε) =", "'" + concatener("ab", MOT_VIDE) + "'", "(attendu ab)");
console.log("estPrefixe('ab','abba') =", estPrefixe("ab", "abba"), "(attendu true)");
console.log("");
for (let n = 0; n <= 3; n++) {
  const m = motsDeLongueur(n);
  console.log("mots de longueur " + n + " : " + m.length + " -> [" + m.join(", ") + "]");
  console.log("   |SIGMA|^" + n + " = " + Math.pow(SIGMA.length, n));
}

Solution

function longueur(u) {
  return u.length;
}
function concatener(u, v) {
  return u + v;              // le mot vide est l'élément neutre : u·ε = ε·u = u
}
function estPrefixe(u, w) {
  return w.slice(0, u.length) === u;
}

function motsDeLongueur(n) {
  if (n === 0) return [MOT_VIDE];              // un seul mot de longueur 0 : ε
  const petits = motsDeLongueur(n - 1);        // les mots de longueur n-1
  const resultat = [];
  for (const m of petits)                      // devant chacun,
    for (const lettre of SIGMA)                // on place chaque lettre
      resultat.push(lettre + m);
  return resultat;
}

// ── Ce que l'exercice montre ────────────────────────────────────────────────
//
// 1. Le mot vide ε n'est PAS "rien" : c'est un mot, de longueur 0, et il est
//    l'élément neutre de la concaténation (u·ε = u). L'oublier fausse
//    récurrences et automates — la moitié des erreurs du cours viennent de là.
//
// 2. Le dénombrement suit une récurrence : chaque mot de longueur n s'obtient
//    en ajoutant UNE des |SIGMA| lettres devant un mot de longueur n-1. D'où
//        (nb de longueur n) = |SIGMA| × (nb de longueur n-1),  avec 1 pour n=0.
//    La solution de cette récurrence est |SIGMA|^n. On ne l'a pas récitée :
//    on l'a construite, et le code la vérifie (1, 2, 4, 8 sur un alphabet de 2).
//
// 3. Σ* — l'ensemble de TOUS les mots — est donc infini, mais DÉNOMBRABLE :
//    on peut les énumérer longueur par longueur, sans en oublier aucun. C'est
//    la première brique de tout le cours : un langage sera un sous-ensemble
//    de ce Σ*.

Ce que la suite en fait

Ce vocabulaire est le socle de tout. Le chapitre 2 se dote des outils pour prouver des propriétés sur ces objets — l'induction et la récurrence sur la longueur d'un mot, qui reposent directement sur l'égalité uv=u+v|uv| = |u| + |v| vue ici.

Ensuite, tout le cours consistera à décrire des langages — d'abord les plus simples, les langages réguliers, par des automates (chapitre 3) et des expressions régulières (chapitre 5) — et à comprendre ce que chaque outil peut et ne peut pas décrire. La question « ce mot appartient-il à ce langage ? » de l'introduction ne vous quittera plus.

À retenir

Flashcards · 4 cartes

Quelle est la différence entre ε, ∅ et {ε} ?
ε est le mot vide : un mot de longueur 0, élément neutre de la concaténation (u·ε = u). ∅ est le langage vide : un ensemble sans aucun mot. {ε} est le langage qui contient exactement un mot, le mot vide. ∅ et {ε} sont donc deux langages différents — l'un a zéro élément, l'autre en a un. Les confondre est l'erreur la plus fréquente du cours.
Qu'est-ce qu'un langage sur un alphabet Σ ?
Un sous-ensemble de Σ* : L ⊆ Σ*, c'est-à-dire un ensemble de mots, fini ou infini. Σ* est l'ensemble de TOUS les mots formables sur Σ (y compris ε) : il est infini mais dénombrable, et compte |Σ|^n mots de longueur n. Tout le cours consiste à décrire des langages et à cerner ce que chaque outil de description peut exprimer.
Que contient l'étoile de Kleene L*, et quel piège faut-il retenir ?
L* = {ε} ∪ L ∪ L² ∪ L³ ∪ … : tous les mots obtenus en concaténant zéro, un ou plusieurs mots de L. Le piège : ε ∈ L* TOUJOURS (la concaténation de zéro mot), même quand ε ∉ L. Oublier ce cas « zéro copie » fausse beaucoup d'exercices sur les expressions régulières.
Quelles sont les deux propriétés clés de la concaténation de mots ?
Elle est associative — (uv)w = u(vw), donc on écrit uvw sans parenthèses — et admet ε pour élément neutre — u·ε = ε·u = u. Elle n'est PAS commutative : ab ≠ ba en général. Et les longueurs s'ajoutent : |uv| = |u| + |v|, égalité sur laquelle reposent les preuves par récurrence sur la longueur du chapitre suivant.

Exercices d'entraînement

Exercice 1

Dénombrer des mots

On travaille sur l'alphabet Σ={a,b,c}\Sigma = \{a, b, c\}.

  1. Combien y a-t-il de mots de longueur exactement 33 ?
  2. Combien de mots de longueur au plus 33 (le mot vide compris) ?

Correction

  1. Chaque position se choisit indépendamment parmi Σ=3|\Sigma| = 3 lettres, donc il y a 33=273^3 = 27 mots de longueur 33.
  2. On additionne les mots de chaque longueur, sans oublier ε\varepsilon (longueur 00) : 30+31+32+33=1+3+9+27=40.3^0 + 3^1 + 3^2 + 3^3 = 1 + 3 + 9 + 27 = 40. Le terme 30=13^0 = 1 compte le seul mot de longueur nulle, le mot vide.

Exercice 2

Préfixes, suffixes, facteurs

Soit le mot w=abbaw = abba.

  1. Donner tous ses préfixes.
  2. Combien ww possède-t-il de facteurs distincts ?

Correction

  1. Un mot de longueur nn a exactement n+1n + 1 préfixes (on coupe avant chaque lettre, plus le mot entier). Ici : ε\varepsilon, a, ab, abb, abba — soit 55 préfixes.

  2. On compte les facteurs par longueur, en éliminant les doublons :

    • longueur 00 : ε\varepsilon11 ;
    • longueur 11 : a, b22 ;
    • longueur 22 : ab, bb, ba33 ;
    • longueur 33 : abb, bba22 ;
    • longueur 44 : abba11.

    Total : 1+2+3+2+1=91 + 2 + 3 + 2 + 1 = 9 facteurs distincts. La lettre a n'est comptée qu'une fois, bien qu'elle apparaisse deux fois dans ww — un facteur est un mot, pas une position.

Exercice 3

Opérations sur les langages

Soit L1={a,ab}L_1 = \{a, ab\} et L2={b,c}L_2 = \{b, c\}.

  1. Donner tous les mots de L1L2L_1 \cdot L_2.
  2. Le mot vide ε\varepsilon appartient-il à L1L_1^* ? Justifier.

Correction

  1. On concatène chaque mot de L1L_1 avec chaque mot de L2L_2 : L1L2={ab, ac, abb, abc}={ab, ac, abb, abc}.L_1 \cdot L_2 = \{a\cdot b,\ a\cdot c,\ ab\cdot b,\ ab\cdot c\} = \{ab,\ ac,\ abb,\ abc\}.
  2. Oui. Par définition, L1L_1^* contient la concaténation de zéro mot de L1L_1, qui vaut ε\varepsilon. C'est vrai pour tout langage, même quand εL1\varepsilon \notin L_1 — le piège classique de l'étoile de Kleene.