Chaînes de caractèresDans le dialogue d’impression, choisissez « Enregistrer au format PDF » comme destination.
Retour

Programmation en C · C3 Tableaux et chaînes · Chapitre 2 · 4 h

Chaînes de caractères

Le caractère nul terminal, les fonctions de string.h, les pièges de strcpy et le dépassement de tampon, la manipulation caractère par caractère.

Le ver Morris de 1988 — celui qui ouvrait le chapitre 1 de l'UE de cybersécurité — s'est propagé, entre autres, par un débordement de tampon dans le démon fingerd. Le code fautif appelait gets(), une fonction qui lit une ligne dans un tampon sans jamais savoir quelle taille il fait. Le ver envoyait une ligne plus longue que le tampon, écrasait l'adresse de retour, et prenait la main.

gets a été retirée de la norme C en 2011, après vingt-trois ans de bons et loyaux services aux attaquants. Mais le problème qu'elle illustre n'a pas disparu : il est inhérent à la façon dont le C représente les chaînes, et c'est le sujet de ce chapitre.

Une chaîne est un tableau, plus une convention

Le C n'a pas de type chaîne. Une chaîne est un tableau de char terminé par un caractère nul, noté '\0', de code 0.

char mot[] = "chat"; ┌─────┬─────┬─────┬─────┬──────┐│ 'c' │ 'h' │ 'a' │ 't' │ '\0' │└─────┴─────┴─────┴─────┴──────┘   0     1     2     3     4        ← taille du tableau : 5, pas 4

Toute la suite découle de ce schéma.

La longueur n'est pas stockée : elle se calcule, en parcourant jusqu'au marqueur. C'est la différence de fond avec les chaînes de Python ou de Java, qui portent leur longueur.

Il faut toujours une case de plus. Un tableau destiné à contenir nn caractères doit être déclaré de taille n+1n+1. L'oubli du +1 est la faute la plus fréquente du chapitre, et elle produit un débordement d'exactement une case — le genre d'erreur qui passe les tests.

Un marqueur perdu est une chaîne infinie. Si le '\0' est écrasé, toutes les fonctions de chaîne continuent de lire au-delà du tableau, jusqu'à tomber par hasard sur un octet nul — ou sur une page interdite.

Deux déclarations qu'il ne faut pas confondre :

char a[] = "chat";      /* tableau de 5 char, modifiable, sur la pile */char *b  = "chat";      /* pointeur vers une chaîne littérale, EN LECTURE SEULE */

Modifier b[0] est un comportement indéfini : les littéraux sont généralement placés dans une zone protégée en écriture, et le programme meurt. On écrit donc const char *b pour que le compilateur le rappelle.

Les fonctions de string.h

FonctionRôleCoût
strlen(s)longueur, sans le '\0'O(n)O(n)
strcpy(dst, src)copie, marqueur comprisO(n)O(n)
strcmp(a, b)0 si égales, signe de la différence sinonO(n)O(n)
strcat(dst, src)concatène à la fin de dstO(n+m)O(n+m)
strchr(s, c)première occurrence de cO(n)O(n)
strncpy, strncatversions bornées par une tailleO(n)O(n)

La colonne des coûts mérite plus d'attention qu'on ne lui en accorde. strlen est linéaire, puisqu'il faut parcourir jusqu'au marqueur. Écrire

for (int i = 0; i < strlen(s); i++)      /* QUADRATIQUE */

recalcule la longueur à chaque tour : la boucle devient O(n2)O(n^2). Sur une chaîne d'un million de caractères, c'est la différence entre instantané et plusieurs minutes. On calcule la longueur une fois, avant la boucle.

Deux rappels de syntaxe qui coûtent cher. strcmp rend 0 quand les chaînes sont égales, donc if (strcmp(a, b)) teste la différence — le piège du chapitre 3. Et l'on ne compare jamais deux chaînes avec ==, qui compare les adresses : a == b est vrai seulement si les deux pointeurs désignent le même tableau.

Les pièges

Ils viennent tous du même endroit : aucune de ces fonctions ne connaît la taille de la destination.

strcpy(dst, src) copie jusqu'au marqueur de src, sans se demander si dst peut l'accueillir.

char petit[8];strcpy(petit, "une chaîne beaucoup trop longue");   /* débordement */

Le débordement du chapitre 5, avec ses trois issues — dont l'écrasement de l'adresse de retour, qui est exactement le mécanisme du ver Morris.

Les versions bornées, strncpy et strncat, prennent une taille maximale. Elles sont plus sûres, mais elles ont leurs propres pièges : strncpy ne pose pas le marqueur si la source remplit exactement la destination, ce qui produit une chaîne non terminée. Il faut donc écrire dst[n-1] = '\0' après coup. Et strncat prend en argument la place restante, pas la taille du tampon — une source d'erreur classique.

D'où les recommandations d'usage : gets est interdite, on emploie fgets qui prend une taille ; sprintf est à remplacer par snprintf pour la même raison ; et sur les systèmes qui les offrent, strlcpy et strlcat font ce que strncpy aurait dû faire.

Quiz · 1 question

Pourquoi for (int i = 0; i < strlen(s); i++) est-il quadratique, et comment le corriger ?

  • Parce que l'accès s[i] est lui-même linéaire : il faut parcourir la chaîne depuis le débutaccès linéaire
  • Parce que strlen est appelée à CHAQUE TOUR et parcourt toute la chaîne pour trouver le marqueur : n tours × n caractères. On calcule la longueur une fois, avant la bouclestrlen appelée n fois
  • Parce que la comparaison entre int et size_t force une conversion coûteuse à chaque tourconversion de type

Réponse : L'accès s[i] est bien en O(1) — un simple calcul d'adresse, comme au chapitre 5. Le coupable est la CONDITION : elle est réévaluée à chaque tour, et strlen doit à chaque fois parcourir la chaîne du début jusqu'au marqueur, puisque la longueur n'est stockée nulle part. Résultat : n tours, chacun coûtant n, soit O(n²). Sur un million de caractères, c'est la différence entre quelques millisecondes et plusieurs minutes. Le correctif tient en une ligne : size_t n = strlen(s); puis i < n. À noter qu'un compilateur optimisant peut parfois sortir l'appel de la boucle s'il prouve que la chaîne n'est pas modifiée — mais compter là-dessus est fragile, et le code reste trompeur pour le lecteur.

Manipuler caractère par caractère

Un char est un entier — le chapitre 2 d'architecture l'avait posé — et l'arithmétique directe sur les codes ASCII est parfaitement légitime en C.

char c = '7';int chiffre = c - '0';           /* 55 − 48 = 7 */char maj = c - 'a' + 'A';        /* bascule minuscule → majuscule */

Le - '0' est l'idiome de conversion caractère vers chiffre, et il fonctionne parce que les chiffres sont consécutifs dans la table. L'écart entre minuscule et majuscule vaut 32, soit un seul bit — le chapitre 2 d'architecture l'avait noté.

Ces manipulations sont si fréquentes que ctype.h les encapsule : isdigit, isalpha, isspace, toupper, tolower. Il vaut mieux les employer, pour une raison qui n'est pas cosmétique : elles tiennent compte des paramètres régionaux, alors que les comparaisons directes supposent l'ASCII et se cassent sur les caractères accentués — dont le chapitre 2 d'architecture rappelait qu'ils occupent plusieurs octets en UTF-8.

C'est d'ailleurs la limite à connaître de tout ce chapitre : strlen compte des octets, pas des caractères. Sur « été », elle rend 5. Manipuler du texte réellement international demande une bibliothèque dédiée, et le C seul n'y suffit pas.

Quiz · 1 question

char nom[5] ; strcpy(nom, « Alice ») — combien d'octets sont copiés, et pourquoi est-ce un débordement ?

  • Aucun débordement : « Alice » fait exactement 5 caractères, qui tiennent dans nom[5]ça passe
  • Débordement d'une case : strcpy copie AUSSI le marqueur de fin, donc 6 octets dans un tableau de 5 — l'octet nul est écrit juste après la finune case de trop
  • Débordement de 5 cases : strcpy ne tient jamais compte de la taille de la destinationcinq cases

Réponse : C'est l'oubli du + 1, et la plus fréquente des fautes du chapitre. « Alice » compte cinq lettres, mais une chaîne C en occupe SIX : les cinq caractères plus le marqueur '\\0', que strcpy copie fidèlement puisqu'il fait partie de la chaîne source. L'octet nul est donc écrit un cran après la fin du tableau — un débordement d'exactement une case, qui écrase la variable voisine ou un octet de bourrage. C'est le genre d'erreur qui passe tous les tests : selon l'agencement de la pile, l'octet écrasé peut n'avoir aucune conséquence visible pendant des mois. La règle : un tableau destiné à n caractères se déclare de taille n + 1, et l'on emploie snprintf ou strlcpy plutôt que strcpy.

À vous

L'exercice réimplémente strlen, strcpy et strcmp sur un tableau de caractères simulé, avec un tampon de taille fixe et une variable voisine — le cadre du chapitre 5.

Trois choses à faire tomber. Le débordement du +1 oublié, en voyant l'octet nul écraser le voisin. Le marqueur perdu, en écrasant le '\0' et en constatant que strlen part au-delà du tampon. Et la boucle quadratique, en comptant les caractères examinés avec strlen dans la condition puis en dehors — le rapport se voit dès une chaîne de cent caractères.

Exercice de code

Réimplémentez strcpy, strlen et strcmp, puis faites tomber le « + 1 », le marqueur perdu et la boucle quadratique.

Point de départ

// La mémoire : un tampon de 8 octets, puis une variable voisine.
function creerMemoire() {
  const m = new Array(16).fill(0);
  const TAMPON = 0, TAILLE = 8, VOISIN = 8;
  m[VOISIN] = 1234;
  return {
    tampon: TAMPON, taille: TAILLE,
    ecrire(i, code) { m[i] = code; },
    lire(i) { return m[i]; },
    voisin: () => m[VOISIN],
    vue() {
      return m.slice(0, 12).map((c, i) => {
        const s = c === 0 ? "\\0" : (i >= VOISIN ? String(c) : String.fromCharCode(c));
        return (i === VOISIN ? "| " : "") + s;
      }).join(" ");
    },
  };
}

// Pose une chaîne littérale dans le tampon, SANS aucun contrôle — comme strcpy.
function monStrcpy(m, depart, texte) {
  let i = 0;
  for (; i < texte.length; i++) m.ecrire(depart + i, texte.charCodeAt(i));
  // ← à écrire : et le marqueur de fin ? combien d'octets au total ?
  return i;
}

// Longueur : on compte jusqu'au marqueur. AUCUNE borne.
function monStrlen(m, depart, compteur = { n: 0 }) {
  let i = 0;
  while (m.lire(depart + i) !== 0) { compteur.n++; i++; if (i > 40) return -1; }
  return i;
}

function monStrcmp(m, a, b) {
  return 0;   // ← à écrire : 0 si égales, sinon le signe de la différence
}

// ── À VOUS ────────────────────────────────────────────────────────────────
// 1. Faites copier le marqueur par monStrcpy, puis copiez « Alice » dans le
//    tampon de 8 : combien d'octets ? Et « personnage » ?
// 2. Écrasez le marqueur et relancez monStrlen : que lit-elle ?
// 3. Comptez les caractères examinés avec strlen DANS la condition d'une
//    boucle, puis calculée une seule fois avant.

const m = creerMemoire();
monStrcpy(m, 0, "chat");
console.log("mémoire :", m.vue());
console.log("longueur :", monStrlen(m, 0), "| voisin :", m.voisin());

Solution

function creerMemoire() {
  const m = new Array(16).fill(0);
  const TAMPON = 0, TAILLE = 8, VOISIN = 8;
  m[VOISIN] = 1234;
  return {
    tampon: TAMPON, taille: TAILLE,
    ecrire(i, code) { m[i] = code; },
    lire(i) { return m[i]; },
    voisin: () => m[VOISIN],
    vue() {
      return m.slice(0, 12).map((c, i) => {
        const s = c === 0 ? "\\0" : (i >= VOISIN ? String(c) : String.fromCharCode(c));
        return (i === VOISIN ? "| " : "") + s;
      }).join(" ");
    },
  };
}

function monStrcpy(m, depart, texte) {
  let i = 0;
  for (; i < texte.length; i++) m.ecrire(depart + i, texte.charCodeAt(i));
  // Le marqueur FAIT PARTIE de la chaîne : strcpy le copie aussi, d'où
  // texte.length + 1 octets écrits. C'est le « + 1 » qu'on oublie.
  m.ecrire(depart + i, 0);
  return i + 1;
}

function monStrcpyBorne(m, depart, texte, taille) {
  // Ce que strncpy aurait dû être : on réserve la dernière case au marqueur.
  const n = Math.min(texte.length, taille - 1);
  for (let i = 0; i < n; i++) m.ecrire(depart + i, texte.charCodeAt(i));
  m.ecrire(depart + n, 0);
  return { ecrits: n + 1, tronque: n < texte.length };
}

function monStrlen(m, depart, compteur = { n: 0 }) {
  let i = 0;
  while (m.lire(depart + i) !== 0) { compteur.n++; i++; if (i > 40) return -1; }
  return i;
}

function monStrcmp(m, a, b) {
  let i = 0;
  while (m.lire(a + i) !== 0 && m.lire(a + i) === m.lire(b + i)) i++;
  // On compare les octets À LA PREMIÈRE DIFFÉRENCE, marqueurs compris : c'est
  // ce qui fait que 0 signifie « égales », d'où le piège du if (strcmp(...)).
  return m.lire(a + i) - m.lire(b + i);
}

console.log("— 1. le « + 1 » —");
for (const texte of ["chat", "Alice", "personnage"]) {
  const m = creerMemoire();
  const ecrits = monStrcpy(m, 0, texte);
  const debord = ecrits > m.taille;
  console.log("   « " + texte.padEnd(11) + " » : " + ecrits + " octets dans un tampon de " +
    m.taille + (debord ? "   << DÉBORDEMENT, voisin = " + m.voisin() : "   ok"));
}
console.log("   « Alice » fait 5 lettres et 6 octets : le marqueur déborde d'exactement");
console.log("   une case, ce qui passe la plupart des tests.");

console.log("");
console.log("— version bornée —");
const b = creerMemoire();
const r = monStrcpyBorne(b, 0, "personnage", b.taille);
console.log("   " + b.vue() + "   tronquée : " + r.tronque + ", voisin intact : " + b.voisin());

console.log("");
console.log("— 2. le marqueur perdu —");
const p = creerMemoire();
monStrcpy(p, 0, "chat");
console.log("   longueur normale : " + monStrlen(p, 0));
p.ecrire(4, 88);                  // on écrase le '\0' par un 'X'
console.log("   marqueur écrasé  : " + monStrlen(p, 0) +
            "   (lecture au-delà du tampon, jusqu'à un zéro fortuit ou la garde)");

console.log("");
console.log("— 3. strlen dans la condition —");
const q = creerMemoire();
for (let i = 0; i < 100; i++) q.ecrire(i, 65 + (i % 26));
q.ecrire(100, 0);
let dans = { n: 0 }, dehors = { n: 0 };
for (let i = 0; i < monStrlen(q, 0, dans); i++) { /* corps vide */ }
const n = monStrlen(q, 0, dehors);
for (let i = 0; i < n; i++) { /* corps vide */ }
console.log("   strlen DANS la condition : " + dans.n + " caractères examinés");
console.log("   strlen calculée une fois : " + dehors.n + " caractères examinés");
console.log("   rapport : " + Math.round(dans.n / dehors.n) + " fois plus, et il croît avec n.");

En travaux pratiques

Travaux pratiques 6 · 3 h

Le caractère nul, et tout ce qui en dépend

Manipuler des chaînes C en comprenant que leur longueur n'est écrite nulle part, et réaliser le découpage de lignes dont le fil rouge a besoin.

Avant de commencer

  • Le TP 5 : tableaux et débordements
  • Le TP 2 d'Architecture, sur UTF-8

Énoncé

  1. Compter les octetsDéclarez une chaîne littérale et affichez sa longueur par strlen et sa taille par sizeof. Expliquez la différence d'exactement un.
  2. Perdre le zéroRemplissez un tableau de dix caractères avec dix lettres, sans terminateur, puis affichez-le avec %s. Recommencez plusieurs fois et notez la variabilité.
  3. Le débordement classiqueCopiez une chaîne de vingt caractères dans un tampon de dix avec strcpy. Exécutez, puis recompilez avec le détecteur d'adresses.
  4. La fausse correctionRemplacez par strncpy avec la taille du tampon. Affichez le résultat et cherchez le nouveau problème. Écrivez ensuite la version réellement correcte. Indice : strncpy ne garantit PAS d'écrire le terminateur.
  5. ComparerComparez deux chaînes de contenu identique avec l'opérateur d'égalité, puis avec strcmp. Expliquez pourquoi la première forme est parfois vraie.
  6. Découper une ligneÉcrivez une fonction qui découpe une ligne en champs sur un séparateur, sans utiliser strtok. Testez avec des champs vides et des séparateurs consécutifs.
  7. Au fil rougeBranchez ce découpage dans journal : extraire l'adresse, la date, le code de réponse de chaque ligne. Testez sur une ligne tronquée et sur une ligne vide.
  8. Les accentsComptez les caractères d'une chaîne accentuée avec strlen, puis à la main. Écrivez une fonction qui compte les vrais caractères UTF-8.

C'est réussi quand

  • Vous expliquez pourquoi sizeof vaut strlen plus un sur un littéral
  • Votre version de la copie est sûre ET termine toujours la chaîne
  • Votre découpage gère un champ vide entre deux séparateurs
  • Votre compteur UTF-8 donne 8 pour « éléphant »

Correction

Une chaîne, c'est une convention
char s[] = "abc";
strlen(s)  → 3      (compte jusqu'au zéro, exclu)
sizeof s   → 4      (a, b, c, et le '\0')

en mémoire : 'a' 'b' 'c' '\0'

La longueur n'est stockée NULLE PART : strlen la calcule en parcourant jusqu'au terminateur, donc en temps linéaire. Une boucle écrite avec strlen dans sa condition relit donc toute la chaîne à chaque tour — le classique O(n²) invisible. Toutes les particularités de ce TP découlent de cette seule convention.

Sans terminateur
char t[10];
for (int i = 0; i < 10; i++) t[i] = 'A' + i;
printf("%s\n", t);

→ ABCDEFGHIJ suivi de déchets, jusqu'au premier octet nul
 rencontré par hasard — longueur variable d'une exécution à l'autre

printf avec %s lit jusqu'au zéro, et il ne peut pas savoir que votre tableau s'arrête. C'est une lecture hors bornes, avec toutes les conséquences du TP 5 — y compris la divulgation du contenu de la pile, qui est une classe de faille à part entière.

Les trois copies
char buf[10];

strcpy(buf, "chaîne bien trop longue");    /* DÉBORDEMENT */

strncpy(buf, source, sizeof buf);           /* pas de débordement,
                                             mais PAS DE '\0' si
                                             source fait 10 ou plus */

/* la version correcte */
strncpy(buf, source, sizeof buf - 1);
buf[sizeof buf - 1] = '\0';

/* ou, plus lisible, en vérifiant la troncature */
int n = snprintf(buf, sizeof buf, "%s", source);
if (n >= (int)sizeof buf) { /* tronqué : c'est une ERREUR, pas un détail */ }

strncpy est un faux ami : conçu à l'origine pour des champs de taille fixe non terminés, il ne garantit pas le zéro final. snprintf est préférable parce qu'il termine toujours ET indique par sa valeur de retour ce qu'il AURAIT écrit — donc s'il y a eu troncature. Une troncature silencieuse est un bogue de sécurité, pas un désagrément cosmétique.

Comparer deux chaînes
char *a = "bonjour", *b = "bonjour";
a == b        → parfois VRAI : le compilateur a fusionné les littéraux
strcmp(a, b)  → 0 : contenus identiques

char c[] = "bonjour", d[] = "bonjour";
c == d        → FAUX : deux tableaux distincts

L'égalité compare des ADRESSES, jamais des contenus. Elle peut être vraie par accident quand le compilateur mutualise deux littéraux identiques, ce qui rend le bogue intermittent selon le niveau d'optimisation. Toute comparaison de chaînes passe par strcmp, sans exception.

Le découpage, sans strtok
int decouper(char *ligne, char sep, char *champs[], int max) {
  int n = 0;
  char *debut = ligne;
  for (char *p = ligne; ; p++) {
      if (*p == sep || *p == '\0') {
          if (n >= max) return -1;
          char fin = *p;
          *p = '\0';              /* on coupe SUR PLACE */
          champs[n++] = debut;
          debut = p + 1;
          if (fin == '\0') break;
      }
  }
  return n;
}

Le découpage modifie la ligne en y plaçant des zéros, et les champs pointent DEDANS : aucune allocation, aucune copie. Contrairement à strtok, cette fonction rend les champs vides — deux séparateurs consécutifs donnent un champ de longueur zéro, ce qui est presque toujours l'information voulue. Et elle n'a pas d'état statique, donc reste utilisable avec plusieurs fils d'exécution.

Compter des caractères, pas des octets
strlen("éléphant") → 10 octets, pour 8 caractères

int caracteres_utf8(const char *s) {
  int n = 0;
  for (; *s; s++)
      if ((*s & 0xC0) != 0x80) n++;   /* on ignore les octets 10xxxxxx */
  return n;
}

Un octet de continuation UTF-8 commence toujours par les bits 10 : les ignorer revient à ne compter que les premiers octets de chaque caractère. C'est le TP 2 d'Architecture rendu utile. Retenez la conséquence : en C, une chaîne est une suite d'OCTETS, et tout code qui coupe, tronque ou aligne du texte doit savoir dans quel encodage il travaille.

Ce que la suite en fait

Le bloc IV explique enfin ce que ce chapitre a manipulé sans le nommer. char *b = "chat" est un pointeur, strcpy(dst, src) reçoit deux adresses, et la conversion tableau-pointeur du chapitre 5 est la raison pour laquelle une fonction de chaîne peut modifier la chaîne de son appelant.

Le chapitre 8 lèvera aussi la contrainte de taille fixe : une chaîne dont la longueur n'est connue qu'à l'exécution s'alloue dynamiquement — et il faudra alors ne pas oublier le +1 au moment du malloc, où l'erreur est exactement la même.

À retenir

Flashcards · 4 cartes

Comment le C représente-t-il une chaîne, et quelles conséquences ?
Un TABLEAU DE CHAR terminé par le caractère nul '\0'. Trois conséquences : la LONGUEUR N'EST PAS STOCKÉE, elle se calcule en parcourant jusqu'au marqueur (contrairement à Python ou Java) ; il faut TOUJOURS une case de plus — un tableau pour n caractères se déclare de taille n+1 ; et un marqueur écrasé donne une chaîne « infinie », les fonctions lisant au-delà du tableau jusqu'à un octet nul fortuit.
Pourquoi strlen dans la condition d'une boucle est-il quadratique ?
Parce que la condition est réévaluée à chaque tour, et que strlen parcourt toute la chaîne pour trouver le marqueur — la longueur n'étant stockée nulle part. n tours coûtant n chacun donnent O(n²) : sur un million de caractères, la différence entre quelques millisecondes et plusieurs minutes. Correctif : calculer la longueur UNE FOIS, avant la boucle.
Pourquoi strcpy est-il dangereux, et que valent les versions bornées ?
strcpy copie jusqu'au marqueur de la SOURCE, sans jamais connaître la taille de la destination : d'où le débordement de tampon, mécanisme du ver Morris. strncpy et strncat prennent une taille, mais ont leurs propres pièges — strncpy NE POSE PAS le marqueur si la source remplit exactement la destination, et strncat attend la place RESTANTE, pas la taille du tampon. En pratique : jamais gets (retirée de la norme), fgets à la place ; snprintf plutôt que sprintf ; strlcpy si disponible.
Pourquoi c - '0' convertit-il un caractère en chiffre, et quelle est la limite du chapitre ?
Parce qu'un char EST un entier et que les chiffres sont consécutifs dans la table ASCII : '7' vaut 55, '0' vaut 48, la différence donne 7. De même l'écart minuscule/majuscule vaut 32, soit un seul bit. On préfère toutefois ctype.h (isdigit, toupper) qui tient compte des paramètres régionaux. LIMITE : strlen compte des OCTETS, pas des caractères — sur « été » elle rend 5, puisqu'un accent occupe deux octets en UTF-8.