Guide IA, information, communication numérique & cybersécurité
Lors de l’étape précédente, nous avons commencé à distinguer plusieurs éléments susceptibles d’intervenir entre votre demande et la réponse obtenue.
L’un d’entre eux reste encore largement une boîte noire :
LE MODÈLE
Nous écrivons des phrases.
Nous utilisons des mots.
Nous ajoutons de la ponctuation, des nombres, parfois des emojis, des noms propres ou des termes dans plusieurs langues.
Mais est-ce réellement sous cette forme que le modèle traite notre demande ?
Dans cette étape, nous allons suivre ce que devient le texte de votre demande lorsqu’il est transmis au modèle.
Nous chercherons à déterminer :
Mais, comme précédemment, nous ne commencerons pas par les définitions.
Observez cette phrase :
Pour vous, elle est composée de mots.
Vous pouvez les compter.
Vous pouvez identifier une phrase, des espaces, une ponctuation et un nom propre.
Imaginez maintenant que cette phrase soit envoyée à un modèle de langage.
Avant de poursuivre, représentez ce que vous pensez que le modèle reçoit réellement.
Ne cherchez pas la bonne réponse : indiquez aussi ce dont vous n’êtes pas certains.
Sans utiliser d’outil, travaillez sur cette phrase :
Il n’existe pas encore de réponse attendue à ce stade.
Utilisez maintenant un tokenizer officiel ou documenté correspondant à une famille de modèles étudiée.
Pour cette première observation, tous les groupes utilisent le même tokenizer de référence afin de pouvoir comparer leurs résultats.
Entrez exactement la même phrase :
Ne modifiez pas vos propositions avant d’observer le résultat.
Vous venez d’observer le fonctionnement d’un tokenizer.
Dans les modèles de langage, le texte est généralement transformé en tokens, c’est-à-dire en unités déterminées par le système de tokenisation utilisé.
Un token peut correspondre, selon les cas et le tokenizer :
Et surtout :
le découpage n’est pas nécessairement identique d’un tokenizer à l’autre.
Nous n’allons donc pas apprendre :
comme une règle universelle.
Ce serait précisément le type de simplification que notre démarche cherche à éviter.
Vous allez maintenant concevoir votre propre série d’essais afin de mettre à l’épreuve votre représentation de la tokenisation.
Chaque essai doit avoir une raison d’exister.
Lorsque c’est possible, ne modifiez qu’un élément à la fois.
Avant chaque essai, notez ce que vous pensez observer.
Consignez uniquement les essais que votre groupe juge réellement informatifs.
| TEXTE TESTÉ | CE QUE NOUS MODIFIONS | NOTRE PRÉDICTION | RÉSULTAT OBSERVÉ | CE QUE LE RÉSULTAT CHANGE DANS NOTRE MODÈLE |
|---|---|---|---|---|
Vous observez un tokenizer particulier sur quelques exemples.
Vos résultats ne suffisent pas encore à formuler une règle universelle.
Jusqu’à présent, vous avez observé un seul tokenizer.
Mais pouvons-nous supposer que tous les modèles découpent nécessairement le même texte de la même manière ?
Reprenez exactement la même phrase :
Identifiez des tokenizers associés à des modèles ou à des familles de modèles différents lorsque cette information et un outil permettant de les observer sont disponibles.
Utilisez en priorité un outil officiel ou un tokenizer publié ou documenté par l’organisation à l’origine du modèle.
Vous pouvez utiliser un comparateur multi-tokenizers pour explorer rapidement plusieurs découpages.
Un comparateur tiers constitue un outil d’exploration.
Le résultat qu’il affiche ne suffit pas, à lui seul, à établir que le modèle ou le service que vous utilisez actuellement emploie exactement ce tokenizer.
Lorsque cela est possible, vérifiez cette association dans une source officielle.
Complétez le tableau en distinguant ce que vous observez de ce que vos sources permettent réellement d’établir.
| MÊME TEXTE | MODÈLE / FAMILLE | TOKENIZER IDENTIFIÉ | SOURCE DE L’ASSOCIATION + NIVEAU DE CERTITUDE | NOMBRE DE TOKENS | DÉCOUPAGE VISIBLE |
|---|---|---|---|---|---|
| Nous partons trois jours à Ajaccio en septembre. | |||||
| Texte strictement identique | |||||
| Texte strictement identique |
Ne remplacez pas ce que vous ne savez pas par une supposition.
Confrontez maintenant votre représentation aux éléments suivants :
Un même texte peut être découpé différemment selon le tokenizer utilisé.
Plusieurs modèles peuvent utiliser des tokenizers différents.
Certains modèles peuvent également partager un même tokenizer ou une même famille de tokenisation.
Nous devons donc éviter de transformer l’observation réalisée avec un tokenizer particulier en règle applicable à tous les modèles.
De même, lorsque vous utilisez un service tel qu’un assistant conversationnel, ne confondez pas automatiquement :

L’étape précédente nous a appris à distinguer les composantes d’un système.
Cette distinction reste nécessaire ici.
Le tokenizer vous montre des morceaux de texte.
Mais le modèle ne manipule pas directement les mots tels que vous les voyez à l’écran.
À partir du tokenizer utilisé, les tokens sont associés à des identifiants numériques.
Lorsque l’outil utilisé le permet, affichez maintenant l’identifiant associé à chaque token.
Vous pouvez représenter cette étape ainsi :
TEXTE ↓ TOKENISATION ↓ TOKEN 1 | TOKEN 2 | TOKEN 3 | TOKEN 4... ↓ ID 1 | ID 2 | ID 3 | ID 4…
Ne cherchez pas encore à conclure : conservez plusieurs explications compatibles avec ce que vous observez.
L’identifiant permet de désigner une unité dans le vocabulaire utilisé par le tokenizer.
Le modèle associe ensuite ces unités à des représentations numériques apprises qui seront utilisées dans les traitements suivants. À ce stade, il n’est pas nécessaire d’en connaître précisément le fonctionnement mathématique.
Nous pouvons maintenant représenter le chemin parcouru par notre texte :

À ce stade, nous savons mieux comment le texte devient traitable par le modèle. Nous ne savons pas encore comment celui-ci produit la réponse.
Nous avons observé comment notre texte peut être découpé et transformé avant son traitement par le modèle.
Supposons maintenant que deux services semblent accepter des quantités de texte différentes.
La limite dépend-elle du modèle, du service, de l’interface ou d’un autre élément du système ?
Avant de rechercher la réponse, formulez votre représentation.
Recherchez maintenant, dans la documentation officielle du modèle ou du service que vous utilisez, les informations disponibles concernant la quantité de contexte pouvant être prise en compte.
Notez précisément :
Avez-vous trouvé les mêmes valeurs ? Parlez-vous exactement du même modèle, du même service et de la même version ?
Les informations consultées sont-elles datées ?
Les modèles disposent d’une capacité limitée concernant la quantité d’informations pouvant être prise en compte dans un contexte donné.
Cette limite est généralement exprimée en tokens.
On parle couramment de fenêtre de contexte.
Reprenez maintenant le modèle construit à l’étape précédente.
Vous aviez commencé à représenter :


À partir des observations et vérifications réalisées dans cette étape, nous pouvons maintenant établir que :
Le texte soumis à un modèle de langage est tokenisé avant son traitement par le modèle.
Un token ne correspond pas nécessairement à un mot.
La manière dont un texte est tokenisé dépend du tokenizer utilisé.
Un même texte peut donc produire des tokenisations différentes selon le tokenizer considéré.
Les tokens sont associés à des identifiants puis à des représentations numériques utilisées par le modèle.
La quantité d’informations pouvant être prise en compte dans un contexte donné est limitée et dépend notamment du modèle et du système considérés.
Et surtout :
Conservez :
Et surtout :
Le modèle ne reçoit pas simplement « vos mots » tels que vous les percevez.
TOKEN ≠ MOT
La manière dont le texte est tokenisé dépend du tokenizer utilisé.
Un même texte n’est donc pas nécessairement découpé de la même manière pour tous les modèles.
Un outil tiers peut permettre d’explorer une tokenisation sans suffire, à lui seul, à établir celle réellement utilisée par un modèle ou un service donné.
Le contexte pouvant être pris en compte est limité.
Transformer le texte permet au modèle de le traiter ; cela n’explique pas encore comment il produit une réponse.
Vos réponses enregistrées dans le carnet sont conservées dans ce navigateur.