Projet · Actif
Lexique de l’intelligence artificielle
Des définitions courtes pour comprendre les mots employés dans nos articles, nos essais et nos tests de modèles locaux.
26 termes
Modèle
Essentiel
Terme ambigu : il peut désigner une architecture, cette architecture accompagnée des paramètres appris pendant l’entraînement, ou une version précise de ces paramètres. Dans l’usage courant de l’IA générative, un modèle désigne le plus souvent une architecture neuronale avec des poids entraînés, prête pour l’inférence. Deux modèles peuvent donc partager la même architecture sans partager les mêmes poids.
Architecture
Essentiel
Description de l’organisation d’un réseau de neurones : types de couches, connexions et opérations effectuées. Elle ne contient pas, à elle seule, les poids appris. Une même architecture peut servir à entraîner plusieurs modèles distincts ; Transformer est une famille d’architectures, pas le nom d’un jeu de poids particulier.
Modèle de langage
Essentiel
Modèle qui attribue des probabilités à des séquences de tokens ou à des tokens masqués à partir de leur contexte. Selon son objectif d’entraînement, il peut notamment compléter ou générer du texte. Il peut être petit ou grand et n’est pas nécessairement fondé sur un Transformer : un LLM est un modèle de langage à grande échelle, mais l’inverse n’est pas vrai.
Grand modèle de langage (LLM)
Essentiel
Sigle de Large Language Model, ou « grand modèle de langage ». Il désigne un modèle de langage entraîné à grande échelle — en quantité de paramètres, de données et de calcul — et généralement fondé sur une architecture Transformer. Tous les LLM sont des modèles de langage, mais tous les modèles de langage ne sont pas des LLM ; aucun seuil unique ne définit le mot « grand ».
Transformer
Essentiel
Famille d’architectures neuronales qui traite des séquences au moyen de blocs d’attention et de réseaux entièrement connectés, avec une information sur la position des éléments. Transformer désigne une architecture ; LLM décrit l’échelle et la fonction d’un modèle de langage. La plupart des LLM actuels emploient une variante du Transformer.
Token
Essentiel
Unité produite par le tokenizer avant le traitement d’un texte par le modèle. Selon le vocabulaire et la méthode de tokenisation, un token peut représenter un mot, un fragment de mot, un signe ou une combinaison incluant une espace. Il est ensuite converti en identifiant numérique.
Prompt
Essentiel
Contenu fourni au modèle au moment de l’inférence : consigne, question, exemples, historique ou documents. La sortie est calculée conditionnellement à ce contenu. Ajouter une information dans le prompt peut donc être utile pour la réponse en cours, sans modifier les paramètres entraînés du modèle.
Inférence
Essentiel
Utilisation d’un modèle entraîné pour calculer une sortie à partir d’une entrée, avec ses paramètres alors fixés. Pour un LLM génératif, cette entrée est habituellement constituée du prompt et du contexte disponible : instructions, historique de la conversation et éventuels documents ajoutés. Générer la réponse relève de l’inférence, par opposition à l’entraînement qui ajuste les paramètres.
Entraînement
Essentiel
Processus qui ajuste les paramètres d’un modèle afin de réduire une fonction de perte mesurée sur des données. Il transforme une architecture initialisée en modèle entraîné. Le préentraînement construit les capacités générales ; d’autres étapes peuvent ensuite spécialiser ou aligner le modèle.
Poids du modèle (paramètres)
Essentiel
Les paramètres sont les valeurs numériques ajustées pendant l’entraînement et utilisées dans les calculs du réseau. Dans l’usage courant, « poids du modèle » désigne l’ensemble de ces paramètres, même si le terme technique peut aussi distinguer les poids d’autres paramètres comme les biais. Une information apprise est généralement répartie dans de nombreuses valeurs.
Checkpoint
Important
État sauvegardé d’un entraînement à une étape donnée : poids du modèle et, selon le cas, configuration et état de l’optimiseur. Un modèle publié correspond souvent à un checkpoint sélectionné, éventuellement converti dans un autre format ou quantifié pour l’inférence.
Attention
Important
Opération qui calcule, pour chaque élément d’une séquence, une combinaison pondérée des représentations d’autres éléments. Dans l’auto-attention, les requêtes, clés et valeurs proviennent de la même séquence. Les poids obtenus participent au calcul du modèle ; ils ne constituent pas automatiquement une explication de sa décision.
Fenêtre de contexte
Important
Nombre maximal de tokens accepté dans une opération par le modèle ou le service. Selon l’implémentation, cette limite porte sur l’entrée seule ou sur l’entrée et la sortie réunies. Elle indique une capacité technique maximale, pas la qualité avec laquelle le modèle exploite une information située loin dans le contexte.
Hallucination
Important
Dans le cas d’un modèle génératif, contenu plausible mais faux, non étayé par les données fournies ou incompatible avec elles. Une séquence peut être probable linguistiquement sans avoir été vérifiée comme vraie : le terme décrit ce décalage, pas une perception comparable à celle d’un humain.
Modèle local
Important
Modèle dont l’inférence s’exécute sur l’ordinateur ou le réseau de l’utilisateur plutôt que sur le serveur d’un fournisseur d’API. « Local » décrit le mode de déploiement, pas une architecture particulière : les mêmes poids peuvent parfois être exécutés localement ou à distance.
Quantification
Important
Représentation des poids — et parfois des activations — avec moins de bits, par exemple en 8 ou 4 bits, afin de réduire l’usage mémoire et le coût de certains calculs. La quantification post-entraînement, fréquente pour les modèles locaux, conserve l’architecture mais approxime les valeurs d’origine ; l’effet sur la vitesse et la qualité dépend du matériel et de la méthode.
GPU
Important
Sigle de Graphics Processing Unit, ou processeur graphique. Ses nombreuses unités de calcul parallèle sont adaptées aux opérations matricielles des réseaux de neurones. Un GPU peut accélérer l’entraînement et l’inférence, à condition que le logiciel et les types numériques utilisés soient pris en charge.
VRAM
Important
Sigle de Video Random Access Memory : mémoire directement accessible par le GPU. Pendant l’inférence locale, elle contient notamment tout ou partie des poids, les activations temporaires et le cache d’attention. Sa capacité détermine donc quels modèles, quantifications et longueurs de contexte peuvent être chargés sans déport vers la mémoire vive.
Benchmark
Important
Ensemble défini de tâches, données, métriques et conditions servant à comparer des modèles ou des systèmes. Un résultat n’est interprétable qu’avec son protocole : version du modèle, prompt, méthode de notation et, pour les mesures de vitesse, matériel et réglages.
RAG
Important
Sigle de Retrieval-Augmented Generation, ou « génération augmentée par récupération ». Un composant recherche des passages dans une source externe, puis le générateur produit sa réponse en étant conditionné par les passages retenus. La récupération n’exige pas, à elle seule, de modifier les poids du générateur, même si un système RAG complet peut aussi être entraîné ou fine-tuné.
Embedding
Pour aller plus loin
Vecteur numérique produit par un modèle pour représenter un token, un texte, une image ou un autre objet. Dans l’espace propre à ce modèle, une mesure de distance peut servir à rechercher ou regrouper des éléments similaires. Les embeddings sont notamment utilisés par de nombreux systèmes RAG pour retrouver des passages.
Fine-tuning
Pour aller plus loin
Poursuite de l’entraînement à partir d’un modèle préentraîné, sur des données et un objectif plus ciblés. Selon la méthode, tous les poids ou seulement une petite partie sont ajustés. Le fine-tuning modifie des paramètres ; fournir des exemples dans un prompt ou récupérer des documents par RAG n’en est pas, en soi, un.
Modèle multimodal
Pour aller plus loin
Modèle qui reçoit ou produit plusieurs modalités, par exemple texte, image, audio ou vidéo. Le terme ne signifie pas nécessairement que toutes les combinaisons sont possibles : un modèle peut accepter texte et image mais ne générer que du texte.
Poids ouverts
Pour aller plus loin
Expression désignant des poids de modèle publiquement téléchargeables. La licence précise les droits de copie, de modification et d’usage ; certaines imposent des restrictions. « Poids ouverts » n’implique pas que le code d’entraînement, les données et la méthode complète soient publiés comme dans un projet open source reproductible.
Température
Pour aller plus loin
Paramètre utilisé lors de la génération par échantillonnage : les scores des tokens sont divisés par la température avant leur conversion en probabilités. Une valeur inférieure à 1 concentre la distribution sur les tokens déjà les mieux classés ; une valeur supérieure à 1 l’aplatit et augmente la probabilité de choix moins bien classés. Elle règle donc la dispersion de l’échantillonnage sans modifier les poids du modèle.
Agent
Pour aller plus loin
Système logiciel qui place un modèle dans une boucle : recevoir un objectif, choisir une action, appeler éventuellement un outil, observer le résultat puis poursuivre ou s’arrêter. L’agent comprend donc le modèle mais aussi l’orchestration, l’état, les outils et les règles d’autorisation ; ce n’est pas une propriété du modèle seul.
Aucun terme ne correspond à cette recherche.