Projet · Actif

Lexique de l’intelligence artificielle

Des définitions courtes pour comprendre les mots employés dans nos articles, nos essais et nos tests de modèles locaux.

26 termes

  1. Modèle

    Essentiel

    Terme ambigu : il peut désigner une architecture, cette architecture accompagnée des paramètres appris pendant l’entraînement, ou une version précise de ces paramètres. Dans l’usage courant de l’IA générative, un modèle désigne le plus souvent une architecture neuronale avec des poids entraînés, prête pour l’inférence. Deux modèles peuvent donc partager la même architecture sans partager les mêmes poids.

    Voir aussi : Architecture, Entraînement, Poids du modèle (paramètres), Inférence

  2. Architecture

    Essentiel

    Description de l’organisation d’un réseau de neurones : types de couches, connexions et opérations effectuées. Elle ne contient pas, à elle seule, les poids appris. Une même architecture peut servir à entraîner plusieurs modèles distincts ; Transformer est une famille d’architectures, pas le nom d’un jeu de poids particulier.

    Voir aussi : Modèle, Transformer, Poids du modèle (paramètres)

  3. Modèle de langage

    Essentiel

    Modèle qui attribue des probabilités à des séquences de tokens ou à des tokens masqués à partir de leur contexte. Selon son objectif d’entraînement, il peut notamment compléter ou générer du texte. Il peut être petit ou grand et n’est pas nécessairement fondé sur un Transformer : un LLM est un modèle de langage à grande échelle, mais l’inverse n’est pas vrai.

    Voir aussi : Modèle, Grand modèle de langage (LLM), Token

  4. Grand modèle de langage (LLM)

    Essentiel

    Sigle de Large Language Model, ou « grand modèle de langage ». Il désigne un modèle de langage entraîné à grande échelle — en quantité de paramètres, de données et de calcul — et généralement fondé sur une architecture Transformer. Tous les LLM sont des modèles de langage, mais tous les modèles de langage ne sont pas des LLM ; aucun seuil unique ne définit le mot « grand ».

    Voir aussi : Modèle de langage, Transformer, Poids du modèle (paramètres)

  5. Transformer

    Essentiel

    Famille d’architectures neuronales qui traite des séquences au moyen de blocs d’attention et de réseaux entièrement connectés, avec une information sur la position des éléments. Transformer désigne une architecture ; LLM décrit l’échelle et la fonction d’un modèle de langage. La plupart des LLM actuels emploient une variante du Transformer.

    Voir aussi : Architecture, Attention, Grand modèle de langage (LLM)

  6. Token

    Essentiel

    Unité produite par le tokenizer avant le traitement d’un texte par le modèle. Selon le vocabulaire et la méthode de tokenisation, un token peut représenter un mot, un fragment de mot, un signe ou une combinaison incluant une espace. Il est ensuite converti en identifiant numérique.

    Voir aussi : Modèle de langage, Fenêtre de contexte

  7. Prompt

    Essentiel

    Contenu fourni au modèle au moment de l’inférence : consigne, question, exemples, historique ou documents. La sortie est calculée conditionnellement à ce contenu. Ajouter une information dans le prompt peut donc être utile pour la réponse en cours, sans modifier les paramètres entraînés du modèle.

    Voir aussi : Inférence, Fenêtre de contexte

  8. Inférence

    Essentiel

    Utilisation d’un modèle entraîné pour calculer une sortie à partir d’une entrée, avec ses paramètres alors fixés. Pour un LLM génératif, cette entrée est habituellement constituée du prompt et du contexte disponible : instructions, historique de la conversation et éventuels documents ajoutés. Générer la réponse relève de l’inférence, par opposition à l’entraînement qui ajuste les paramètres.

    Voir aussi : Modèle, Prompt, Fenêtre de contexte, Entraînement, Modèle local

  9. Entraînement

    Essentiel

    Processus qui ajuste les paramètres d’un modèle afin de réduire une fonction de perte mesurée sur des données. Il transforme une architecture initialisée en modèle entraîné. Le préentraînement construit les capacités générales ; d’autres étapes peuvent ensuite spécialiser ou aligner le modèle.

    Voir aussi : Modèle, Poids du modèle (paramètres), Fine-tuning

  10. Poids du modèle (paramètres)

    Essentiel

    Les paramètres sont les valeurs numériques ajustées pendant l’entraînement et utilisées dans les calculs du réseau. Dans l’usage courant, « poids du modèle » désigne l’ensemble de ces paramètres, même si le terme technique peut aussi distinguer les poids d’autres paramètres comme les biais. Une information apprise est généralement répartie dans de nombreuses valeurs.

    Voir aussi : Modèle, Entraînement, Checkpoint

  11. Checkpoint

    Important

    État sauvegardé d’un entraînement à une étape donnée : poids du modèle et, selon le cas, configuration et état de l’optimiseur. Un modèle publié correspond souvent à un checkpoint sélectionné, éventuellement converti dans un autre format ou quantifié pour l’inférence.

    Voir aussi : Modèle, Poids du modèle (paramètres), Quantification

  12. Attention

    Important

    Opération qui calcule, pour chaque élément d’une séquence, une combinaison pondérée des représentations d’autres éléments. Dans l’auto-attention, les requêtes, clés et valeurs proviennent de la même séquence. Les poids obtenus participent au calcul du modèle ; ils ne constituent pas automatiquement une explication de sa décision.

    Voir aussi : Transformer

  13. Fenêtre de contexte

    Important

    Nombre maximal de tokens accepté dans une opération par le modèle ou le service. Selon l’implémentation, cette limite porte sur l’entrée seule ou sur l’entrée et la sortie réunies. Elle indique une capacité technique maximale, pas la qualité avec laquelle le modèle exploite une information située loin dans le contexte.

    Voir aussi : Token, Prompt

  14. Hallucination

    Important

    Dans le cas d’un modèle génératif, contenu plausible mais faux, non étayé par les données fournies ou incompatible avec elles. Une séquence peut être probable linguistiquement sans avoir été vérifiée comme vraie : le terme décrit ce décalage, pas une perception comparable à celle d’un humain.

  15. Modèle local

    Important

    Modèle dont l’inférence s’exécute sur l’ordinateur ou le réseau de l’utilisateur plutôt que sur le serveur d’un fournisseur d’API. « Local » décrit le mode de déploiement, pas une architecture particulière : les mêmes poids peuvent parfois être exécutés localement ou à distance.

    Voir aussi : Inférence, GPU, VRAM, Quantification

  16. Quantification

    Important

    Représentation des poids — et parfois des activations — avec moins de bits, par exemple en 8 ou 4 bits, afin de réduire l’usage mémoire et le coût de certains calculs. La quantification post-entraînement, fréquente pour les modèles locaux, conserve l’architecture mais approxime les valeurs d’origine ; l’effet sur la vitesse et la qualité dépend du matériel et de la méthode.

    Voir aussi : Poids du modèle (paramètres), Checkpoint, VRAM, Inférence

  17. GPU

    Important

    Sigle de Graphics Processing Unit, ou processeur graphique. Ses nombreuses unités de calcul parallèle sont adaptées aux opérations matricielles des réseaux de neurones. Un GPU peut accélérer l’entraînement et l’inférence, à condition que le logiciel et les types numériques utilisés soient pris en charge.

  18. VRAM

    Important

    Sigle de Video Random Access Memory : mémoire directement accessible par le GPU. Pendant l’inférence locale, elle contient notamment tout ou partie des poids, les activations temporaires et le cache d’attention. Sa capacité détermine donc quels modèles, quantifications et longueurs de contexte peuvent être chargés sans déport vers la mémoire vive.

  19. Benchmark

    Important

    Ensemble défini de tâches, données, métriques et conditions servant à comparer des modèles ou des systèmes. Un résultat n’est interprétable qu’avec son protocole : version du modèle, prompt, méthode de notation et, pour les mesures de vitesse, matériel et réglages.

  20. RAG

    Important

    Sigle de Retrieval-Augmented Generation, ou « génération augmentée par récupération ». Un composant recherche des passages dans une source externe, puis le générateur produit sa réponse en étant conditionné par les passages retenus. La récupération n’exige pas, à elle seule, de modifier les poids du générateur, même si un système RAG complet peut aussi être entraîné ou fine-tuné.

    Voir aussi : Embedding, Fenêtre de contexte, Fine-tuning

  21. Embedding

    Pour aller plus loin

    Vecteur numérique produit par un modèle pour représenter un token, un texte, une image ou un autre objet. Dans l’espace propre à ce modèle, une mesure de distance peut servir à rechercher ou regrouper des éléments similaires. Les embeddings sont notamment utilisés par de nombreux systèmes RAG pour retrouver des passages.

  22. Fine-tuning

    Pour aller plus loin

    Poursuite de l’entraînement à partir d’un modèle préentraîné, sur des données et un objectif plus ciblés. Selon la méthode, tous les poids ou seulement une petite partie sont ajustés. Le fine-tuning modifie des paramètres ; fournir des exemples dans un prompt ou récupérer des documents par RAG n’en est pas, en soi, un.

    Voir aussi : Entraînement, RAG, Poids du modèle (paramètres)

  23. Modèle multimodal

    Pour aller plus loin

    Modèle qui reçoit ou produit plusieurs modalités, par exemple texte, image, audio ou vidéo. Le terme ne signifie pas nécessairement que toutes les combinaisons sont possibles : un modèle peut accepter texte et image mais ne générer que du texte.

  24. Poids ouverts

    Pour aller plus loin

    Expression désignant des poids de modèle publiquement téléchargeables. La licence précise les droits de copie, de modification et d’usage ; certaines imposent des restrictions. « Poids ouverts » n’implique pas que le code d’entraînement, les données et la méthode complète soient publiés comme dans un projet open source reproductible.

  25. Température

    Pour aller plus loin

    Paramètre utilisé lors de la génération par échantillonnage : les scores des tokens sont divisés par la température avant leur conversion en probabilités. Une valeur inférieure à 1 concentre la distribution sur les tokens déjà les mieux classés ; une valeur supérieure à 1 l’aplatit et augmente la probabilité de choix moins bien classés. Elle règle donc la dispersion de l’échantillonnage sans modifier les poids du modèle.

  26. Agent

    Pour aller plus loin

    Système logiciel qui place un modèle dans une boucle : recevoir un objectif, choisir une action, appeler éventuellement un outil, observer le résultat puis poursuivre ou s’arrêter. L’agent comprend donc le modèle mais aussi l’orchestration, l’état, les outils et les règles d’autorisation ; ce n’est pas une propriété du modèle seul.