Bilingual glossary & indexGlossaire bilingue et index
An English/French glossary that doubles as an index across the website. Every
term or concept mentioned in a module carries a tooltip and links to its entry
here, and every entry records where the term is introduced and where it is used.
232 entries; select one to open it.
Un glossaire anglais-français qui sert aussi d'index pour l'ensemble du site.
Chaque terme ou concept mentionné dans un module est accompagné d'une infobulle
et mène à son entrée ici, et chaque entrée indique où le terme est présenté et
où il est employé. 232 entrées ; sélectionnez-en une pour
l'ouvrir.
What each entry contains, and how it is madeCe que contient chaque entrée, et comment elle est faite
English term and French term
For French I relied on high-quality Canadian sources wherever possible:
DataFranca for
artificial intelligence, machine learning and language technology,
TERMIUM Plus (Government
of Canada) and the
Vitrine linguistique
of the Office québécois de la langue française. Where these sources did not
contain the term I was looking for, I used another source or suggested my own
equivalent, usually a descriptive, relatively literal translation. Entries name
the record the term comes from; a French term I suggested myself carries an
asterisk, and attested alternatives are listed.
Definition in English
This is not necessarily a definition up to the standards of a formal glossary.
It is a practical guide, based on verified sources and my own expertise,
written for the readers of these materials.
Definition in French
Always a machine translation of the English definition. I ground the
translations in the available French terminology, but I do not revise them:
my French is good, but for this particular task I am more likely to introduce
translation errors than the model I use. The
AI transparency statement says how AI is
used across the site.
Sources
Every entry names the sources its definition is based on and the record its
French term comes from. Definition sources link to the full reference in the
bibliography.
Where the term appears
Each entry lists the chapter where the term is introduced and explained, and
the pages where it is used without being explained, plus cross-references to
related entries. Where a word has more than one sense, the entry names the one
it covers: attribute is the XML sense, and homographs are numbered
(token¹ in linguistics, token² in language models).
The colour on each card
The coloured edge is the module where the term is introduced, in that module's
own accent, the same one it uses everywhere else on the site. Terms no chapter
introduces yet have a plain edge.
Terme anglais et terme français
Pour le français, je me suis appuyée autant que possible sur des sources
canadiennes de qualité :
DataFranca pour
l'intelligence artificielle, l'apprentissage automatique et les technologies
langagières, TERMIUM Plus
(gouvernement du Canada) et la
Vitrine linguistique
de l'Office québécois de la langue française. Quand ces sources ne contenaient
pas le terme cherché, j'ai utilisé une autre source ou proposé mon propre
équivalent, en général une traduction descriptive et assez littérale. Chaque
entrée nomme la fiche d'où vient le terme ; un terme français que je
propose moi-même porte un astérisque, et les variantes attestées sont
indiquées.
Définition en anglais
Ce n'est pas nécessairement une définition répondant aux normes d'un glossaire
formel. C'est un guide pratique, fondé sur des sources vérifiées et sur ma
propre expertise, rédigé pour le lectorat de ce matériel.
Définition en français
Toujours une traduction automatique de la définition anglaise. J'ancre les
traductions dans la terminologie française disponible, mais je ne les révise
pas : mon français est bon, mais pour cette tâche précise, je suis plus
susceptible d'introduire des erreurs de traduction que le modèle que j'utilise.
La déclaration de transparence sur l'IA
explique l'usage de l'IA sur le site.
Sources
Chaque entrée nomme les sources sur lesquelles repose sa définition ainsi que
la fiche d'où provient son terme français. Les sources des définitions mènent à
la référence complète dans la
bibliographie.
Où le terme apparaît
Chaque entrée indique le chapitre où le terme est présenté et expliqué, les
pages où il est employé sans être expliqué, et les renvois vers les entrées
apparentées. Quand un mot a plusieurs sens, l'entrée précise celui qu'elle
traite : attribut est le sens XML, et les homographes sont
numérotés (jeton¹ en linguistique, jeton² pour les modèles de langue).
La couleur de chaque fiche
Le liseré coloré correspond au module où le terme est présenté, dans la teinte
propre à ce module, la même que partout ailleurs sur le site. Les termes
qu'aucun chapitre ne présente encore ont un liseré neutre.
No entries match the current filter.Aucune entrée ne correspond au filtre.
A
agentic AIfr IA agentive
ContextagentsAI
AI systems that can work toward a goal with limited human guidance by deciding what to do next, remembering relevant information from earlier steps, using external tools or software, and acting on the results, often with several specialized AI agents working together.
other attested French terms: IA générative multiagent, IA agentique
An AI system that selects and carries out actions toward a goal, often by using tools or calling other programs and adapting later actions to the results it receives.
other attested English terms: agent
other attested French terms: agent intelligent autonome
AI-generated content that looks polished or competent at first glance but has little substance, takes very little effort to produce compared with making it without AI, and can be produced in very large quantities.
other attested French terms: IA dégénérative, bouillie d'IA
The process of pairing a source text with an existing translation of it, segment by segment, so that the pairs can be stored as translation units in a translation memory.
Notes Alignment is how a memory is built out of documents translated before any tool was involved, or translated by someone else. Software aligns automatically, by sentence or by word, and the output is checked by hand: one sentence split into two in the translation, or a paragraph moved, puts the two texts out of step from that point onwards.
other attested English terms: text alignment, translation alignment, bitext alignment
The either/or of a regular expression, written with a vertical bar: /cat|dog/ matches one or the other, and the first alternative that matches at that point is the one taken.
Notes The bar has the lowest precedence of any operator, so on its own it separates everything to its left from everything to its right; a group is what limits its reach, which is why /^(cat|dog)$/ and /^cat|dog$/ do not mean the same thing.
* “amplification” is my own suggestion: no term bank attests it.
anchorfr ancre*
Contextregular expressions
A regular-expression construct that matches a position in the text rather than a character, so it makes a match succeed or fail without consuming anything.
Notes The line anchors are ^ for the start of a line and $ for the end; under the multiline flag they apply line by line rather than to the whole text. Because they consume nothing, /^$/ finds an empty line, where the two positions fall together, and /^\d/ matches one digit rather than a digit plus the start of the line.
application programming interface (API)fr interface de programmation d'application (API)
Contextcomputing
A standardized interface that allows software applications to communicate by sending requests and receiving responses, without needing to know how the other application works internally.
A field of research and practice concerned with developing computer systems that perform functions associated with intelligence, such as perception, learning, reasoning, language use, and decision-making. By extension, the term also refers to the systems themselves, as in the increasingly common expression "an AI". For this second sense, the OECD defines an AI system as "a machine-based system that, for explicit or implicit objectives, infers, from the input it receives, how to generate outputs such as predictions, content, recommendations, or decisions that can influence physical or virtual environments. Different AI systems vary in their levels of autonomy and adaptiveness after deployment" (Grobelnik et al., 2024).
ASCIIfr code ASCII
Contexttext encoding
A 7-bit coded character set of 128 characters for information interchange, standardized as ANSI X3.4 and adopted as the US national variant of ISO/IEC 646. It holds the unaccented letters of the English alphabet, the digits, common punctuation and a set of control codes, and no accented letter. The first 128 characters of Unicode are the ASCII ones, in the same order, which is why UTF-8 stores them in a single byte.
other attested English terms: American Standard Code for Information Interchange
other attested French terms: ASCII, code américain normalisé pour l'échange d'information
A rule or numerical structure that prevents an attention layer from assigning attention to specified token positions.
Notes For example, a causal attention mask blocks access to later positions during next-token prediction, while a padding mask prevents the model from attending to placeholder tokens added to make sequences the same length. An attention mask controls the flow of information within an attention calculation; it is different from the masking used in masked language modeling, where selected input tokens are hidden or altered to create a prediction task.
A "method in neural networks that helps a model focus on the most relevant parts of the input when producing an output. For example, when translating a sentence, it 'pays attention' to the words that matter most for the next translated word, which improves accuracy and handling of long sequences." (Stanford HAI).
In XML, a name-value pair written in an element's start-tag or empty-element tag to provide additional information about that element, such as its language, identifier, or creation date.
automatic prompt optimizationfr optimisation automatique de requêtes*
Contextprompting
The use of an algorithm to generate, evaluate, and iteratively revise candidate prompts in order to improve a model's performance on a specified task or evaluation measure.
A method of generating a sequence, such as text, one token at a time.
Notes At each step, the model uses the tokens generated so far to assign probabilities to possible next tokens, selects one using a decoding method, and repeats the process until it reaches a stopping point. Autoregressive indicates that each generated token depends on the preceding sequence; it does not mean that the model considers only the immediately preceding token.
* “génération autorégressive” is my own suggestion: no term bank attests it.
B
base modelfr modèle de base
Contextlanguage models
A language model that has completed pretraining but has not yet undergone post-training.
Notes It can generate text by predicting successive tokens, but it has not received additional training intended to improve instruction-following, alignment with human preferences, or complex reasoning.
A decoding method that keeps a fixed number of promising partial sequences at each generation step. It extends these candidates with possible next tokens, scores the resulting sequences and retains only the highest-scoring candidates for the next step, allowing the decoder to reconsider several alternatives instead of committing immediately to one token.
Notes The number of candidates retained is called the beam width. Beam search is a heuristic, so it is not guaranteed to find the globally best sequence once lower-scoring paths have been discarded. It is particularly common in constrained sequence-generation tasks such as machine translation and speech recognition, while sampling is generally more common for open-ended conversational generation.
other attested French terms: algorithme de recherche en faisceau
A standardized evaluation used to measure and compare how AI systems perform on particular tasks or capabilities.
Notes It generally combines a test set (such as questions, examples, or another task) with a scoring method such as accuracy. A benchmark may overstate a model's abilities if its test material appeared in the model's training data (see data contamination). Moreover, strong performance on a particular benchmark does not necessarily translate into strong performance in real-world situations.
other attested French terms: test d'évaluation des performances
A systematic tendency in an AI system, or in the processes surrounding it, that makes certain outputs, errors, or effects more likely than others.
Notes Bias can arise from training data, choices about what to measure or predict, model design and evaluation, human assumptions, institutional practices, or the context in which the system is used. In responsible AI, the term generally refers to unwanted bias that makes results inaccurate, unrepresentative, or unfair, particularly for certain people or groups. Bias need not be intentional, and statistical bias does not necessarily amount to discrimination.
bidirectional language modelfr modèle de langue bidirectionnel*
Contextlanguage models
A language model that can use context from token positions both before and after a given position when computing its representation or prediction.
Notes In a bidirectional transformer encoder, self-attention can draw on the entire available input sequence. This is useful for representing and analyzing existing text, as in BERT and other masked language models. Bidirectional does not necessarily mean that the text is processed in two separate passes; in a transformer encoder it means that a token representation may incorporate information from positions on both sides. A bidirectional language model is not necessarily a masked language model, although masked language modeling is a common way to train one.
other attested English terms: bidirectional model
other attested French terms: modèle de langage bidirectionnel, modèle bidirectionnel
* “modèle de langue bidirectionnel” is my own suggestion: no term bank attests it.
byte-pair encoding (BPE)fr encodage par paires d'octets
Contextlanguage modelsNLP
A subword tokenization method that learns a vocabulary from training text by repeatedly joining frequently occurring adjacent characters or bytes.
Notes It then applies the learned combinations to new text, allowing common words or sequences to become single tokens while representing rarer or unfamiliar words as several smaller tokens.
In a regular expression, a part of a pattern enclosed in parentheses, so that a quantifier or an alternation applies to the whole of it rather than to one character: /(ha)+/ repeats the pair, /(anti|pro)nuclear/ puts the choice inside the shared word.
Notes What each group matched is also kept, which is what lets a find-and-replace put those pieces back into the replacement.
* “groupe de capture” is my own suggestion: no term bank attests it.
carbon footprintfr empreinte carbone
Contextenvironment
"A carbon footprint is the total amount of greenhouse gases [...] released into the atmosphere as a result of human activities. These emissions are primarily carbon dioxide (CO₂), but also include methane (CH₄), nitrous oxide (N₂O) and other gases that contribute to climate change. To make these different greenhouse gases easier to compare, a carbon footprint is usually expressed in carbon dioxide equivalents (CO₂e) [...], based on each gas's global warming potential [...]. The concept can be applied at different levels: individuals have a personal carbon footprint shaped by everyday choices such as transport, home energy use, diet and consumption habits. Products carry a carbon footprint across their life cycle, from raw material extraction and manufacturing to transport, use, disposal or recycling. Organizations generate carbon emissions through their operations, supply chains, buildings, services and products. Even specific events and activities, such as a conference, concert or flight, can be assessed for their carbon impact." (ISO).
A language model that predicts each token using only the token positions that precede it in the sequence; it cannot use later tokens when making that prediction.
Notes This restriction makes the model suitable for autoregressive generation, in which it generates a token, adds it to the available context and then predicts the next one. In language modelling, causal refers to the restriction on access to later token positions; it does not mean that the model discovers cause-and-effect relationships. Causal language model and autoregressive language model are often used interchangeably: more precisely, causal describes the permitted information flow, while autoregressive describes the factorization or generation process.
other attested French terms: modèle de langage causal
A convention for representing the characters in a text as sequences of bytes so that the text can be stored, transmitted, and reconstructed. The same bytes may produce different characters when interpreted using different encodings, so the declared encoding must correspond to the encoding actually used to save the file. Character encoding should not be confused with a font, which controls how characters look, or with a character repertoire, which determines which characters are available.
coherence-correspondence distinctionfr distinction entre cohérence et correspondance*
Contextevaluationlanguage models
A framework for evaluating an LLM's outputs according to two different criteria.
Notes Coherence concerns whether the claims, expressed reasoning and conclusion within an output are mutually consistent and logically connected; correspondence concerns whether the output agrees with external facts or successfully predicts real-world outcomes. An output may therefore be coherent but factually incorrect, or reach a correct answer through inconsistent or invalid reasoning.
* “distinction entre cohérence et correspondance” is my own suggestion: no term bank attests it.
collocationfr collocation
Contextcorporalinguistics
A combination of words that co-occur more often than chance would predict and form a habitual, semi-fixed pairing, such as heavy rain or commit a crime (rather than strong rain or do a crime).
Notes Corpus tools identify collocations statistically, by comparing how often two words appear together with how often they would be expected to by chance. Knowing the collocations of the target language is a large part of producing idiomatic text, which makes corpus-based collocation lookup directly useful in translation.
A nonprofit organization that regularly collects publicly accessible web data and makes the resulting archives and datasets freely available.
Notes Filtered and processed versions of Common Crawl data have been used to train many large language models.
comparable corpusfr corpus comparable*
Contextcorporatranslation
A corpus containing texts in two or more languages (or language varieties) that are not translations of each other but share a subject, genre or communicative function, such as press articles written independently in French and in English on the same events.
Notes Comparable corpora show how each language expresses similar content natively, free of translation influence, which makes them useful for terminology work and for checking that a translation reads like an original.
The interdisciplinary study of human language from a computational perspective, including the development of computational models of linguistic phenomena.
Notes The terms computational linguistics and natural language processing are used more or less interchangeably.
* “utilisation d'un ordinateur” is my own suggestion: no term bank attests it.
computer-assisted translation (CAT)fr traduction assistée par ordinateur (TAO)
ContextCAT toolstranslation
Software that assists a human translator during the translation process, commonly by dividing texts into segments and providing functions such as translation-memory retrieval, terminology management, consistency checks and file management.
Notes Unlike machine translation, the human translator remains responsible for producing and approving the translation, although a CAT tool may incorporate machine-generated suggestions.
A display of all occurrences of a word or expression in a corpus, each shown with its surrounding context, typically one occurrence per line with the search word aligned in the middle (the key word in context, or KWIC, format).
Notes Concordances let an analyst move from counting words to observing how they are used: their typical constructions, collocations, register and senses. The tool that produces them is called a concordancer.
The process by which an online service reviews and acts on content to enforce legal requirements or platform rules.
Notes Actions can include labelling content, reducing its visibility, restricting access to it, or removing it, and may be performed by human reviewers, automated systems, or both.
A translation-memory match in which the stored source segment is identical to the segment being translated and the segments around it match as well, so the stored translation was produced in the same surroundings.
Notes It therefore depends on segmentation twice over: on the segment itself, and on where segmentation placed its neighbours. Tools treat it as more dependable than a plain exact match and label it separately, above 100 % or under a name of their own, because the commonest reason an identical sentence needs a different translation is that it sits somewhere else in the document.
other attested English terms: in-context exact match, 101 % match
other attested French terms: correspondance exacte avec contexte
"The amount of input (like text) that an AI system can process at one time during a task. Think of it as a model's short-term memory. A model can only consider so much text when generating its next response, and once the conversation exceeds its context window, the model starts 'forgetting' prior responses." (Stanford HAI).
A numerical representation generated for a particular occurrence of a token by taking account of the other tokens available to the model.
Notes The representation can therefore change according to the token's context: bank can receive different representations in river bank and bank account. In a transformer, each layer progressively combines information from relevant token positions, producing increasingly contextualized representations. Depending on the model, the available context may include preceding text, following text, or both. Unlike a static embedding, a contextual embedding is computed for a particular occurrence rather than retrieved as a single permanent representation from a vocabulary. Contextual embeddings can encode information related to a token's meaning, grammatical role and relationships with other parts of the text; different layers of a model may capture different kinds of information, so a contextual embedding should not be understood as a complete or directly interpretable representation of meaning.
other attested English terms: contextualized word representation
copyright infringementfr violation du droit d'auteur
Contextlawethics & society
"Copyright infringement occurs when a person uses content protected by copyright in a way that violates rights granted in the Copyright Act, for example by copying or communicating to the public a copyrighted work (all or a substantial part of it) without authorization from the owner of the copyright." (Government of Canada).
A collection of written texts, speech recordings or transcribed language assembled for analysis or use in language technology (plural: corpora).
Notes In corpus linguistics, a corpus is typically machine-readable and selected and documented according to explicit criteria so that it can support research on a particular language or language variety. In NLP, the term is often used more broadly for a collection of language data used to train, develop or evaluate a system, even when the collection was not designed to be balanced or representative.
An attention mechanism in which the queries come from one sequence or component and the keys and values come from another.
Notes In an encoder-decoder model, cross-attention allows the decoder to select information from the encoder's representations while producing the output. Cross-attention can also connect text with image, audio or other representations in multimodal systems. In self-attention, queries, keys and values are derived from the same sequence; in cross-attention, they connect different sequences or components. Standard decoder-only language models have no separate encoder and therefore do not use the encoder-decoder form of cross-attention, although multimodal variants may add cross-attention modules.
User-provided preferences, background information, or requirements that an AI assistant stores and applies automatically across conversations, so that they do not need to be repeated in every prompt.
* “instructions personnalisées” is my own suggestion: no term bank attests it.
D
data annotationfr annotation des données
ContextdataNLP
The process of adding labels or other structured information, such as categories, tags, transcriptions, or marked regions, to data so that it can be used to train or evaluate a machine learning system.
Notes Annotation is often carried out by people, sometimes with machine assistance, and may involve judgement when the appropriate labels are not unambiguous.
A facility that houses computing, storage, and networking equipment, together with supporting infrastructure such as power supplies, cooling systems, and security systems.
Notes Data centres provide the computing resources used to train and run AI models, although AI is only one of the workloads they support. The growing use of data centres, including for AI, is increasing their overall electricity demand.
A problem that occurs when some of the data used to evaluate a model also appears in its training data.
Notes Because the model may already have encountered the evaluation examples, its benchmark results can overstate how well it performs on genuinely unseen material.
The operation of searching for data according to precise criteria, in a database or another source, and isolating them in order to remove them from the set they belong to, or to copy or migrate them to another database (translated from the OQLF's French definition).
A neural-network component or architecture used to generate an output sequence.
Notes During generation, a decoder processes the tokens already available and produces a probability distribution over possible next tokens. Its attention mechanism is normally restricted so that a prediction cannot use tokens that have not yet been generated. In an encoder-decoder model, the decoder also draws on a representation of the input produced by a separate encoder, an arrangement commonly used for tasks such as machine translation. In a decoder-only model there is no separate encoder: the prompt and the previously generated tokens are processed as a single sequence, and most contemporary general-purpose generative language models use this architecture. The decoder calculates the next-token probabilities; a decoding method, such as greedy decoding or top-p sampling, determines how an output token is selected from those probabilities.
A transformer language-model architecture that uses a sequence of decoder blocks without a separate encoder.
Notes At each token position, causal masking allows the model to use earlier token positions but prevents it from using later positions in the same sequence. During text generation, the model uses the prompt and the tokens already generated to predict a probability distribution for the next token, selects a token through a decoding method, adds it to the sequence and repeats the process. This architecture is widely used for general-purpose generative language models. "Earlier" refers to earlier token positions in the modelled sequence, not necessarily to words visually appearing on the left, and causal masking does not mean the prompt must be processed one token at a time: its token representations can be computed in parallel while respecting the restriction on access to later positions. Unlike a decoder inside an encoder-decoder model, a decoder-only model normally has no cross-attention layer for reading a separate encoder's output.
* “modèle à décodeur seul” is my own suggestion: no term bank attests it.
decodingfr décodage*
Contextlanguage models
The process used during text generation to turn a language model's predicted probabilities into an actual sequence of output tokens.
Notes At each generation step, the model assigns probabilities to possible next tokens, and a decoding method determines which token is selected; the selected token is added to the preceding context, the model calculates a new probability distribution, and the process repeats until a stopping condition is reached. Different decoding methods make these selections differently: greedy decoding always chooses the most probable next token, while sampling methods allow other likely tokens to be chosen, and controls such as temperature, top-k and top-p change how varied or predictable the resulting text is. Decoding does not retrain the model or change its parameters, but it can substantially affect the wording, diversity and quality of its output. This entry concerns decoding during autoregressive language generation; in other areas of natural language processing, decoding can refer more broadly to finding the most likely output or hidden sequence, as in Viterbi decoding.
* “décodage” is my own suggestion: no term bank attests it.
deep learning (DL)fr apprentissage profond
Contextmachine learningAI
An approach to machine learning based on neural networks with many successive layers of computing units.
Notes The term deep refers to this layered architecture, in which each layer processes information received from the preceding layer.
denoisingfr débruitage
Contextmachine learning
A training approach in which input data are deliberately corrupted and a model learns to reconstruct the original or otherwise clean version.
Notes For text, corruption may involve masking, deleting, replacing, inserting or reordering tokens; masked language modeling is one form of denoising. Noise need not be random visual or acoustic interference: in machine learning, any deliberate alteration that the model is trained to reverse may function as noise.
other attested French terms: apprentissage par débruitage
A vector in which most or all components are non-zero real numbers.
Notes In natural language processing, dense vectors are often relatively short, learned representations of words or other tokens. Their individual dimensions usually have no obvious interpretation, but the vector as a whole can represent useful similarities between items.
Describes a process, algorithm, or system that, under the same initial conditions and with the same input, always produces the same output.
Notes The corresponding noun, determinism, is the property of a process that produces the same output whenever it begins from the same state and receives the same input. Both are often discussed in the context of neural networks, and of LLMs in particular, where randomness in decoding and in the computing environment can make outputs vary between runs.
Inequalities between people, communities, organizations, or regions in their access to digital technologies, their ability to use those technologies effectively, and the benefits they obtain from their use.
Notes In the context of AI, the digital divide can also include unequal access to suitable AI tools, data, computing resources, technical expertise, and systems that work effectively for different languages and communities.
direct preference optimization (DPO)fr optimisation directe des préférences (DPO)
Contextlanguage modelsmachine learning
A preference-alignment method that trains a language model directly from pairs of preferred and rejected responses.
Notes Training increases the relative probability of preferred responses while limiting how far the resulting model moves from a reference model. Unlike common RLHF methods, DPO does not require a separately trained reward model or a reinforcement-learning stage that repeatedly samples from the model being updated. DPO eliminates the explicit reward model, not the assumptions underlying preference modelling: its results still depend on the quality, coverage and values represented in the preference data.
A representation in which an item or concept is encoded by a pattern of values across multiple units or dimensions, while each unit or dimension contributes to the representation of multiple items.
Notes Unlike a local representation, no single unit alone represents the entire item or concept. In NLP, embeddings typically use distributed representations: information about a word or token is spread across many vector dimensions rather than stored in a single identifiable dimension.
The linguistic hypothesis that patterns of word use provide evidence about meaning: words that occur with similar neighbouring words are likely to have related or similar meanings.
Notes Many methods for learning word embeddings from text are based on this principle.
The building block of an XML document: an opening tag, the content it delimits and a closing tag, or a single empty-element tag when there is no content.
Notes Elements nest inside one another and form the document's tree.
* “élément” is my own suggestion: no term bank attests it.
embedding arithmeticfr arithmétique vectorielle appliquée aux plongements*
Contextembeddings
The use of addition and subtraction on embedding vectors to test whether a semantic relationship is represented as an approximately consistent direction or offset in an embedding space.
Notes A familiar illustration is that the vector produced by king − man + woman may lie near the vector for queen.
* “arithmétique vectorielle appliquée aux plongements” is my own suggestion: no term bank attests it.
embedding spacefr espace de plongement
Contextembeddings
A vector space into which an embedding method maps items such as words, sentences, documents, or images.
Notes Each item is represented by a vector, and the geometry of the space is constructed or learned so that proximity or other geometric relationships reflect patterns useful for the intended task.
other attested French terms: espace de plongement vectoriel
An ability is described as emergent when a model shows little or no measured success on a task at smaller scales but substantially better performance at a larger scale, in a way that is not predicted by simply extrapolating the smaller models' results.
Notes Apparent emergence can depend on how performance is measured and therefore does not necessarily demonstrate that an entirely new ability appeared suddenly.
The component of a neural network that processes an input and converts it into internal representations that can be used by another component or by a task-specific output layer.
Notes In a transformer encoder, self-attention allows the representation of each input token to incorporate information from other token positions. An encoder may form part of an encoder-only model or supply representations to the decoder in an encoder-decoder model. Saying that an encoder "encodes the meaning" of the input can be convenient but overstates what is established; more precisely, it computes numerical representations learned to be useful for the model's training objective and subsequent tasks.
A neural-network architecture composed of two connected parts.
Notes The encoder processes an input sequence and produces contextual representations of it; the decoder uses those representations, together with the output tokens already produced, to generate an output sequence, in the common autoregressive form one token at a time. Because the input and output may differ in length, order, vocabulary or even modality, encoder-decoder models are useful for tasks that transform one sequence into another, including machine translation, summarization and speech recognition. In a transformer encoder-decoder model, the encoder normally uses attention across the full input sequence, while the decoder uses causal self-attention over the output generated so far and cross-attention to obtain relevant information from the encoder's representations. Encoder-decoder architectures existed before the transformer and may also use recurrent or convolutional networks; the encoder does not necessarily compress the entire input into a single fixed vector, and non-autoregressive variants also exist.
A neural-network architecture that processes an input sequence and produces a contextual representation for each input token, without using a separate decoder to generate an output sequence.
Notes In the common bidirectional transformer form, each token can be represented using information from positions both before and after it in the input. Encoder-only models are therefore especially useful for analyzing or representing text, for example in classification, information extraction, semantic similarity and search; BERT is a well-known example. These models are generally not designed to generate extended text one token at a time, although encoder-based components can be incorporated into generative systems.
* “modèle à encodeur seul” is my own suggestion: no term bank attests it.
epistemic crisisfr crise épistémique
Contextethics & societyAI
A serious disruption of the shared practices, standards, and institutions through which a society produces, verifies, and recognizes knowledge.
Notes It is marked by deep disagreement about which sources and methods are trustworthy, weakening the common factual basis needed for public judgment and collective decision-making. AI-generated misinformation can contribute to an epistemic crisis by increasing the volume and plausibility of false or unverifiable content, but such crises have broader social, political, and institutional causes.
A translation-memory match in which the stored source segment is identical to the segment being translated, character for character, so the tool can insert the stored translation as it is.
Notes The memory is searched segment by segment, so what counts as identical depends on the segmentation applied to both texts: the same sentence divided differently is not found. Identical source text does not guarantee that the same translation still fits: the same sentence may need to be rendered differently somewhere else in a document, which is what a context match adds and an exact match does not.
other attested English terms: full match, 100 % match
other attested French terms: correspondance à 100 %
eXtensible Markup Language (XML)fr langage de balisage extensible (XML)
ContextXMLmarkup
A markup language and W3C standard for storing structured data as plain text: elements delimited by tags, with attributes on them, nested in a hierarchy.
Notes The translation interchange formats TMX, TBX and XLIFF are all XML-based.
Related copyright doctrines that permit certain uses of copyright-protected material without the rightsholder's authorization.
Notes In the United States, fair use is assessed case by case using four non-exhaustive statutory factors, including the purpose and character of the use, the amount used, and its effect on the work's potential market. In Canada, fair dealing applies when the use is for a purpose specified in the Copyright Act (research, private study, education, parody, satire, criticism, review, or news reporting) and the dealing is considered fair in its circumstances. Although comparable, the two doctrines have different legal requirements and are not interchangeable.
few-shot learningfr apprentissage à peu d'exemples
Contextmachine learning
A machine-learning approach in which a model learns or adapts to perform a new task, or to recognize new categories, using only a small number of relevant examples, typically by drawing on knowledge acquired from other data or tasks.
other attested French terms: apprentissage avec peu d'exemples
few-shot promptingfr formulation de requête avec quelques exemples*
Contextprompting
A prompting technique in which a small number of demonstrations, typically examples pairing an input with its desired output, are included in the prompt to show a language model how to perform a task.
Notes The model uses these examples at inference time without updating its parameters.
other attested French terms: requête avec quelques exemples
* “formulation de requête avec quelques exemples” is my own suggestion: no term bank attests it.
fine-tuningfr affinage
Contextmachine learninglanguage models
Further training of a pretrained model on new data to adapt it for a particular task, domain, or intended behaviour.
Notes Fine-tuning may adjust all the model's parameters or only a selected subset and generally requires much less data and computation than pretraining.
other attested French terms: réglage fin, peaufinage
In programming, an option turned on or off for a whole operation, changing how it is executed.
Notes Flags are added to a regular expression as letters written after the pattern, in any order and any combination: g finds every match instead of only the first, i ignores case, m makes ^ and $ match at the start and end of each line rather than of the whole text, s lets the dot match a line break, u turns on full Unicode support.
A mechanism that allows a language model to request the use of an external function or tool by producing its name and required arguments in a structured form.
Notes The surrounding application validates and executes the function and may return its result to the model, which can then use it in generating a response.
A translation-memory match in which the stored source segment resembles the segment being translated without being identical to it, reported as a percentage below 100. The comparison is made segment by segment, so the percentage measures the distance between two segments as segmentation produced them, not between two texts.
Notes The tool proposes the stored translation and shows where the two source segments differ, and the translator adapts it. Tools apply a threshold below which no match is offered, on the reasoning that editing a distant match costs more than translating the segment afresh.
other attested English terms: partial match
other attested French terms: correspondance approximative, correspondance floue
garbage in, garbage out (GIGO)fr médiocre en entrée, médiocre en sortie (GIGO)
Contextcomputingdata
The principle that the quality and reliability of a computer system's outputs depend substantially on the quality and suitability of its inputs.
Notes In AI, inaccurate, incomplete, biased, outdated, irrelevant, or unrepresentative data can lead to unreliable or misleading results.
generative AI (GenAI)fr intelligence artificielle générative (IAGén)
ContextAI
An area of artificial intelligence concerned with systems that generate content such as text, code, images, audio, or video by learning patterns from training data and producing new outputs in response to input or prompts.
A transformer-based generative model, originally developed by OpenAI for language processing, that is pretrained on large quantities of text to predict successive tokens and can subsequently be prompted or further trained to perform a wide range of tasks.
Notes GPT also names OpenAI's family of such models.
ghost workfr travail fantôme
Contextethics & societyAI
Human labour that remains hidden behind digital services presented as automated.
Notes In AI, it includes work such as collecting, labelling, or classifying data, moderating content, evaluating model outputs, and completing tasks that automated systems cannot handle. It is often organized through digital labour platforms and performed under insecure or poorly paid conditions.
The best available reference dataset, annotation, measurement or procedure against which a system's results are evaluated.
Notes In natural language processing, a gold standard is commonly a set of human-produced or adjudicated labels that are treated as the expected outputs for a task. Calling a resource a gold standard does not mean that it is perfectly correct: its annotations may contain mistakes or biases, and a single adjudicated answer may obscure legitimate differences among annotators, especially when language or social judgments are ambiguous.
* “référence” is my own suggestion: no term bank attests it.
greedy decodingfr décodage glouton*
Contextlanguage models
A decoding method that selects the single most probable next token at every generation step. The selected token is added to the sequence, and the procedure repeats until generation stops.
Notes Greedy decoding is simple and deterministic under fixed conditions, but its locally best choice at one step does not necessarily produce the most probable or best complete sequence. It can produce repetitive or generic text, and it differs from sampling in that it introduces no deliberate randomness.
* “décodage glouton” is my own suggestion: no term bank attests it.
ground truthfr réalité de terrain
Contextevaluationdata
The values, labels or observations treated as the correct description of the cases in a dataset.
Notes They are used as targets during training or as references for evaluating a model's predictions, and may be obtained from direct measurements, verified records, expert judgments, human annotation or an adjudication process. The word truth can be misleading: ground-truth data are not necessarily infallible, since measurements can be inaccurate, annotators can make mistakes, and some tasks permit more than one reasonable interpretation. In subjective tasks, reducing several judgments to a single ground-truth label may hide meaningful disagreement. Ground truth and gold standard are often used interchangeably; a useful editorial distinction is that ground truth consists of the accepted reference values, while the gold standard is the dataset, annotation process or measurement method used as the authoritative reference.
The tendency of an AI model to portray members of some social groups, particularly marginalized or socially subordinate groups, as more similar to one another and less individually varied than members of socially dominant groups.
human preference evaluationfr évaluation fondée sur les préférences humaines*
ContextevaluationAI
A method for evaluating AI systems in which people compare two or more outputs and indicate which they prefer, usually in response to the same prompt and according to stated criteria.
Notes The resulting judgments can be aggregated to compare or rank responses, models, or systems according to perceived quality or usefulness.
* “évaluation fondée sur les préférences humaines” is my own suggestion: no term bank attests it.
hyperparameterfr hyperparamètre
Contextmachine learning
A setting that controls a model's design or training process but is not learned from the training examples in the same way as the model's parameters.
Notes Examples include the learning rate, batch size, number of layers and degree of regularization. Hyperparameter values are usually selected by comparing performance on a validation set. A hyperparameter need not be chosen manually: automated optimization methods can search for suitable values. What distinguishes it from an ordinary parameter is how its value is selected, not whether a person types it in directly.
HyperText Markup Language (HTML)fr langage HTML (HTML)
Contextmarkupweb
The markup language of web pages: a vocabulary of elements laid down by a standard, marking headings, paragraphs, links, images and the rest, which a browser renders.
Notes Its element names come from the standard, whereas an XML format defines its own.
other attested French terms: langage de balisage hypertexte
in-context learning (ICL)fr apprentissage en contexte
Contextpromptinglanguage models
The temporary adaptation of a language model's behaviour to information, instructions, or examples provided in its current prompt or context, without changing the model's parameters.
Notes This can help the model perform a new task or make better predictions during the current interaction, but the adaptation does not persist after the context is removed.
The stage in which a trained AI model processes new input to produce a prediction, classification, decision, or generated output.
Notes In a language model, inference includes processing the prompt and generating an output, usually one token at a time.
inference emissionsfr émissions liées à l'inférence*
ContextenvironmentAI
The greenhouse gas emissions associated with using a trained AI model to process inputs and produce predictions or generated outputs.
Notes Their total depends on factors such as the model and task, the hardware used, data-centre efficiency, the electricity source, and the number of uses. Repeated inference can therefore account for a substantial share of an AI system's lifetime emissions.
* “émissions liées à l'inférence” is my own suggestion: no term bank attests it.
information pollutionfr pollution informationnelle
Contextethics & societyAI
The degradation of an information environment through the accumulation and circulation of content that is false, misleading, irrelevant, redundant, unsolicited, or otherwise of low value.
Notes Information pollution makes reliable and useful information harder to find or assess. Generative AI can intensify it by enabling such content to be produced and distributed at large scale.
A marker inside a segment standing for formatting or a code of the original document, a bold run or a footnote reference for instance, rather than for text to translate.
Notes Each interchange format defines its own inline elements: bpt, ept and ph in TMX; pc, sc, ec and ph in XLIFF.
* “balise interne” is my own suggestion: no term bank attests it.
instruction tuningfr affinage par instructions
Contextlanguage models
A form of supervised fine-tuning in which a pretrained language model is trained further on examples pairing instructions or questions with appropriate responses.
Notes This makes the model better able to follow instructions across a range of tasks, including tasks not represented exactly in the training examples.
other attested English terms: instruction fine-tuning
A documented way of organizing and representing data so that it can be transferred between different systems or applications. In translation technology, TMX is primarily used to exchange translation-memory data, TBX to exchange terminological data, and XLIFF to move localizable content, translations, and related workflow information. A standardized format facilitates interoperability, but successful exchange may still depend on the versions, optional features, and metadata supported by each tool.
other attested English terms: data exchange format
other attested French terms: format d'échange de données
The ability of two or more systems, applications, or tools to exchange information and make use of what is exchanged.
Notes In translation technology, interoperability allows resources such as bilingual texts, translation memories, terminology records, and project data to move between tools, often through shared formats or interfaces.
Generated content that uses or combines information from the provided source or context in a way that misrepresents or contradicts that information.
Notes Unlike an extrinsic hallucination, it distorts available source information rather than introducing information that the source does not support.
The uneven and often difficult-to-see boundary between tasks that an AI system can perform well and tasks that it handles poorly.
Notes Tasks that appear similarly difficult to people may lie on opposite sides of this boundary, so AI assistance can improve performance on one task while harming it on another.
other attested French terms: frontière technologique en dents de scie
jailbreakingfr débridage
ContextAI safetyAI
The deliberate use of specially crafted prompts or interaction strategies to make an AI model bypass restrictions on its outputs or behaviour, such as its refusal to provide prohibited content or sensitive information.
knowledge collapsefr appauvrissement des connaissances
Contextethics & societyAI
A hypothesized process in which widespread reliance on AI-generated or AI-mediated information concentrates attention on common, centrally represented ideas, while rarer, specialized, or unconventional knowledge is consulted, transmitted, and developed less often.
Notes Over time, this can narrow the range of knowledge that a community considers accessible or worth pursuing.
A machine-learning model that estimates how likely different sequences of language are.
Notes Given a sequence of tokens as context, it assigns probabilities to the tokens that could come next. These probabilities can be used to predict or generate text and to compare the likelihood of complete sequences.
large language model (LLM)fr grand modèle de langue (GML)
Contextlanguage modelsAI
A neural-network language model, usually based on the transformer architecture, that is trained on very large amounts of text and contains many learned parameters.
Notes Most current generative LLMs process text as tokens and generate text one token at a time by repeatedly assigning probabilities to possible next tokens. When incorporated into an application, an LLM can support tasks such as answering questions, summarizing, translating, and conducting conversations.
The delay between an input and the system's response; in live speech recognition and interpreting, the time between the spoken words and their displayed transcription or translation.
other attested French terms: temps de latence
latent spacefr espace latent
Contextmachine learning
A space in which a model represents data using latent, that is, not directly observed, features learned from the data.
Notes Each point or vector encodes underlying patterns identified by the model, often in a representation that is more compact than the original data. Related to, but not the same as, an embedding space.
The base or dictionary form under which the inflected forms of a word are grouped: go, goes, went and gone share the lemma go.
Notes Corpus tools use lemmatization to count or search all forms of a word at once; a frequency list of lemmas answers a different question than a frequency list of word forms.
The character that ends a line in a file, stored in it like any other and invisible on screen. It is what divides a file into lines, so a file's line count is fixed : two of them make three lines, whatever width the window is. Windows writes it as two characters, a carriage return followed by a line feed (CR LF), where macOS and Linux use one (LF).
other attested English terms: hard return, newline
other attested French terms: retour à la ligne forcé, retour forcé, présentation de ligne
The dominance of one language or a small group of languages in institutions, communication, and knowledge production, such that their use is treated as normal or more valuable while other languages receive less recognition, resources, or support.
Notes In AI, linguistic hegemony can be reinforced when training data, benchmarks, development resources, and model performance are concentrated in dominant languages, especially English, disadvantaging speakers and knowledge expressed in underrepresented languages.
A method of reducing the amount of data needed to represent information by discarding some information, so that the original cannot be reconstructed exactly.
Notes LLM pretraining is sometimes described metaphorically as lossy compression of the training corpus because the model's parameters retain statistical patterns and associations from the text without preserving the corpus as a complete, exact archive.
M
machine learning (ML)fr apprentissage automatique
Contextmachine learningAI
An approach to artificial intelligence in which a model is trained on data or experience so that its adjustable parameters come to reflect patterns relevant to a task.
Notes The trained model can then apply those patterns to new inputs, for example to make predictions or classifications. The task-specific patterns are learned from data rather than fully specified in advance as hand-written rules.
The use of a computer system to produce content in a target language that conveys content expressed in a source language.
Notes Machine translation is more than the replacement of each source word with a target-language word: a translation system must also account for differences in meaning, grammar, word order, idiomatic expression and context between languages. Modern machine translation is generally performed by neural models that generate a target-language sequence while conditioned on a source-language sequence; encoder-decoder models were developed especially for this type of task, although general-purpose large language models can also perform translation. Machine-translated output may be used directly for information access or communication, or as a draft that a human translator reviews and edits. Machine translation differs from computer-assisted translation: in machine translation the system produces a translation, while a computer-assisted translation tool supports a human translator, although it may include a machine-translation system as one of its components.
The extent to which sales, output, or another relevant measure of activity in a defined market is accounted for by a relatively small number of firms.
Notes It is commonly assessed from firms' market shares using measures such as concentration ratios or the Herfindahl-Hirschman Index (HHI). In the AI sector, concentration can occur at different levels of the supply chain, including AI chips, cloud computing, access to data and computing resources, model development, and downstream applications.
A convention for annotating text with tags that mark its structure or presentation, keeping the annotations distinct from the content itself; HTML and XML are the best-known examples.
masked language model (MLM)fr modèle de langue masqué
Contextlanguage models
A language model commonly built using a bidirectional transformer encoder and pretrained to reconstruct selected tokens that have been hidden or otherwise altered in a text.
Notes To predict an original token, the model can use the visible context both before and after its position. This self-supervised training process enables the model to learn contextual representations of words and passages without requiring every training example to be labelled by people; the pretrained model can then be adapted to tasks such as text classification, information extraction, semantic similarity and question answering. BERT and RoBERTa are well-known masked language models. Not every selected token is necessarily replaced by a visible [MASK] token: in the original BERT procedure, some are replaced by [MASK], some by a randomly chosen token and some are left unchanged, and in all three cases the model is trained to predict the original. A masked language model is not synonymous with an encoder-only model, and these models are generally used to produce contextual representations rather than to generate extended passages autoregressively, although they can fill masked positions and newer generative methods can build on masking.
other attested French terms: modèle de langage masqué
masked language modelingfr modélisation du langage masqué
Contextlanguage models
A self-supervised training objective in which selected tokens in a text are hidden or otherwise altered and a model is trained to reconstruct the original tokens from the remaining context.
Notes In the usual bidirectional form, the prediction can draw on visible tokens occurring both before and after each selected position.
A character with a special meaning inside a regular expression (such as ., *, [ or ^) instead of matching itself literally; a backslash escape turns it back into a literal character.
Awareness and monitoring of one's own cognitive processes, often combined with attempts to regulate them.
Notes It includes judging what one knows, assessing confidence, noticing possible errors, and changing strategies when necessary. In AI research, the term is sometimes used by analogy for mechanisms or behaviours through which a system monitors or regulates aspects of its own processing, such as estimating uncertainty, checking an answer, or changing strategy; such behaviour does not by itself demonstrate consciousness or human-like self-awareness.
metadatafr métadonnée
Contextdata
Structured information that describes, identifies, or provides context for other data. In a marked-up document or translation format, metadata may indicate the language, author, creation date, file type, segment identifier, translation status, subject field, or origin of the content. Metadata may be stored in elements or attributes. It is generally distinguished from the main content to be translated, although some metadata values may themselves require localization.
A degenerative process in which successive generations of a generative model become less faithful to the original data because they are trained recursively on data produced by earlier models.
Notes As errors accumulate, rare patterns may disappear first, and the model's outputs may become less varied and increasingly distorted.
An AI model that processes and relates information from two or more data modalities, such as text, images, audio, video, or sensor data.
Notes Depending on its design, it may accept multiple modalities as input, produce outputs in one or more modalities, or both.
N
n-gramfr n-gramme
ContextcorporaNLP
A sequence of n consecutive items from a text, usually words: bigrams (n = 2), trigrams (n = 3), and so on.
Notes In corpus analysis, frequent n-grams reveal recurring multi-word expressions and phraseology. In language modelling, n-gram models were the standard statistical approach before neural networks: they estimate the probability of each word from the n − 1 words that precede it.
A name, written as a URI, that says which vocabulary an element or attribute belongs to.
Notes Declared with an xmlns attribute, it lets one document mix vocabularies, a standard format and a tool's own extensions for instance, without name collisions.
A machine-learning model composed of interconnected layers of small computational units.
Notes Each unit combines input values using adjustable numerical weights and passes the resulting value to other units. During training, the network adjusts its weights to improve its performance on a task. The name reflects the field's historical inspiration from biological neurons; modern neural networks are mathematical computing systems, not realistic models of how the human brain works.
other attested French terms: réseau de neurones artificiels
next-token predictionfr prédiction du jeton suivant*
Contextlanguage models
The task of estimating the probabilities of the tokens that could follow a given sequence of tokens.
Notes It is a common training objective for autoregressive language models. During text generation, the model repeatedly produces this probability distribution, a decoding method selects a token, and the selected token is added to the context for the next prediction.
other attested English terms: next-word prediction
A market structure in which a small number of firms account for most of the supply of a product or service.
Notes Because the decisions of each firm can materially affect the others, firms in an oligopoly tend to make decisions with their competitors' likely responses in mind. In discussions of AI, the relevant market should be specified: oligopolistic conditions may occur in markets such as advanced AI chips, cloud computing, or foundation-model development, but it is generally too broad to describe the entire AI sector as a single oligopoly.
A vector whose elements are all 0 except for a single 1. The position of the 1 identifies one item in a fixed set, such as a category or a token in a vocabulary.
Notes Unlike an embedding, a one-hot vector identifies an item but does not represent similarities or relationships between items.
open-weight modelfr modèle à poids ouverts
ContextAI
An AI model whose trained parameters, commonly called weights, are made available for others to download.
Notes This generally allows users with suitable software and computing resources to run the model on their own systems and may allow them to inspect, modify or fine-tune it; the exact permitted uses depend on the terms under which the weights are released. Making the weights available does not necessarily mean that the training data, data-processing methods, training code or complete development process have also been disclosed, and an open-weight model may come with licence restrictions on commercial use, redistribution or particular applications. An open-weight model is not automatically open-source AI: under the Open Source AI Definition 1.0, open-source AI must additionally provide the freedoms to use, study, modify and share the system, together with the necessary code, parameters and sufficiently detailed information about the training data and process. The term open source should therefore not be used merely because model weights can be downloaded; conversely, open weight does not necessarily mean unrestricted, free of charge or fully reproducible.
operator precedencefr priorité des opérateurs
Contextcomputingregular expressions
The rule fixing the order in which the operators of an expression are applied. In a regular expression that order runs from the quantifiers, which attach to the single element in front of them, through the elements written one after another, to the vertical bar, which has the lowest precedence of all and so separates everything on its left from everything on its right. Parentheses are applied before any of it, which is why /^(cat|dog)$/ and /^cat|dog$/ do not mean the same thing.
other attested English terms: precedence
other attested French terms: préséance des opérateurs, priorité
Describes a word that is absent from the vocabulary used by a particular language-processing system.
Notes In systems with a fixed word-level vocabulary, such a word cannot be represented directly and is often replaced by a special unknown-word symbol such as <UNK>. Modern subword or byte-level tokenizers can usually represent an unfamiliar word as a sequence of smaller known tokens, so a word may be out of vocabulary as a whole without being unprocessable.
A corpus of texts in one language together with their translations into one or more other languages, usually aligned sentence by sentence so that each segment can be viewed next to its equivalent.
Notes Parallel corpora such as Europarl or the Canadian Hansard record real translation decisions, which makes them useful for observing equivalences, building translation memories and training machine-translation systems. A translation memory is in effect a parallel corpus built from one's own translations.
The performance of two or more computational operations at the same time, typically by distributing the work across multiple processor cores or computing devices.
Notes In AI, it can reduce computation time by allowing independent calculations or portions of data to be processed simultaneously rather than sequentially. During transformer training, many computations involving the tokens in an input sequence can be performed in parallel; the model's ability to represent relationships between distant tokens comes from its attention mechanism, not from parallel processing itself.
parameterfr paramètre de modèle
Contextmachine learning
A numerical value learned during a model's training and used in its computations.
Notes In a neural network, parameters consist mainly of weights and biases. Their total number is commonly used as one measure of model size.
An AI assistant's ability to retain information from earlier interactions and retrieve relevant information in later conversations, allowing it to maintain continuity and personalize its responses across sessions.
Notes Persistent memory is usually implemented by storing and retrieving information outside the language model itself; it does not ordinarily involve changing the model's trained parameters, and persistent does not necessarily mean permanent.
* “mémoire persistante” is my own suggestion: no term bank attests it.
personally identifiable information (PII)fr renseignements personnels
Contextdataethics & society
Information that can identify, distinguish, or trace a person, either on its own or when combined with other information that can be linked to that person.
Notes It includes direct identifiers, such as passport numbers or biometric records, as well as information that may become identifying in combination, such as birth dates, locations, or demographic characteristics.
plain textfr texte brut
Contexttext encodingcomputing
Text represented as a sequence of characters alone, with no formatting or layout of its own. A plain-text file opens in any text editor, whatever produced it, which is why interchange formats are written this way: markup languages record structure inside plain text, by writing that structure as characters in the text itself.
The property of a word or lemma having two or more related senses.
Notes The intended sense is ordinarily determined from the context in which the word occurs. For example, mouse can refer to an animal or, through a related metaphorical sense, a computer input device.
positional encodingfr encodage positionnel
Contextdeep learninglanguage models
A numerical representation of the position of each token in a sequence.
Notes In a transformer, positional information is combined with token representations so that the model can take token order into account even though computations for different sequence positions can be performed in parallel. In the original transformer architecture, a positional encoding is added to each token embedding; other transformer architectures may represent absolute or relative position in different ways.
Additional training applied to a pretrained model to adapt its capabilities or behaviour for intended uses.
Notes For modern language models, post-training may include instruction tuning, preference alignment and reinforcement learning with verifiable rewards. These stages can make a base model better at following instructions, producing preferred responses or solving particular kinds of problems. Post-training is an umbrella term, and organizations do not necessarily use the same stages or sequence. In-context learning and ordinary prompting are not post-training, because they do not update the model's parameters. In some engineering contexts, post-training is used more broadly for processes applied after training, such as quantization; this entry concerns post-training as a stage in developing language models.
An initial stage in which a model learns general patterns and reusable representations from a large dataset, often through self-supervised learning, before any later adaptation for particular tasks or uses.
Notes For autoregressive language models, pretraining typically involves learning to predict the next token from its context.
preference alignmentfr alignement sur les préférences*
Contextlanguage modelsAI
A post-training process that adjusts a language model so that it becomes more likely to produce responses judged preferable and less likely to produce responses judged undesirable.
Notes The training data typically pair a prompt with two or more candidate responses that have been ranked, selected or rejected according to criteria such as helpfulness, accuracy, safety, style or compliance with instructions. The preferences may be provided by human annotators, inferred from user behaviour or generated by another model acting as an evaluator, and different algorithms can learn from these judgments: reinforcement learning from human feedback commonly trains a reward model and then optimizes the language model against that reward, while direct preference optimization trains the language model more directly from preferred and rejected response pairs. Preference alignment is broader than RLHF, which is one of its methods. Alignment with collected preferences does not guarantee factual correctness, safety or agreement with universal human values: the result reflects the criteria, instructions and judgments of the people or systems that produced the preference data, and even the InstructGPT authors emphasize that their annotators' preferences do not necessarily represent those of a broader population.
* “alignement sur les préférences” is my own suggestion: no term bank attests it.
probability distributionfr distribution de probabilité
Contextmachine learning
A description of how probability is allocated among the possible values of a random variable.
Notes For a discrete set of outcomes, each outcome is assigned a probability between 0 and 1, and the probabilities of all possible outcomes sum to 1. A language model produces a probability distribution over the possible next tokens in its vocabulary; to generate text, a decoding procedure selects or samples a token using this distribution.
Input given to a generative AI system to specify a task, provide context, or otherwise guide its output.
Notes For a language model, a prompt may contain instructions, questions, examples, data, or text that the model is asked to continue. The prompt becomes part of the context on which the model conditions its subsequent token generation.
The systematic design, testing, and refinement of prompts to help a generative AI system produce outputs that better satisfy the requirements of a particular task.
An attack in which untrusted input is incorporated into a prompt and interpreted by a generative AI system as instructions, causing the system to disregard or conflict with its intended instructions or to produce unintended outputs or actions.
Notes The injected instructions may be supplied directly by a user or indirectly through data that the system retrieves or processes.
other attested French terms: infiltration de requête
quality assurance (QA)fr assurance de la qualité (AQ)
ContextCAT toolstranslation
A planned, systematic set of checks carried out to give reasonable confidence that a product or service meets the requirements set for it.
Notes In translation, and inside a computer-assisted translation tool in particular, it takes the form of an automatic check of formal properties of a translation: numbers that differ from the source, tags present in the source and missing from the target, empty or untranslated segments, double spaces, punctuation, terms from the termbase whose equivalent does not appear in the target. The check reports where the target departs from the source or from the project's rules, and says nothing about whether the translation is any good. Which checks run and how strictly is set per project, because a software-localisation job and a marketing job tolerate different things.
other attested English terms: QA check
other attested French terms: assurance qualité, contrôle qualité
A regular-expression operator stating how many times the preceding element may repeat ({n}, {n,m}, *, +, ?); greedy by default, matching as much as possible, and made lazy with a following ?
The process of using available information to draw conclusions or work toward the solution of a problem.
Notes In AI, reasoning may involve formal rules, probabilistic inference, learned patterns or representations, or a combination of these methods. In discussions of language models, reasoning is often used operationally to describe performance on tasks requiring multiple connected steps; successful answers or generated rationales do not necessarily demonstrate human-like reasoning or reveal the model's actual internal computations.
* “raisonnement” is my own suggestion: no term bank attests it.
reasoning modelfr modèle de raisonnement
Contextlanguage models
A language model designed to improve its performance on complex, multi-step problems by using additional computation during inference.
Notes Such models are often post-trained on tasks whose answers can be checked automatically and may generate intermediate steps before producing a final response. In this term, reasoning is an operational label for a model's training, inference process, and problem-solving performance: it does not establish that the model reasons in the same way as a person, and a generated rationale is not necessarily a faithful account of how the answer was produced.
other attested French terms: modèle génératif de résolution de problèmes
Tokens generated during an intermediate reasoning process before a model produces its final answer.
Notes They allow the model to perform additional step-by-step computation at inference time. Depending on the model and interface, these tokens may be displayed as a reasoning trace, hidden from the user, or represented only by a summary; they may nevertheless affect response time, token limits, and cost. The term is not completely standardized across providers. Reasoning tokens should not be interpreted literally as a model's "thoughts", nor assumed to provide a faithful explanation of how it reached its answer.
A structured testing process in which testers adopt an adversarial perspective and deliberately try to expose vulnerabilities, harmful or unexpected behaviour, and possible ways of misusing an AI model or system.
Notes The findings can be used to evaluate and improve the system's safeguards.
A pattern describing a set of character strings, built from literal characters and metacharacters with special meanings; used to search, filter and transform text by structure rather than by exact wording.
reinforcement learning (RL)fr apprentissage par renforcement (AR)
Contextmachine learning
A type of machine learning in which an agent learns how to act by receiving rewards or penalties in response to its actions, with the aim of maximizing its overall reward.
Notes In language-model post-training, generated responses are evaluated by a reward signal, and the model is adjusted to make responses receiving higher rewards more likely.
reinforcement learning from human feedback (RLHF)fr apprentissage par renforcement avec rétroaction humaine (ARRH)
Contextlanguage modelsmachine learning
A method for post-training a language model in which human evaluations of possible responses are used to create a reward signal, often by training a separate reward model.
Notes Reinforcement learning then adjusts the language model to make responses receiving higher predicted rewards more likely.
reinforcement learning with verifiable rewards (RLVR)fr apprentissage par renforcement avec récompenses vérifiables*
Contextlanguage modelsmachine learning
A method for post-training a language model in which rewards are based on whether its responses satisfy criteria that can be checked automatically.
Notes For example, a mathematical answer may be compared with a known solution, or generated code may be tested to determine whether it runs correctly. Reinforcement learning adjusts the model to make responses receiving higher rewards more likely.
* “apprentissage par renforcement avec récompenses vérifiables” is my own suggestion: no term bank attests it.
representation learningfr apprentissage de représentations
Contextmachine learning
A machine-learning approach in which a system learns useful internal representations of its input from data rather than relying mainly on features designed by people.
Notes In a neural network, these representations are numerical vectors or activation patterns that make information useful for prediction, classification or another training objective. Representation learning can be supervised, self-supervised or unsupervised; it is not a synonym for unsupervised learning. A learned representation need not have dimensions that people can interpret individually, and calling it a representation of meaning should not imply human-like semantic understanding.
A character with a special syntactic function in a programming or markup language. Where it should appear as ordinary text instead, it usually has to be written another way, as a short code standing in for it: in XML, "&" and "<" cannot generally appear literally in text and are written "&" and "<". Whether it counts as reserved depends on the context; it is not necessarily prohibited everywhere in the document.
A model trained to assign a numerical score to a candidate output according to learned evaluation criteria.
Notes In language-model alignment, reward models are commonly trained on responses ranked according to human preferences. Their scores can then guide reinforcement learning or help select among several candidate responses.
A decoding method that uses an element of randomness to select the next token generated by a language model.
Notes At each generation step, the model assigns probabilities to the possible next tokens; sampling chooses among them according to those probabilities, so a highly probable token is more likely to be selected but is not guaranteed to be selected. The chosen token is then added to the context, and the process repeats. Unrestricted sampling can occasionally select implausible tokens from the low-probability end of the distribution, so practical sampling methods commonly adjust or restrict the available probabilities using controls such as temperature, top-k or top-p. Because selection involves randomness, repeated generations from the same prompt can produce different outputs, although reproducibility may be possible when the random seed and computational conditions are fixed. Sampling is one kind of decoding; the two terms are not synonyms, because decoding also includes non-sampling methods such as greedy decoding and beam search.
Empirically observed mathematical relationships describing how a model's measured performance or error tends to change as factors such as the number of parameters, the amount of training data, and the computational resources used for training increase.
Notes These relationships can help researchers estimate the effects of increasing scale and allocate a fixed training budget between model size and data.
A portion of translatable content that a CAT tool treats as a discrete unit for translation, alignment, storage and match retrieval.
Notes A segment often corresponds to a sentence, but it may also be a title, a menu item, a paragraph, or part of a sentence, depending on the document structure and the segmentation rules applied.
The operation of dividing translatable content into segments, which correspond roughly to sentences, titles and other separate text elements.
Notes A CAT tool may use the structure of the document together with language-specific rules and exceptions for detecting sentence boundaries: it has to distinguish a period that ends a sentence from one used in an abbreviation, for example. Segmentation affects what is stored in a translation memory and which matches can later be retrieved. SRX is a format designed for exchanging segmentation rules between tools.
An attention mechanism that allows each token in a sequence to assign different weights to other relevant tokens in the same sequence and combine information from them.
Notes This helps the model construct a context-sensitive representation of each token and capture relationships between tokens, including relationships across long distances in the sequence.
A machine-learning approach in which the targets used for training are created automatically from the structure or content of the training data, rather than being supplied as separate human-written labels.
Notes The model is typically given one part or modified version of an example and trained to predict another part. For example, an autoregressive language model is trained to predict the next token from the preceding tokens; in masked-language-model training, selected tokens are hidden and the model learns to reconstruct them from the surrounding text. In both cases, the text itself supplies the expected answers. Self-supervised learning avoids the need to label every training example manually. It does not mean that the model independently chooses what or how to learn: people and organizations still select the data, design the learning objective and determine how the resulting model will be evaluated.
The degree to which two words, expressions, or concepts resemble one another in meaning.
Notes In embedding-based NLP, semantic similarity is often estimated by comparing their vectors, commonly with cosine similarity. Vector proximity is an estimate of semantic similarity, not its definition. Similarity is also distinct from broader semantic relatedness: doctor and hospital are related, but not similar in the way doctor and physician are.
sequence-to-sequence modelfr modèle séquence à séquence
Contextdeep learninglanguage models
A model that maps an input sequence to an output sequence, which may have a different length or structure.
Notes Most contemporary sequence-to-sequence models use an encoder-decoder architecture. Sequence-to-sequence model describes the input-output relationship, while encoder-decoder model describes the architecture; they are frequently used almost interchangeably, but they are not strictly identical.
The automatic segmentation of an audio recording by speaker: determining who speaks when, so that each stretch of speech is attributed to the right person.
other attested French terms: diarisation des locuteurs
speech synthesis (TTS)fr synthèse de la parole
Contextspeech
The generation of artificial speech from written text (text-to-speech), combining linguistic processing to derive a pronounceable phonetic form with signal processing to render it as audio; the inverse of automatic speech recognition.
other attested French terms: synthèse vocale, synthèse texte-parole
speech-to-speech translation (S2ST)fr traduction parole à parole
Contextspeechtranslation
The conversion of spoken input in one language into spoken output in another language, either by chaining speech recognition, machine translation and speech synthesis (cascade) or by a single end-to-end model.
static word embeddingfr plongement lexical statique
ContextembeddingsNLP
A numerical representation that assigns each word type, meaning each distinct word in a vocabulary, a single fixed vector learned from patterns in a corpus.
Notes Words that occur in similar linguistic contexts generally receive similar vectors. Once learned, the vector for a word remains the same wherever that word appears: bank receives the same representation in river bank and bank account. Static word embeddings are efficient and can capture broad semantic and grammatical relationships, but they cannot directly distinguish between different meanings of a polysemous word. Word2vec and GloVe are well-known methods for creating static word embeddings.
supervised fine-tuning (SFT)fr affinage par apprentissage supervisé*
Contextlanguage modelsmachine learning
Additional training of a pretrained model on labelled examples that pair an input with a desired output, with the model's parameters adjusted to make the desired outputs more likely.
Notes For LLMs, SFT often uses instruction-and-response examples, in which case it is also called instruction tuning. Instruction tuning is a common subtype of SFT, but SFT can also be used for classification, domain adaptation, and other labelled tasks.
other attested French terms: peaufinage par apprentissage supervisé
* “affinage par apprentissage supervisé” is my own suggestion: no term bank attests it.
surveillance capitalismfr capitalisme de surveillance
Contextethics & society
An economic logic in which organizations claim and analyze data about people's activities and experiences in order to predict behaviour and, increasingly, to influence it for commercial gain.
Fast, automatic, and intuitive cognitive processing that occurs with little deliberate effort.
Notes In discussions of language models, System 1 is often used as a useful, though imperfect, analogy for rapid, direct responses generated primarily from learned patterns. The term originates in theories of human cognition, and its application to AI is metaphorical: it does not imply that language models possess human cognitive systems, conscious effort, intuition, or self-awareness.
Slow, deliberate, and analytical cognitive processing that requires sustained attention and effort.
Notes In discussions of language models, System 2 is often used as a useful, though imperfect, analogy for processes that devote additional computation to multistep reasoning, evaluation, or verification before producing an answer. The term originates in theories of human cognition, and its application to AI is metaphorical: it does not imply that language models possess human cognitive systems, conscious effort, intuition, or self-awareness.
An instruction supplied to a language model before or alongside the user's input that establishes the model's role, task, behavioural rules, tone, or other context for the interaction.
Notes Applications commonly insert it automatically at the beginning of the model's effective context. A system prompt is often, though not always, hidden; its priority and persistence depend on the application and model interface, and it is not an absolute security boundary.
A marker that delimits and identifies an element in a markup document, usually working as a pair: an opening tag and a closing tag around the content they label.
A setting that influences how predictable or varied a language model's output will be.
Notes When choosing each new token, the model assigns different probabilities to the available options. A lower temperature makes it favour the most probable options more strongly, usually producing more predictable and consistent text; a higher temperature gives less probable options a greater chance of being selected, which can make the output more varied or surprising, but also less coherent or accurate. Temperature affects the probability distribution used in generation, but does not by itself guarantee that an output will be deterministic, even when set to zero.
A database of terminological entries organized by concept, grouping the terms of several languages with metadata such as definitions, domains and usage status.
The XML-based standard (ISO 30042) for exchanging termbases: each concept entry can gather the terms of several languages plus rich metadata such as definitions, part of speech, domain and usage notes.
A portion of a dataset held back from both model training and model selection and used to evaluate the final model.
Notes Its purpose is to provide an estimate of how well the completed model will perform on new data from the intended task or population. A test set should not overlap with the training data and should not guide choices about model architecture, hyperparameters or prompts: repeatedly changing a system in response to test results gradually turns the test set into a validation set and can make the reported performance overly optimistic. Training-data contamination can produce the same problem if test examples appear in the model's training data. A test set is not automatically representative merely because it was kept separate; it must also reflect the kinds of inputs, languages, populations and conditions in which the model is intended to operate.
other attested French terms: jeu de test, données de test
test-time computationfr calcul au moment de l'inférence*
Contextlanguage models
Computation performed when a trained model is used to answer a particular input, beyond a single ordinary forward generation.
Notes It may include producing longer intermediate reasoning, generating and comparing several candidates, searching, retrieving information, or verifying an answer.
* “tarification à l'usage selon le nombre de jetons” is my own suggestion: no term bank attests it.
token¹fr occurrence de mot
Contextlinguistics
An individual occurrence of a word or another countable element in a text.
Notes Depending on the conventions used, tokens may include words, numbers, punctuation marks and other symbols, and each occurrence is counted separately even when the same form appears more than once. For example, cats chase cats contains three word tokens but only two word types: cats and chase. A token is therefore a particular occurrence in a text, whereas a type is a distinct form represented by one or more occurrences. In part because of possible confusion with tokens in the context of LLMs, this is also sometimes called an instance or word token.
other attested English terms: word token, instance
A unit of text that a language model processes or generates.
Notes A token may correspond to an entire word, part of a word, a punctuation mark, or a smaller character- or byte-based sequence. Each token belongs to the model's vocabulary and is represented by a numerical identifier. Tokens are therefore not the same as words: one word may be represented by a single token or divided into several tokens, and different models may divide the same text differently.
The process of dividing running text into individual units that can be counted, annotated or analyzed.
Notes These units are commonly words and punctuation marks, but their boundaries depend on the language, the purpose of the analysis and the conventions adopted. For example, an analyst must decide whether punctuation should be counted separately, whether a contraction such as I'm represents one written word or two grammatical units, and how to identify word boundaries in languages that do not regularly separate words with spaces.
other attested French terms: segmentation lexicale, segmentation
The process of converting text into an ordered sequence of tokens that a language model can process.
Notes A tokenizer applies a model-specific vocabulary and segmentation procedure to the text. In modern language models, commonly used methods such as byte-pair encoding learn frequently occurring units from training data: common words or expressions may consequently be represented by single tokens, while rarer or unfamiliar words are divided into smaller subword, character or byte-based units. Because tokenizers and their vocabularies differ, the same text may require different numbers of tokens in different models or languages.
other attested French terms: segmentation en jetons textuels, conversion en jetons
The ability of a language model or AI system to request and use the results of external resources or software in order to complete a task.
Notes Tools may include a search engine, calculator, database, code-execution environment, calendar or external application programming interface. In a typical tool-use process, the model selects an available tool and generates a structured request containing the necessary arguments; software surrounding the model validates and executes that request, then returns the result to the model, which can incorporate it into its response or use it to decide on another action. Tool use can therefore give a model access to current information, specialized computations and actions that cannot be performed using the model's learned parameters alone. Tool use is broader than function calling, which is a common technical mechanism for expressing a tool request. A single tool call does not necessarily make a system an agent: agentic systems usually plan and coordinate multiple tool calls or actions over time. The language model commonly proposes the action rather than executing it directly, a distinction that matters for accountability and safety because the surrounding system controls permissions, validates arguments and performs actions that may have external effects.
A sampling method that, at each generation step, retains only the k tokens with the highest probabilities, renormalizes their probabilities and randomly selects the next token from that group. A smaller value of k restricts the choice more strongly, while a larger value permits greater variety.
Notes When k = 1, top-k sampling is equivalent to greedy decoding. Unlike top-p sampling, top-k always retains the same number of candidates, even when the model's probability distribution is unusually concentrated or unusually flat.
top-p samplingfr échantillonnage à troncature de masse p
Contextlanguage models
A method for choosing the next token in generated text.
Notes At each step, the model ranks the possible tokens from most to least likely and keeps the smallest group whose combined probability reaches a chosen threshold, called p. It then adjusts the probabilities within this group so that they add up to 100% and randomly selects the next token from it.
An unwanted systematic pattern, distortion, or gap in the data used to train an AI model that influences what the model learns.
Notes It may arise because the data reproduce historical inequalities or stereotypes, underrepresent relevant people, languages or situations, or contain systematically skewed measurements, examples or labels. Training data bias can make a model less accurate or fair for some uses or groups, but it is only one possible source of bias in an AI system.
other attested English terms: training data bias
other attested French terms: biais des données d'apprentissage
training emissionsfr émissions liées à l'entraînement*
ContextenvironmentAI
Greenhouse-gas emissions attributable to training a model. Depending on the assessment boundary, these may include emissions from electricity used for computation and cooling, supporting data-centre operations, and the manufacture of the hardware used.
Notes Training is not always the largest part of lifetime emissions: inference may dominate for heavily used services, while embodied hardware emissions can also be substantial. The estimate depends on hardware, utilization, location, electricity mix, and accounting boundary.
other attested French terms: émissions liées à l'apprentissage du modèle
* “émissions liées à l'entraînement” is my own suggestion: no term bank attests it.
training setfr jeu de données d'entraînement
Contextmachine learningdata
The portion of a dataset used to train a machine-learning model.
Notes The learning algorithm repeatedly processes these data and adjusts the model's parameters to reduce its errors or improve its performance on the training objective. In supervised learning, the training set generally contains inputs paired with expected outputs or labels; in self-supervised learning, the training targets are derived automatically from the data. For a language model, the training set may consist of a very large corpus of tokenized text from which the model learns to predict tokens.
other attested French terms: jeu d'entraînement, données d'entraînement
A neural-network architecture for processing sequences, such as text.
Notes It consists of repeated blocks that combine self-attention with feedforward neural networks. Self-attention allows the model to determine which other tokens in the available context are most relevant to interpreting each token and to combine information from those positions. Positional information tells the model where the tokens occur, since attention by itself does not represent sequence order. By building increasingly rich contextual representations through successive layers, transformers can model relationships between parts of a text even when they are far apart. Transformers form the basis of most modern large language models.
translation memory (TM)fr mémoire de traduction (MT)
ContextCAT toolstranslation
A bilingual database of previously translated source segments and their corresponding target segments, which a translation-memory system searches to propose exact or similar matches for new source text.
The XML-based standard format for exchanging translation memories between CAT tools: a TMX file contains translation units whose language variants can cover any number of languages.
A record that associates a source-language segment with its target-language equivalent, usually together with relevant metadata.
Notes The boundaries of these segments are determined during segmentation. In TMX, a tu element groups language-specific variants represented by tuv elements, each of which contains a seg element. A segment therefore contains text in one particular language, whereas a translation unit records the relationship between equivalent segments and may contain variants in more than two languages. The term is used here in the technical sense associated with translation memories; it can have broader and somewhat different meanings in translation studies.
A distinct linguistic form found in a text or corpus, counted only once regardless of how many times it occurs.
Notes For example, cats chase cats contains three word tokens but only two word types: cats and chase. What counts as the same type depends on the conventions used: capitalized and lowercase forms may be treated as the same type or as different types, and inflected forms may be counted separately unless they have been grouped under a common lemma.
unsupervised learningfr apprentissage non supervisé
Contextmachine learning
A machine-learning approach that seeks patterns or structure in data without being given a target label or expected output for each training example.
Notes It is used for tasks such as grouping similar examples, detecting anomalies, reducing dimensionality and estimating the distribution of data. This does not mean that no people are involved: people still select and prepare the data, choose the algorithm and decide how to interpret and validate the resulting patterns. Self-supervised learning is sometimes grouped under unsupervised learning because it starts with unlabelled data; it is useful to distinguish them, since self-supervised learning automatically constructs prediction targets while unsupervised learning in the narrower sense looks for structure without such input-target pairs.
A variable-length character encoding for Unicode. It represents each valid Unicode code point using a sequence of one to four bytes. Characters in the ASCII repertoire use one byte and retain the same byte values as in ASCII, which helps with compatibility. UTF-8 can represent the same Unicode repertoire as UTF-16 and UTF-32, but it does not imply that every character occupies a single byte. It is widely recommended for multilingual Web content and data exchange.
* “UTF-8” is my own suggestion: no term bank attests it.
V
validation setfr jeu de données de validation
Contextmachine learningdata
A portion of a dataset kept separate from the data used to fit a model's parameters and used during development to guide choices about the model.
Notes Developers may use validation results to compare model versions, select hyperparameters, set decision thresholds or decide when to stop training. Although the model does not ordinarily learn its parameters directly from the validation examples, repeated development decisions based on validation performance indirectly adapt the final system to that dataset; validation results should therefore not be presented as a fully independent estimate of final performance. Terminology is not completely consistent across disciplines, and some publications use test set for data that are actually being used for validation; this glossary maintains the stricter three-way distinction.
other attested English terms: development set, dev set
other attested French terms: jeu de validation, données de validation, jeu de développement
Notes In machine learning, a vector can represent the features of an item or its location in a multidimensional space.
vector spacefr espace vectoriel
Contextmachine learning
A mathematical set of same-dimensional vectors on which operations such as vector addition and multiplication by a scalar are defined.
Notes In NLP, vectors representing linguistic items can be treated as points in such a space and compared geometrically. A vector space is the general mathematical structure; an embedding space is a particular learned representation within such a structure, and a latent space is the broader space of hidden variables or representations in a model.
The fixed set of tokens that a tokenizer and language model can recognize and represent.
Notes Depending on the tokenization method, the vocabulary may contain complete words, parts of words, individual characters, punctuation marks, bytes and special tokens. Each vocabulary item is assigned a numerical identifier: the tokenizer converts input text into these identifiers, and the language model selects from the same vocabulary when predicting tokens. The vocabulary is normally created during tokenizer training and then kept fixed while the model is trained and used.
other attested French terms: vocabulaire de jetons
The use of AI models to build a digital copy of a person's voice and generate new speech in that voice; unlike generic speech synthesis, the goal is to reproduce a specific speaker.
W
web crawlingfr exploration du Web
Contextdataweb
The automated process of systematically discovering and retrieving pages or other resources from the Web.
Notes A crawler typically begins with one or more known web addresses, downloads the corresponding pages, and follows links found in those pages to discover additional resources. Crawling is commonly used to build search-engine indexes, create web archives, monitor websites, or assemble collections of online material. Although a crawler may examine page contents and links, its main purpose is to find and collect resources rather than to extract particular data from them.
The automated process of retrieving online content and extracting selected information from it so that the information can be stored, analyzed, or reused in another context.
Notes A scraper may collect elements such as text, prices, tables, links, images, or metadata, often by using the structure of a web page to locate the desired information. Scraping may be applied to a known set of pages or combined with web crawling to discover additional pages; its main purpose is data extraction rather than page discovery.
In a search, a character that stands for other characters rather than for itself, so the parts of a string that do not matter can be left unspecified.
Notes File search and word processors use * and ? this way. In a regular expression the wildcard is the dot: it matches any single character except a line break, and line breaks as well when the s flag is on.
other attested French terms: caractère joker, joker, caractère de remplacement, caractère de substitution
The zero-width position between a word character and a non-word character, written \b in a regular expression; based on the ASCII \w set, so accented letters do not count as word characters.
A learned numerical representation of a word as a short, dense vector, meaning a list of numbers.
Notes The numbers are learned from patterns in language data rather than assigned manually, and their individual meanings are usually not interpretable. Words that occur in similar linguistic contexts generally receive similar vectors, allowing a system to compare words mathematically and recognize relationships in meaning or grammatical use. Word embeddings can therefore serve as inputs to tasks such as text classification, translation and language generation. In traditional static embedding methods such as word2vec and GloVe, each word type has a single fixed vector, so different senses of a polysemous word share the same representation. Modern language models instead create contextual embeddings for individual token occurrences, so the representation can change according to the surrounding text.
other attested French terms: vecteur-mot, plongement de mots
The standard metric of speech recognition quality: the proportion of substituted, deleted and inserted words in the automatic transcript relative to the number of words in a human reference; it measures how frequent errors are, not how serious.
A line break added by the program, not typed by the user : when a line reaches the edge of the window, whatever does not fit moves to the next row of the display. Nothing is added to the text itself, so the same text breaks in different places at a different window width, in another program, or at another font size. A line break typed into the text is a character, and it stays where it is.
other attested English terms: word wrapping, wraparound, soft return
other attested French terms: retour automatique à la ligne, bouclage, renvoi à la ligne
XML Localization Interchange File Format (XLIFF)fr XML Localization Interchange File Format (XLIFF)
Contextexchange formatstranslation
The XML-based bilingual format for passing content through a localization workflow: source and target segments travel together with workflow metadata such as translation status, rather than exchanging linguistic resources.
A machine-learning approach in which a model performs a new task, or recognizes new categories, without receiving any task-specific examples, by drawing on knowledge acquired from other data or tasks.
other attested French terms: apprentissage zéro-coup, apprentissage zéro exemple, apprentissage à zéro exemple
* “formulation de requête sans exemple” is my own suggestion: no term bank attests it.
A
affinageen fine-tuning
Contexteapprentissage automatiquemodèles de langue
Poursuite de l'entraînement d'un modèle préentraîné sur un jeu de données généralement plus restreint et spécialisé, afin de l'adapter à une tâche ou à un domaine particulier.
Remarques L'affinage peut ajuster tous les paramètres du modèle ou seulement une partie, et demande généralement beaucoup moins de données et de calcul que le préentraînement.
autres termes français attestés: réglage fin, peaufinage
affinage par apprentissage supervisé*en supervised fine-tuning (SFT)
Contextemodèles de langueapprentissage automatique
Entraînement supplémentaire d'un modèle préentraîné sur des exemples étiquetés associant une entrée à une sortie souhaitée, les paramètres du modèle étant ajustés pour rendre ces sorties plus probables.
Remarques Pour les GML, il s'appuie souvent sur des exemples d'instructions et de réponses, auquel cas on parle aussi d'affinage par instructions. Ce dernier en est un sous-type courant, mais l'affinage par apprentissage supervisé sert aussi à la classification, à l'adaptation à un domaine et à d'autres tâches étiquetées.
autres termes français attestés: peaufinage par apprentissage supervisé
* « affinage par apprentissage supervisé » est ma proposition : aucune banque de terminologie ne l'atteste.
affinage par instructionsen instruction tuning
Contextemodèles de langue
Forme d'affinage par apprentissage supervisé dans laquelle un modèle de langue préentraîné est entraîné davantage sur des exemples associant des instructions ou des questions à des réponses appropriées.
Remarques Le modèle devient ainsi plus apte à suivre des instructions dans un éventail de tâches, y compris des tâches qui ne figurent pas exactement dans les exemples d'entraînement.
autres termes anglais attestés: instruction fine-tuning
Système d'IA qui choisit et exécute des actions en vue d'un but, souvent en utilisant des outils ou en appelant d'autres programmes et en adaptant ses actions ultérieures aux résultats reçus.
autres termes anglais attestés: agent
autres termes français attestés: agent intelligent autonome
Opération qui consiste à apparier un texte source et une traduction déjà existante de ce texte, segment par segment, afin d'en stocker les paires comme unités de traduction dans une mémoire de traduction.
Remarques L'alignement est le moyen de constituer une mémoire à partir de documents traduits avant l'usage d'un outil, ou traduits par quelqu'un d'autre. Les logiciels alignent automatiquement, par phrases ou par mots, et le résultat se vérifie à la main : une phrase scindée en deux dans la traduction, ou un paragraphe déplacé, décale les deux textes à partir de ce point.
autres termes anglais attestés: text alignment, translation alignment, bitext alignment
autres termes français attestés: alignement de texte
Processus et objectif consistant à faire en sorte que les systèmes d'IA se comportent conformément aux valeurs et aux intentions humaines, ce qui suppose souvent des compromis avec la capacité brute.
alignement sur les préférences*en preference alignment
Contextemodèles de langueIA
Processus de postentraînement qui ajuste un modèle de langue pour qu'il produise plus volontiers des réponses jugées préférables et moins volontiers des réponses jugées indésirables.
Remarques Les données d'entraînement associent typiquement une requête à deux réponses candidates ou plus, classées, retenues ou rejetées selon des critères comme l'utilité, l'exactitude, la sécurité, le style ou le respect des instructions. Les préférences peuvent venir d'annotateurs humains, être déduites du comportement des utilisateurs ou être générées par un autre modèle évaluateur, et différents algorithmes peuvent en apprendre : l'apprentissage par renforcement avec rétroaction humaine entraîne couramment un modèle de récompense puis optimise le modèle de langue en fonction de cette récompense, tandis que l'optimisation directe des préférences entraîne le modèle plus directement à partir de paires de réponses préférées et rejetées. L'alignement sur les préférences est plus large que l'ARRH, qui en est une méthode. L'alignement sur des préférences recueillies ne garantit ni l'exactitude factuelle, ni la sécurité, ni l'accord avec des valeurs humaines universelles : le résultat reflète les critères, les consignes et les jugements des personnes ou des systèmes qui ont produit les données de préférence, et les auteurs d'InstructGPT soulignent eux-mêmes que les préférences de leurs annotateurs ne représentent pas nécessairement celles d'une population plus large.
* « alignement sur les préférences » est ma proposition : aucune banque de terminologie ne l'atteste.
alternative*en alternation
Contexteexpressions rationnelles
Le « ou » d'une expression rationnelle, noté par une barre verticale : /chat|chien/ correspond à l'un ou à l'autre, et c'est la première possibilité qui correspond à cet endroit qui est retenue.
Remarques La barre a la priorité la plus faible de tous les opérateurs : seule, elle sépare tout ce qui est à sa gauche de tout ce qui est à sa droite. C'est un groupe qui en limite la portée, et c'est pourquoi /^(chat|chien)$/ et /^chat|chien$/ ne veulent pas dire la même chose.
* « amplification » est ma proposition : aucune banque de terminologie ne l'atteste.
ancre*en anchor
Contexteexpressions rationnelles
Construction d'expression rationnelle qui correspond à une position dans le texte plutôt qu'à un caractère : elle fait réussir ou échouer une correspondance sans rien consommer.
Remarques Les ancres de ligne sont ^ pour le début d'une ligne et $ pour la fin ; avec le drapeau multiligne, elles s'appliquent ligne par ligne plutôt qu'au texte entier. Comme elles ne consomment rien, /^$/ trouve une ligne vide, où les deux positions coïncident, et /^\d/ correspond à un chiffre et non à un chiffre plus le début de la ligne.
Processus consistant à ajouter aux données des étiquettes ou d'autres informations structurées, comme des catégories, des balises, des transcriptions ou des zones marquées, pour qu'elles puissent servir à entraîner ou à évaluer un système d'apprentissage automatique.
Remarques L'annotation est souvent réalisée par des personnes, parfois avec l'aide de machines, et peut exiger du jugement quand les étiquettes appropriées ne sont pas sans ambiguïté.
appauvrissement des connaissancesen knowledge collapse
Contexteéthique et sociétéIA
Processus hypothétique par lequel le recours généralisé à de l'information générée ou relayée par l'IA concentre l'attention sur les idées courantes et centralement représentées, tandis que les savoirs plus rares, spécialisés ou non conventionnels sont consultés, transmis et développés moins souvent.
Remarques Avec le temps, l'éventail des connaissances qu'une communauté juge accessibles ou dignes d'intérêt peut s'en trouver rétréci.
Mécanisme qui permet à un modèle de langue de demander l'utilisation d'une fonction ou d'un outil externe en produisant son nom et les arguments requis sous une forme structurée.
Remarques L'application environnante valide et exécute la fonction, puis peut retourner le résultat au modèle, qui peut l'utiliser pour générer une réponse.
apprentissage à peu d'exemplesen few-shot learning
Contexteapprentissage automatique
Approche d'apprentissage automatique dans laquelle un modèle apprend une nouvelle tâche, ou s'y adapte, ou reconnaît de nouvelles catégories, à partir d'un petit nombre d'exemples pertinents seulement, typiquement en s'appuyant sur des connaissances acquises sur d'autres données ou d'autres tâches.
autres termes français attestés: apprentissage avec peu d'exemples
Approche de l'intelligence artificielle dans laquelle un modèle est entraîné sur des données ou sur l'expérience, de sorte que ses paramètres ajustables en viennent à refléter des régularités pertinentes pour une tâche.
Remarques Le modèle entraîné peut ensuite appliquer ces régularités à de nouvelles entrées, par exemple pour produire des prédictions ou des classifications. Les régularités propres à la tâche sont apprises à partir des données plutôt qu'entièrement spécifiées à l'avance sous forme de règles écrites à la main.
Approche d'apprentissage automatique dans laquelle les cibles servant à l'entraînement sont créées automatiquement à partir de la structure ou du contenu des données, plutôt que fournies sous forme d'étiquettes rédigées par des humains.
Remarques Le modèle reçoit habituellement une partie ou une version modifiée d'un exemple et apprend à en prédire une autre partie. Par exemple, un modèle de langue autorégressif apprend à prédire le jeton suivant à partir des jetons précédents ; dans l'entraînement d'un modèle de langue masqué, des jetons sont cachés et le modèle apprend à les reconstruire à partir du texte environnant. Dans les deux cas, le texte fournit lui-même les réponses attendues. L'apprentissage autosupervisé évite d'étiqueter chaque exemple à la main. Il ne signifie pas que le modèle choisit seul quoi apprendre ni comment : des personnes et des organisations choisissent les données, conçoivent l'objectif d'apprentissage et déterminent comment le modèle sera évalué.
apprentissage de représentationsen representation learning
Contexteapprentissage automatique
Approche d'apprentissage automatique dans laquelle un système apprend, à partir des données, des représentations internes utiles de ses entrées, plutôt que de s'appuyer principalement sur des attributs conçus par des humains.
Remarques Dans un réseau de neurones, ces représentations sont des vecteurs numériques ou des motifs d'activation qui rendent l'information utile pour la prédiction, la classification ou un autre objectif d'entraînement. L'apprentissage de représentations peut être supervisé, autosupervisé ou non supervisé ; ce n'est pas un synonyme d'apprentissage non supervisé. Une représentation apprise n'a pas nécessairement de dimensions interprétables individuellement, et parler de représentation du sens ne suppose pas une compréhension sémantique comparable à celle des humains.
apprentissage en contexteen in-context learning (ICL)
Contexterequêtesmodèles de langue
Adaptation temporaire du comportement d'un modèle de langue à des informations, à des instructions ou à des exemples fournis dans sa requête ou son contexte courant, sans modification de ses paramètres.
Remarques Le modèle peut ainsi accomplir une nouvelle tâche ou mieux prédire pendant l'interaction en cours, mais l'adaptation ne persiste pas une fois le contexte retiré.
apprentissage non superviséen unsupervised learning
Contexteapprentissage automatique
Approche d'apprentissage automatique qui cherche des régularités ou des structures dans les données sans recevoir d'étiquette cible ni de sortie attendue pour chaque exemple d'entraînement.
Remarques Elle sert à des tâches comme regrouper des exemples semblables, détecter des anomalies, réduire la dimensionnalité et estimer la distribution des données. Cela ne signifie pas qu'aucun humain n'intervient : des personnes choisissent et préparent les données, sélectionnent l'algorithme et décident comment interpréter et valider les régularités obtenues. L'apprentissage autosupervisé est parfois rangé sous l'apprentissage non supervisé parce qu'il part de données non étiquetées ; il est utile de les distinguer, puisque l'apprentissage autosupervisé construit automatiquement des cibles de prédiction, alors que l'apprentissage non supervisé au sens strict cherche des structures sans de telles paires entrée-cible.
apprentissage par renforcement (AR)en reinforcement learning (RL)
Contexteapprentissage automatique
Type d'apprentissage automatique dans lequel un agent apprend à agir en recevant des récompenses ou des pénalités en réponse à ses actions, avec l'objectif de maximiser sa récompense globale.
Remarques Dans le postentraînement des modèles de langue, les réponses générées sont évaluées par un signal de récompense et le modèle est ajusté pour rendre plus probables les réponses les mieux récompensées.
apprentissage par renforcement avec récompenses vérifiables*en reinforcement learning with verifiable rewards (RLVR)
Contextemodèles de langueapprentissage automatique
Méthode de postentraînement d'un modèle de langue dans laquelle les récompenses dépendent du respect, par ses réponses, de critères vérifiables automatiquement.
Remarques Par exemple, une réponse mathématique peut être comparée à une solution connue, ou du code généré peut être exécuté pour vérifier son bon fonctionnement. L'apprentissage par renforcement ajuste le modèle pour rendre plus probables les réponses les mieux récompensées.
* « apprentissage par renforcement avec récompenses vérifiables » est ma proposition : aucune banque de terminologie ne l'atteste.
apprentissage par renforcement avec rétroaction humaine (ARRH)en reinforcement learning from human feedback (RLHF)
Contextemodèles de langueapprentissage automatique
Méthode de postentraînement d'un modèle de langue dans laquelle des évaluations humaines de réponses possibles servent à créer un signal de récompense, souvent en entraînant un modèle de récompense distinct.
Remarques L'apprentissage par renforcement ajuste ensuite le modèle de langue pour rendre plus probables les réponses dont la récompense prédite est plus élevée.
Approche de l'apprentissage automatique fondée sur des réseaux de neurones comportant de nombreuses couches successives d'unités de calcul.
Remarques Le mot profond renvoie à cette architecture en couches, où chaque couche traite l'information reçue de la couche précédente.
apprentissage sans exempleen zero-shot learning
Contexteapprentissage automatique
Approche d'apprentissage automatique dans laquelle un modèle accomplit une nouvelle tâche, ou reconnaît de nouvelles catégories, sans recevoir d'exemples propres à la tâche, en s'appuyant sur des connaissances acquises sur d'autres données ou d'autres tâches.
autres termes français attestés: apprentissage zéro-coup, apprentissage zéro exemple, apprentissage à zéro exemple
Forme d'apprentissage automatique dans laquelle un modèle apprend à partir d'exemples étiquetés.
Remarques Chaque exemple d'entraînement associe une entrée à sa sortie correcte, ce qui permet au modèle entraîné de prédire une sortie appropriée pour de nouvelles entrées.
Processus d'essai structuré dans lequel les testeurs adoptent une perspective antagoniste et tentent délibérément de mettre au jour des vulnérabilités, des comportements nuisibles ou inattendus et des façons possibles de détourner un modèle ou un système d'IA.
Remarques Les constats servent à évaluer et à améliorer les garde-fous du système.
arithmétique vectorielle appliquée aux plongements*en embedding arithmetic
Contexteplongements
Utilisation de l'addition et de la soustraction sur des vecteurs de plongement pour vérifier si une relation sémantique est représentée par une direction ou un décalage à peu près constant dans un espace de plongement.
Remarques Illustration connue : le vecteur obtenu par king − man + woman peut se trouver près du vecteur de queen.
* « arithmétique vectorielle appliquée aux plongements » est ma proposition : aucune banque de terminologie ne l'atteste.
assurance de la qualité (AQ)en quality assurance (QA)
ContexteTAOtraduction
Ensemble de vérifications planifiées et systématiques destinées à donner une confiance raisonnable qu'un produit ou un service satisfait aux exigences fixées.
Remarques En traduction, et particulièrement dans un outil de traduction assistée par ordinateur, elle prend la forme d'une vérification automatique de propriétés formelles de la traduction : nombres qui diffèrent de la source, balises présentes dans la source et absentes de la cible, segments vides ou non traduits, doubles espaces, ponctuation, termes de la base terminologique dont l'équivalent ne figure pas dans la cible. La vérification signale les écarts entre la cible, la source et les règles du projet, et ne dit rien de la qualité de la traduction. Les contrôles activés et leur sévérité se règlent par projet, parce qu'un projet de localisation logicielle et un projet de marketing ne tolèrent pas les mêmes choses.
autres termes anglais attestés: QA check
autres termes français attestés: assurance qualité, contrôle qualité
Mécanisme d'attention dans lequel les requêtes proviennent d'une séquence ou d'un composant et les clés et valeurs d'un autre.
Remarques Dans un modèle encodeur-décodeur, l'attention croisée permet au décodeur de sélectionner de l'information dans les représentations de l'encodeur pendant la production de la sortie. Elle peut aussi relier le texte à des représentations d'images, d'audio ou d'autres modalités dans les systèmes multimodaux. Dans l'autoattention, requêtes, clés et valeurs proviennent de la même séquence ; dans l'attention croisée, elles relient des séquences ou des composants différents. Les modèles de langue à décodeur seul n'ont pas d'encodeur distinct et n'utilisent donc pas la forme encodeur-décodeur de l'attention croisée, même si des variantes multimodales peuvent en ajouter des modules.
Propriété ou représentation d'une observation qu'un modèle d'apprentissage automatique utilise en entrée pour produire une prédiction.
Remarques En traitement automatique de la langue, les attributs peuvent être des comptes de mots, la longueur des phrases, des catégories grammaticales ou des représentations numériques apprises.
En XML, paire nom-valeur inscrite dans la balise ouvrante d'un élément, ou dans sa balise d'élément vide, pour fournir de l'information supplémentaire sur cet élément, comme sa langue, son identifiant ou sa date de création.
Mécanisme d'attention qui permet à chaque jeton d'une séquence d'attribuer des poids différents aux autres jetons pertinents de la même séquence et de combiner l'information qu'ils portent.
Remarques Le modèle peut ainsi construire une représentation de chaque jeton sensible au contexte et capter les relations entre jetons, y compris à longue distance dans la séquence.
Marqueur qui délimite et identifie un élément dans un document balisé, fonctionnant généralement par paire : une balise ouvrante et une balise fermante autour du contenu qu'elles désignent.
Marqueur placé à l'intérieur d'un segment qui représente une mise en forme ou un code du document d'origine, par exemple un passage en gras ou un appel de note, et non du texte à traduire.
Remarques Chaque format d'échange définit ses propres éléments internes : bpt, ept et ph en TMX; pc, sc, ec et ph en XLIFF.
* « balise interne » est ma proposition : aucune banque de terminologie ne l'atteste.
base d'apprentissageen training corpus
Contextedonnéesmodèles de langue
Collection de textes ou d'autres données langagières servant à estimer ou à mettre à jour les paramètres d'un modèle pendant l'entraînement ou le préentraînement.
Base de données d'entrées terminologiques organisée par concept, contenant les termes de plusieurs langues et des métadonnées comme des définitions, des domaines et des marques d'usage.
Tendance systématique d'un système d'IA, ou des processus qui l'entourent, à rendre certains résultats, erreurs ou effets plus probables que d'autres.
Remarques Le biais peut venir des données d'entraînement, des choix sur ce qui est mesuré ou prédit, de la conception et de l'évaluation du modèle, des présupposés humains, des pratiques institutionnelles ou du contexte d'utilisation. En IA responsable, le terme désigne généralement un biais indésirable qui rend les résultats inexacts, non représentatifs ou inéquitables, en particulier pour certaines personnes ou certains groupes. Le biais n'est pas nécessairement intentionnel, et un biais statistique n'équivaut pas nécessairement à de la discrimination.
Tendance d'un modèle d'IA à représenter les membres de certains groupes sociaux, en particulier les groupes marginalisés ou socialement subordonnés, comme plus semblables entre eux et moins variés individuellement que les membres des groupes socialement dominants.
Contexteéthique et sociétéapprentissage automatique
Régularité, distorsion ou lacune systématique et indésirable dans les données servant à entraîner un modèle d'IA, qui influence ce que le modèle apprend.
Remarques Elle peut venir de données qui reproduisent des inégalités ou des stéréotypes historiques, sous-représentent des personnes, des langues ou des situations pertinentes, ou contiennent des mesures, des exemples ou des étiquettes systématiquement faussés. Le biais des données d'entraînement peut rendre un modèle moins exact ou moins équitable pour certains usages ou groupes, mais il n'est qu'une source possible de biais dans un système d'IA.
autres termes anglais attestés: training data bias
autres termes français attestés: biais des données d'apprentissage
* « biais des données d'entraînement » est ma proposition : aucune banque de terminologie ne l'atteste.
C
calcul au moment de l'inférence*en test-time computation
Contextemodèles de langue
Calcul effectué quand un modèle entraîné répond à une entrée donnée, au-delà d'une seule génération ordinaire.
Remarques Il peut comprendre la production d'un raisonnement intermédiaire plus long, la génération et la comparaison de plusieurs candidats, la recherche, la récupération d'information ou la vérification d'une réponse.
autres termes français attestés: calcul à l'inférence
* « calcul au moment de l'inférence » est ma proposition : aucune banque de terminologie ne l'atteste.
capacité émergenteen emergent ability
Contextemodèles de langue
Une capacité est dite émergente quand un modèle ne montre à peu près aucun succès mesuré sur une tâche aux petites échelles, mais une performance nettement meilleure à plus grande échelle, sans que la simple extrapolation des résultats des petits modèles le prédise.
Remarques L'émergence apparente peut dépendre de la façon de mesurer la performance et ne démontre donc pas nécessairement qu'une capacité entièrement nouvelle est apparue soudainement.
capitalisme de surveillanceen surveillance capitalism
Contexteéthique et société
Logique économique dans laquelle des organisations s'approprient et analysent des données sur les activités et les expériences des personnes afin de prédire les comportements et, de plus en plus, de les influencer à des fins commerciales.
Dans une recherche, caractère qui tient lieu d'autres caractères plutôt que de lui-même, ce qui permet de laisser indéterminées les parties d'une chaîne dont on ne se soucie pas.
Remarques La recherche de fichiers et les traitements de texte emploient * et ? de cette façon. Dans une expression rationnelle, le caractère générique est le point : il correspond à n'importe quel caractère sauf un saut de ligne, et aux sauts de ligne aussi quand le drapeau s est actif.
autres termes français attestés: caractère joker, joker, caractère de remplacement, caractère de substitution
Caractère auquel un langage de programmation ou de balisage attribue une fonction syntaxique particulière. Lorsqu'il doit plutôt apparaître comme texte ordinaire, il faut le plus souvent l'écrire autrement, au moyen d'un code court qui le remplace : en XML, « & » et « < » ne peuvent généralement pas figurer tels quels dans le texte et s'écrivent « & » et « < ». Qu'il soit réservé ou non dépend du contexte ; il n'est pas nécessairement interdit partout dans le document.
Installation qui abrite de l'équipement de calcul, de stockage et de réseau, ainsi que les infrastructures de soutien comme l'alimentation électrique, les systèmes de refroidissement et les systèmes de sécurité.
Remarques Les centres de traitement de données fournissent les ressources de calcul servant à entraîner et à exécuter les modèles d'IA, même si l'IA n'est qu'une de leurs charges de travail. Leur usage croissant, y compris pour l'IA, augmente leur demande globale d'électricité.
Séquence d'étapes intermédiaires, semblables à un raisonnement, générée par un modèle de langue pendant qu'il progresse vers une réponse.
Remarques Une telle séquence peut être suscitée par une requête en chaîne de résolution, par exemple en fournissant des démonstrations contenant des étapes détaillées.
Construction d'expression rationnelle entre crochets qui correspond à exactement un caractère parmi l'ensemble ou la plage indiquée, avec négation possible par ^.
Utilisation de modèles d'intelligence artificielle pour créer une copie numérique de la voix d'une personne et générer de nouveaux énoncés avec cette voix; contrairement à la synthèse de la parole générique, l'objectif est de reproduire un locuteur précis.
codage de caractèresen character encoding
Contexteencodage du texte
Convention qui permet de représenter les caractères d'un texte sous forme de séquences d'octets afin de pouvoir l'enregistrer, le transmettre et le reconstituer. Les mêmes octets peuvent donner des caractères différents selon le codage utilisé pour les interpréter : le codage déclaré doit donc correspondre à celui dans lequel le fichier a réellement été enregistré. Le codage de caractères ne doit pas être confondu avec la police de caractères, qui détermine l'apparence des caractères, ni avec le répertoire de caractères, qui détermine quels caractères sont disponibles.
Jeu de caractères codés sur sept bits comptant 128 caractères, destiné à l'échange d'information, normalisé sous le nom ANSI X3.4 et repris comme variante nationale américaine de la norme ISO/IEC 646. Il contient les lettres non accentuées de l'alphabet anglais, les chiffres, la ponctuation courante et un ensemble de codes de commande, et aucune lettre accentuée. Les 128 premiers caractères d'Unicode sont ceux d'ASCII, dans le même ordre, ce qui explique qu'UTF-8 les stocke sur un seul octet.
autres termes anglais attestés: American Standard Code for Information Interchange
autres termes français attestés: ASCII, code américain normalisé pour l'échange d'information
Combinaison de mots qui apparaissent ensemble plus souvent que le hasard ne le laisserait prévoir et qui forment une association habituelle, semi-figée, comme soleil de plomb ou commettre un crime (plutôt que faire un crime).
Remarques Les outils de corpus repèrent les collocations statistiquement, en comparant la fréquence d'apparition conjointe de deux mots à celle attendue par hasard. Connaître les collocations de la langue cible compte pour beaucoup dans la production d'un texte idiomatique, ce qui rend la recherche de collocations en corpus directement utile en traduction.
Organisme sans but lucratif qui recueille régulièrement des données Web accessibles au public et rend librement disponibles les archives et jeux de données qui en résultent.
Remarques Des versions filtrées et traitées des données de Common Crawl ont servi à entraîner de nombreux grands modèles de langue.
compression avec perteen lossy compression
Contexteinformatique
Méthode de réduction de la quantité de données nécessaire pour représenter une information, qui en écarte une partie, de sorte que l'original ne peut pas être reconstruit exactement.
Remarques Le préentraînement des GML est parfois décrit, par métaphore, comme une compression avec perte du corpus d'entraînement : les paramètres du modèle retiennent des régularités et des associations statistiques du texte sans conserver le corpus comme archive complète et exacte.
concentration du marchéen market concentration
Contexteéthique et sociétéIA
Mesure dans laquelle les ventes, la production ou une autre mesure pertinente de l'activité d'un marché donné sont le fait d'un nombre relativement restreint d'entreprises.
Remarques On l'évalue couramment d'après les parts de marché, au moyen de mesures comme les ratios de concentration ou l'indice de Herfindahl-Hirschman (IHH). Dans le secteur de l'IA, la concentration peut se produire à différents niveaux de la chaîne d'approvisionnement : puces d'IA, infonuagique, accès aux données et aux ressources de calcul, développement de modèles et applications en aval.
Affichage de toutes les occurrences d'un mot ou d'une expression dans un corpus, chacune accompagnée de son contexte immédiat, généralement une occurrence par ligne avec le mot cherché aligné au centre (format KWIC, mot-clé en contexte).
Remarques La concordance permet de passer du comptage des mots à l'observation de leur usage : constructions typiques, collocations, registre, sens. Le logiciel qui la produit s'appelle un concordancier.
Problème qui survient quand une partie des données servant à évaluer un modèle figure aussi dans ses données d'entraînement.
Remarques Le modèle pouvant déjà avoir rencontré les exemples d'évaluation, ses résultats aux tests de performances peuvent surestimer sa performance sur du matériel réellement inédit.
Contenu généré par l'IA qui paraît soigné ou compétent à première vue, mais qui a peu de substance, demande très peu d'effort à produire par rapport au même contenu fait sans IA, et peut être produit en très grandes quantités.
autres termes français attestés: IA dégénérative, bouillie d'IA
Texte, images, audio, vidéo ou autres médias numériques générés ou substantiellement modifiés par un algorithme, en particulier par un système d'IA générative.
Ensemble de textes écrits, d'enregistrements de parole ou de langue transcrite réuni pour l'analyse ou pour les technologies langagières.
Remarques En linguistique de corpus, un corpus est typiquement lisible par machine, choisi et documenté selon des critères explicites, afin de soutenir la recherche sur une langue ou une variété de langue donnée. En TAL, le terme s'emploie souvent plus largement pour toute collection de données langagières servant à entraîner, à développer ou à évaluer un système, même quand elle n'a pas été conçue pour être équilibrée ou représentative.
Corpus réunissant des textes en deux ou plusieurs langues (ou variétés de langue) qui ne sont pas des traductions les uns des autres, mais qui partagent un sujet, un genre ou une fonction de communication, comme des articles de presse rédigés indépendamment en français et en anglais sur les mêmes événements.
Remarques Le corpus comparable montre comment chaque langue exprime nativement un contenu semblable, sans influence de la traduction, ce qui le rend utile en terminologie et pour vérifier qu'une traduction se lit comme un original.
* « corpus comparable » est ma proposition : aucune banque de terminologie ne l'atteste.
corpus parallèleen parallel corpus
Contextecorpustraduction
Corpus de textes dans une langue accompagnés de leurs traductions vers une ou plusieurs autres langues, généralement alignés phrase par phrase de façon à afficher chaque segment en regard de son équivalent.
Remarques Les corpus parallèles comme Europarl ou le Hansard canadien consignent de vraies décisions de traduction, ce qui les rend utiles pour observer des équivalences, construire des mémoires de traduction et entraîner des systèmes de traduction automatique. Une mémoire de traduction est en somme un corpus parallèle constitué de ses propres traductions.
Correspondance de mémoire de traduction dans laquelle le segment source stocké est identique au segment à traduire et où les segments voisins correspondent également, de sorte que la traduction stockée a été produite dans le même entourage.
Remarques Elle dépend donc deux fois de la segmentation : par le segment lui-même, et par la place que la segmentation a donnée à ses voisins. Les outils la tiennent pour plus fiable que la correspondance exacte simple et l'affichent à part, au-dessus de 100 % ou sous un nom qui leur est propre, parce que la raison la plus courante pour qu'une phrase identique demande une autre traduction est qu'elle se trouve ailleurs dans le document.
autres termes anglais attestés: in-context exact match, 101 % match
autres termes français attestés: correspondance exacte avec contexte
Correspondance de mémoire de traduction dans laquelle le segment source stocké est identique, caractère pour caractère, au segment à traduire, de sorte que l'outil peut insérer la traduction stockée telle quelle.
Remarques La mémoire est interrogée segment par segment : ce qui compte comme identique dépend donc de la segmentation appliquée aux deux textes, et une même phrase découpée autrement n'est pas retrouvée. Un texte source identique ne garantit pas non plus que la même traduction convienne encore : une même phrase peut demander une autre formulation ailleurs dans un document, ce qu'ajoute la correspondance en contexte et que la correspondance exacte ne dit pas.
autres termes anglais attestés: full match, 100 % match
autres termes français attestés: correspondance à 100 %
Correspondance de mémoire de traduction dans laquelle le segment source stocké ressemble au segment à traduire sans lui être identique, exprimée en pourcentage inférieur à 100. La comparaison se fait segment par segment : le pourcentage mesure donc la distance entre deux segments tels que la segmentation les a produits, et non entre deux textes.
Remarques L'outil propose la traduction stockée en signalant les écarts entre les deux segments sources, et le traducteur l'adapte. Les outils appliquent un seuil sous lequel aucune correspondance n'est proposée, au motif que corriger une correspondance trop éloignée coûte plus cher que traduire le segment à neuf.
autres termes anglais attestés: partial match
autres termes français attestés: correspondance approximative, correspondance floue
Perturbation grave des pratiques, des normes et des institutions communes par lesquelles une société produit, vérifie et reconnaît le savoir.
Remarques Elle se marque par un désaccord profond sur les sources et les méthodes dignes de confiance, ce qui affaiblit la base factuelle commune nécessaire au jugement public et à la décision collective. La mésinformation générée par l'IA peut y contribuer en augmentant le volume et la plausibilité des contenus faux ou invérifiables, mais de telles crises ont des causes sociales, politiques et institutionnelles plus larges.
Utilisation délibérée de requêtes spécialement conçues ou de stratégies d'interaction pour amener un modèle d'IA à contourner les restrictions sur ses sorties ou son comportement, comme son refus de fournir du contenu interdit ou des renseignements sensibles.
Approche d'entraînement dans laquelle les données d'entrée sont délibérément corrompues et où un modèle apprend à reconstruire la version d'origine ou une version propre.
Remarques Pour le texte, la corruption peut consister à masquer, supprimer, remplacer, insérer ou réordonner des jetons ; la modélisation du langage masqué est une forme de débruitage. Le bruit n'est pas nécessairement une interférence visuelle ou sonore aléatoire : en apprentissage automatique, toute altération délibérée que le modèle apprend à inverser peut jouer ce rôle.
autres termes français attestés: apprentissage par débruitage
Processus qui, pendant la génération de texte, transforme les probabilités prédites par un modèle de langue en une séquence réelle de jetons de sortie.
Remarques À chaque étape, le modèle attribue des probabilités aux jetons suivants possibles et une méthode de décodage détermine lequel est retenu ; le jeton retenu s'ajoute au contexte, le modèle calcule une nouvelle distribution de probabilité, et le processus se répète jusqu'à une condition d'arrêt. Les méthodes de décodage font ces choix différemment : le décodage glouton choisit toujours le jeton le plus probable, les méthodes d'échantillonnage laissent leur chance à d'autres jetons vraisemblables, et des réglages comme la température, le top-k et le top-p modifient la variété ou la prévisibilité du texte produit. Le décodage ne réentraîne pas le modèle et ne change pas ses paramètres, mais il peut influer sensiblement sur la formulation, la diversité et la qualité de la sortie. Cette entrée concerne le décodage pendant la génération autorégressive ; dans d'autres domaines du TAL, le décodage désigne plus largement la recherche de la sortie ou de la séquence cachée la plus probable, comme dans le décodage de Viterbi.
* « décodage » est ma proposition : aucune banque de terminologie ne l'atteste.
décodage glouton*en greedy decoding
Contextemodèles de langue
Méthode de décodage qui retient, à chaque étape de génération, l'unique jeton le plus probable.
Remarques Le jeton retenu s'ajoute à la séquence et la procédure se répète jusqu'à l'arrêt de la génération. Le décodage glouton est simple et déterministe à conditions fixes, mais son choix localement optimal à chaque étape ne produit pas nécessairement la séquence complète la plus probable ni la meilleure. Il peut produire un texte répétitif ou générique, et il se distingue de l'échantillonnage en ce qu'il n'introduit aucun hasard délibéré.
* « décodage glouton » est ma proposition : aucune banque de terminologie ne l'atteste.
décodeuren decoder
Contexteapprentissage profond
Composant ou architecture de réseau de neurones servant à générer une séquence de sortie.
Remarques Pendant la génération, le décodeur traite les jetons déjà disponibles et produit une distribution de probabilité sur les jetons suivants possibles. Son mécanisme d'attention est normalement restreint pour qu'une prédiction ne puisse pas utiliser des jetons qui ne sont pas encore générés. Dans un modèle encodeur-décodeur, le décodeur s'appuie aussi sur une représentation de l'entrée produite par un encodeur distinct, disposition courante pour des tâches comme la traduction automatique. Dans un modèle à décodeur seul, il n'y a pas d'encodeur distinct : la requête et les jetons déjà générés sont traités comme une seule séquence, et la plupart des modèles de langue génératifs actuels utilisent cette architecture. Le décodeur calcule les probabilités du jeton suivant ; une méthode de décodage, comme le décodage glouton ou l'échantillonnage top-p, détermine comment un jeton de sortie est choisi parmi ces probabilités.
Se dit d'un processus, d'un algorithme ou d'un système qui, dans les mêmes conditions initiales et avec la même entrée, produit toujours la même sortie.
Remarques Le nom correspondant, déterminisme, désigne la propriété d'un processus qui produit la même sortie chaque fois qu'il part du même état et reçoit la même entrée. Les deux notions reviennent souvent à propos des réseaux de neurones, et des GML en particulier, où le hasard du décodage et de l'environnement de calcul peut faire varier les sorties d'une exécution à l'autre.
Segmentation automatique d'un enregistrement audio par locuteur : déterminer qui parle quand, afin d'attribuer chaque segment de parole à la bonne personne.
autres termes français attestés: diarisation des locuteurs
distinction entre cohérence et correspondance*en coherence-correspondence distinction
Contexteévaluationmodèles de langue
Cadre d'évaluation des sorties d'un GML selon deux critères différents.
Remarques La cohérence concerne la compatibilité mutuelle et l'enchaînement logique des affirmations, du raisonnement exprimé et de la conclusion d'une sortie ; la correspondance concerne l'accord de la sortie avec les faits externes ou sa capacité à prédire des résultats réels. Une sortie peut donc être cohérente mais factuellement inexacte, ou arriver à une réponse correcte par un raisonnement incohérent ou invalide.
* « distinction entre cohérence et correspondance » est ma proposition : aucune banque de terminologie ne l'atteste.
distribution de probabilitéen probability distribution
Contexteapprentissage automatique
Description de la répartition de la probabilité entre les valeurs possibles d'une variable aléatoire.
Remarques Pour un ensemble discret de résultats, chaque résultat reçoit une probabilité entre 0 et 1, et les probabilités de tous les résultats possibles totalisent 1. Un modèle de langue produit une distribution de probabilité sur les jetons suivants possibles de son vocabulaire ; pour générer du texte, une procédure de décodage choisit ou échantillonne un jeton selon cette distribution.
En programmation, option activée ou désactivée pour toute une opération, qui modifie sa façon de s'exécuter.
Remarques Les drapeaux s'ajoutent à une expression rationnelle sous forme de lettres écrites après le motif, dans n'importe quel ordre et n'importe quelle combinaison : g trouve toutes les correspondances au lieu de la première seulement, i ignore la casse, m fait correspondre ^ et $ au début et à la fin de chaque ligne plutôt que du texte entier, s permet au point de correspondre à un saut de ligne, u active le support Unicode complet.
Méthode de décodage qui introduit une part de hasard dans le choix du prochain jeton généré par un modèle de langue.
Remarques À chaque étape, le modèle attribue des probabilités aux jetons suivants possibles ; l'échantillonnage choisit parmi eux selon ces probabilités, de sorte qu'un jeton très probable a plus de chances d'être retenu sans que ce soit garanti. Le jeton choisi s'ajoute au contexte et le processus se répète. Un échantillonnage sans restriction peut parfois retenir des jetons peu plausibles dans la queue de la distribution ; les méthodes pratiques ajustent ou restreignent donc les probabilités au moyen de réglages comme la température, le top-k ou le top-p. Le choix étant aléatoire, des générations répétées à partir de la même requête peuvent produire des sorties différentes, même si la reproductibilité est parfois possible quand le germe aléatoire et les conditions de calcul sont fixés. L'échantillonnage est une forme de décodage ; les deux termes ne sont pas synonymes, le décodage comprenant aussi des méthodes sans échantillonnage comme le décodage glouton et la recherche en faisceau.
échantillonnage à troncature de masse pen top-p sampling
Contextemodèles de langue
Méthode de choix du jeton suivant dans un texte généré.
Remarques À chaque étape, le modèle classe les jetons possibles du plus probable au moins probable et conserve le plus petit groupe dont la probabilité combinée atteint un seuil choisi, appelé p. Il ajuste ensuite les probabilités de ce groupe pour qu'elles totalisent 100 %, puis y choisit le jeton suivant au hasard.
Méthode d'échantillonnage qui, à chaque étape de génération, ne conserve que les k jetons les plus probables, renormalise leurs probabilités et choisit le jeton suivant au hasard dans ce groupe.
Remarques Une valeur de k plus petite restreint davantage le choix, une valeur plus grande permet plus de variété. Quand k = 1, l'échantillonnage top-k équivaut au décodage glouton. Contrairement à l'échantillonnage top-p, le top-k conserve toujours le même nombre de candidats, même quand la distribution de probabilité du modèle est inhabituellement concentrée ou plate.
Unité de base d'un document XML : une balise ouvrante, le contenu qu'elle délimite et une balise fermante, ou une seule balise d'élément vide quand il n'y a pas de contenu.
Remarques Les éléments s'imbriquent les uns dans les autres et forment l'arbre du document.
* « élément » est ma proposition : aucune banque de terminologie ne l'atteste.
émissions liées à l'entraînement*en training emissions
ContexteenvironnementIA
Émissions de gaz à effet de serre attribuables à l'entraînement d'un modèle.
Remarques Selon le périmètre d'évaluation, elles peuvent comprendre les émissions de l'électricité consommée pour le calcul et le refroidissement, du fonctionnement des centres de traitement de données et de la fabrication du matériel utilisé. L'entraînement n'est pas toujours la plus grande part des émissions sur le cycle de vie : l'inférence peut dominer pour les services très utilisés, et les émissions intrinsèques du matériel peuvent aussi être considérables. L'estimation dépend du matériel, du taux d'utilisation, du lieu, du bouquet électrique et du périmètre comptable.
autres termes français attestés: émissions liées à l'apprentissage du modèle
* « émissions liées à l'entraînement » est ma proposition : aucune banque de terminologie ne l'atteste.
émissions liées à l'inférence*en inference emissions
ContexteenvironnementIA
Émissions de gaz à effet de serre associées à l'utilisation d'un modèle d'IA entraîné pour traiter des entrées et produire des prédictions ou des sorties générées.
Remarques Leur total dépend de facteurs comme le modèle et la tâche, le matériel utilisé, l'efficacité des centres de traitement de données, la source d'électricité et le nombre d'utilisations. L'inférence répétée peut donc représenter une part importante des émissions d'un système d'IA sur son cycle de vie.
* « émissions liées à l'inférence » est ma proposition : aucune banque de terminologie ne l'atteste.
évaluation fondée sur les préférences humaines*en human preference evaluation
ContexteévaluationIA
Méthode d'évaluation de systèmes d'IA dans laquelle des personnes comparent deux sorties ou plus et indiquent celle qu'elles préfèrent, habituellement en réponse à la même requête et selon des critères énoncés.
Remarques Les jugements recueillis peuvent être agrégés pour comparer ou classer des réponses, des modèles ou des systèmes selon la qualité ou l'utilité perçues.
* « évaluation fondée sur les préférences humaines » est ma proposition : aucune banque de terminologie ne l'atteste.
E
effondrement du modèleen model collapse
Contextemodèles de languedonnées
Processus dégénératif par lequel les générations successives d'un modèle génératif deviennent moins fidèles aux données d'origine parce qu'elles sont entraînées de façon récursive sur des données produites par des modèles antérieurs.
Remarques À mesure que les erreurs s'accumulent, les régularités rares peuvent disparaître en premier, et les sorties du modèle devenir moins variées et de plus en plus déformées.
Quantité totale de gaz à effet de serre rejetés dans l'atmosphère par suite des activités humaines. Ces émissions sont surtout du dioxyde de carbone (CO₂), mais comprennent aussi le méthane (CH₄), le protoxyde d'azote (N₂O) et d'autres gaz qui contribuent aux changements climatiques. Pour faciliter la comparaison entre ces gaz, l'empreinte carbone s'exprime habituellement en équivalents de dioxyde de carbone (éq. CO₂), selon le potentiel de réchauffement de chaque gaz. La notion s'applique à différents niveaux : les personnes ont une empreinte personnelle façonnée par leurs choix quotidiens (transport, énergie domestique, alimentation, consommation) ; les produits portent une empreinte sur tout leur cycle de vie, de l'extraction des matières premières au recyclage ; les organisations génèrent des émissions par leurs activités, chaînes d'approvisionnement, bâtiments, services et produits ; même des événements précis, comme une conférence, un concert ou un vol, peuvent être évalués pour leur impact carbone (d'après l'ISO, traduction libre).
encodage par paires d'octetsen byte-pair encoding (BPE)
Contextemodèles de langueTAL
Méthode de segmentation sous-lexicale qui apprend un vocabulaire à partir d'un texte d'entraînement en fusionnant de façon répétée les caractères ou octets adjacents fréquents.
Remarques Elle applique ensuite les combinaisons apprises au nouveau texte : les mots ou séquences courants deviennent des jetons uniques, tandis que les mots plus rares ou inconnus sont représentés par plusieurs jetons plus petits.
Représentation numérique de la position de chaque jeton dans une séquence.
Remarques Dans un transformeur, l'information positionnelle est combinée aux représentations des jetons pour que le modèle tienne compte de leur ordre, même si les calculs des différentes positions peuvent être menés en parallèle. Dans l'architecture d'origine, un encodage positionnel est ajouté au plongement de chaque jeton ; d'autres architectures représentent la position absolue ou relative autrement.
Composant d'un réseau de neurones qui traite une entrée et la convertit en représentations internes utilisables par un autre composant ou par une couche de sortie propre à la tâche.
Remarques Dans un encodeur de transformeur, l'autoattention permet à la représentation de chaque jeton d'entrée d'incorporer de l'information provenant d'autres positions. Un encodeur peut faire partie d'un modèle à encodeur seul ou fournir des représentations au décodeur d'un modèle encodeur-décodeur. Dire qu'un encodeur « encode le sens » de l'entrée est commode mais excessif ; plus précisément, il calcule des représentations numériques apprises pour être utiles à l'objectif d'entraînement du modèle et aux tâches ultérieures.
Nom, écrit sous la forme d'un URI, qui indique à quel vocabulaire appartient un élément ou un attribut.
Remarques Déclaré par un attribut xmlns, il permet à un même document de mêler plusieurs vocabulaires, par exemple un format normalisé et les extensions propres à un outil, sans collision de noms.
autres termes français attestés: espace de nommage
Espace vectoriel dans lequel une méthode de plongement projette des éléments comme des mots, des phrases, des documents ou des images.
Remarques Chaque élément est représenté par un vecteur, et la géométrie de l'espace est construite ou apprise de sorte que la proximité ou d'autres relations géométriques reflètent des régularités utiles pour la tâche visée.
autres termes français attestés: espace de plongement vectoriel
Espace dans lequel un modèle représente les données au moyen de caractéristiques latentes, c'est-à-dire non observées directement, apprises à partir des données.
Remarques Chaque point ou vecteur encode des régularités sous-jacentes repérées par le modèle, souvent dans une représentation plus compacte que les données d'origine. Notion apparentée à l'espace de plongement, sans lui être identique.
Ensemble mathématique de vecteurs de même dimension sur lequel sont définies des opérations comme l'addition vectorielle et la multiplication par un scalaire.
Remarques En TAL, les vecteurs représentant des unités linguistiques peuvent être traités comme des points d'un tel espace et comparés géométriquement. L'espace vectoriel est la structure mathématique générale ; un espace de plongement est une représentation apprise particulière au sein d'une telle structure, et un espace latent est l'espace plus large des variables ou représentations cachées d'un modèle.
Processus automatisé de découverte et de récupération systématiques de pages ou d'autres ressources du Web.
Remarques Un robot d'exploration part généralement d'une ou de plusieurs adresses connues, télécharge les pages correspondantes et suit les liens qui s'y trouvent pour découvrir d'autres ressources. L'exploration sert couramment à construire les index des moteurs de recherche, à créer des archives du Web, à surveiller des sites ou à constituer des collections de contenus en ligne. Même si un robot peut examiner le contenu et les liens des pages, son but principal est de trouver et de rassembler des ressources, non d'en extraire des données particulières.
Motif décrivant un ensemble de chaînes de caractères, formé de caractères littéraux et de métacaractères à signification spéciale; sert à chercher, filtrer et transformer du texte selon sa structure plutôt que selon une formulation exacte.
autres termes français attestés: expression régulière
« Opération qui consiste à rechercher des données selon des critères précis, dans une base de données ou dans une autre source, et à les isoler afin de les retirer de l'ensemble dont elles font partie, ou encore de les copier ou de les faire migrer vers une autre base de données. » (OQLF, citation directe).
Quantité d'entrée (du texte, par exemple) qu'un système d'IA peut traiter à la fois pendant une tâche ; en quelque sorte, la mémoire à court terme du modèle. Un modèle ne peut considérer qu'une quantité limitée de texte pour générer sa prochaine réponse et, quand la conversation dépasse sa fenêtre contextuelle, il commence à « oublier » les réponses antérieures (d'après Stanford HAI, traduction libre).
Manière documentée d'organiser et de représenter des données afin qu'elles puissent être transférées entre différents systèmes ou applications. En technologies de la traduction, TMX sert principalement à échanger des données de mémoire de traduction, TBX à échanger des données terminologiques, et XLIFF à transporter du contenu localisable, ses traductions et les informations de flux de travail associées. Un format normalisé facilite l'interopérabilité, mais la réussite de l'échange peut dépendre des versions, des fonctionnalités facultatives et des métadonnées que prend en charge chaque outil.
autres termes anglais attestés: data exchange format
autres termes français attestés: format d'échange de données
formulation de requête avec quelques exemples*en few-shot prompting
Contexterequêtes
Technique de formulation de requêtes consistant à inclure dans la requête un petit nombre de démonstrations, typiquement des exemples associant une entrée à la sortie souhaitée, pour montrer à un modèle de langue comment accomplir une tâche.
Remarques Le modèle utilise ces exemples au moment de l'inférence, sans mise à jour de ses paramètres.
autres termes français attestés: requête avec quelques exemples
* « formulation de requête avec quelques exemples » est ma proposition : aucune banque de terminologie ne l'atteste.
formulation de requête sans exemple*en zero-shot prompting
Contexterequêtes
Fait de demander à un (grand) modèle de langue d'accomplir une tâche au moyen d'instructions, sans inclure d'exemples travaillés ni de démonstrations dans la requête.
autres termes français attestés: requête sans exemple
* « formulation de requête sans exemple » est ma proposition : aucune banque de terminologie ne l'atteste.
fracture numériqueen digital divide
Contexteéthique et société
Inégalités entre personnes, communautés, organisations ou régions quant à l'accès aux technologies numériques, à la capacité de les utiliser efficacement et aux bénéfices retirés de leur usage.
Remarques Dans le contexte de l'IA, la fracture numérique peut aussi comprendre l'accès inégal à des outils d'IA adaptés, aux données, aux ressources de calcul, à l'expertise technique et à des systèmes qui fonctionnent bien pour différentes langues et communautés.
Frontière inégale, et souvent difficile à percevoir, entre les tâches qu'un système d'IA accomplit bien et celles qu'il traite mal. Des tâches qui semblent de difficulté comparable aux humains peuvent se trouver de part et d'autre de cette frontière : l'aide de l'IA peut donc améliorer la performance sur une tâche tout en la dégradant sur une autre.
Remarques Tasks that appear similarly difficult to people may lie on opposite sides of this boundary, so AI assistance can improve performance on one task while harming it on another.
autres termes français attestés: frontière technologique en dents de scie
Modèle génératif à transformeur, conçu à l'origine par OpenAI pour le traitement de la langue, préentraîné sur de grandes quantités de texte à prédire des jetons successifs, puis utilisable par requête ou par entraînement supplémentaire pour un large éventail de tâches.
Remarques GPT désigne aussi la famille de modèles de ce type d'OpenAI.
Méthode de génération d'une séquence, comme un texte, un jeton à la fois.
Remarques À chaque étape, le modèle utilise les jetons générés jusque-là pour attribuer des probabilités aux jetons suivants possibles, en choisit un au moyen d'une méthode de décodage, et recommence jusqu'à un point d'arrêt. Autorégressif indique que chaque jeton généré dépend de la séquence qui précède ; cela ne signifie pas que le modèle ne considère que le jeton immédiatement précédent.
* « génération autorégressive » est ma proposition : aucune banque de terminologie ne l'atteste.
grand modèle de langue (GML)en large language model (LLM)
Contextemodèles de langueIA
Modèle de langue à réseau de neurones, habituellement fondé sur l'architecture des transformeurs, entraîné sur de très grandes quantités de texte et comptant de très nombreux paramètres appris.
Remarques La plupart des GML génératifs actuels traitent le texte sous forme de jetons et le génèrent un jeton à la fois, en attribuant de façon répétée des probabilités aux jetons suivants possibles. Intégré à une application, un GML peut servir à répondre à des questions, à résumer, à traduire ou à mener des conversations.
Dans une expression rationnelle, partie d'un motif placée entre parenthèses, pour qu'un quantificateur ou une alternative s'applique à l'ensemble plutôt qu'à un seul caractère : /(ha)+/ répète la paire, /(anti|pro)nucléaire/ place le choix à l'intérieur du mot commun.
Remarques Ce que chaque groupe a trouvé est aussi conservé, ce qui permet à un rechercher-remplacer de replacer ces morceaux dans le remplacement.
* « groupe de capture » est ma proposition : aucune banque de terminologie ne l'atteste.
H
hallucination de l'IAen hallucination
Contextemodèles de langueévaluation
Contenu généré par un modèle d'IA qui est factuellement inexact ou fabriqué, même s'il peut sembler plausible.
Remarques Par exemple, un modèle de langue peut inventer des personnes, des événements, des citations, des références ou d'autres détails qui n'existent pas.
autres termes français attestés: fabulation de l'IA
Contenu généré qui utilise ou combine l'information de la source ou du contexte fournis d'une façon qui la dénature ou la contredit.
Remarques Contrairement à l'hallucination extrinsèque, elle déforme l'information disponible dans la source plutôt que d'introduire de l'information que la source n'appuie pas.
Domination d'une langue, ou d'un petit groupe de langues, dans les institutions, la communication et la production du savoir, telle que son usage est tenu pour normal ou plus valable tandis que les autres langues reçoivent moins de reconnaissance, de ressources ou de soutien.
Remarques En IA, l'hégémonie linguistique peut se renforcer quand les données d'entraînement, les tests de performances, les ressources de développement et la performance des modèles se concentrent dans les langues dominantes, surtout l'anglais, au détriment des locuteurs et des savoirs exprimés dans les langues sous-représentées.
Réglage qui régit la conception ou le processus d'entraînement d'un modèle, mais qui n'est pas appris à partir des exemples d'entraînement de la même façon que les paramètres du modèle.
Remarques En font partie le taux d'apprentissage, la taille des lots, le nombre de couches et le degré de régularisation. La valeur des hyperparamètres est habituellement choisie en comparant la performance sur un jeu de données de validation. Un hyperparamètre n'est pas nécessairement choisi à la main : des méthodes d'optimisation automatisées peuvent en chercher les valeurs. Ce qui le distingue d'un paramètre ordinaire est la façon dont sa valeur est déterminée, et non le fait qu'une personne la saisisse directement.
Hypothèse linguistique selon laquelle les régularités d'emploi des mots renseignent sur leur sens : les mots qui apparaissent avec des voisins semblables ont vraisemblablement des sens apparentés ou proches.
Remarques De nombreuses méthodes d'apprentissage de plongements lexicaux à partir de textes reposent sur ce principe.
Systèmes d'IA capables de progresser vers un but avec un encadrement humain limité : ils décident de la prochaine action, retiennent l'information pertinente des étapes précédentes, utilisent des outils ou des logiciels externes et agissent selon les résultats, souvent avec plusieurs agents d'IA spécialisés travaillant ensemble.
autres termes français attestés: IA générative multiagent, IA agentique
Étape au cours de laquelle un modèle d'IA entraîné traite une nouvelle entrée pour produire une prédiction, une classification, une décision ou une sortie générée.
Remarques Dans un modèle de langue, l'inférence comprend le traitement de la requête et la génération d'une sortie, habituellement un jeton à la fois.
ingénierie de requêtesen prompt engineering
Contexterequêtes
Conception, mise à l'essai et perfectionnement systématiques de requêtes pour aider un système d'IA générative à produire des sorties qui répondent mieux aux exigences d'une tâche donnée.
Processus consistant à sélectionner, à créer ou à transformer l'information de données brutes en attributs qu'un modèle d'apprentissage automatique peut exploiter efficacement.
Remarques Une grande partie de ce travail se faisait traditionnellement à la main ; l'apprentissage de représentations permet aux modèles d'apprendre automatiquement de nombreux attributs utiles.
Attaque dans laquelle une entrée non fiable est incorporée à une requête et interprétée par un système d'IA générative comme des instructions, amenant le système à ignorer ou à contredire ses instructions prévues, ou à produire des sorties ou des actions non voulues.
Remarques Les instructions injectées peuvent être fournies directement par un utilisateur ou indirectement par des données que le système récupère ou traite.
autres termes français attestés: infiltration de requête
Préférences, informations contextuelles ou exigences fournies par l'utilisateur, qu'un assistant d'IA enregistre et applique automatiquement d'une conversation à l'autre, sans qu'il faille les répéter dans chaque requête.
Domaine de recherche et de pratique visant à développer des systèmes informatiques qui accomplissent des fonctions associées à l'intelligence, comme la perception, l'apprentissage, le raisonnement, l'usage de la langue et la prise de décision. Par extension, le terme désigne aussi les systèmes eux-mêmes, comme dans l'expression de plus en plus courante « une IA ». Pour ce second sens, l'OCDE définit un système d'IA comme un système automatisé qui, pour des objectifs explicites ou implicites, déduit à partir des entrées reçues comment générer des sorties telles que des prédictions, du contenu, des recommandations ou des décisions pouvant influencer des environnements physiques ou virtuels, les systèmes d'IA variant dans leur degré d'autonomie et d'adaptativité après leur déploiement (Grobelnik et coll., 2024, traduction libre).
intelligence artificielle générative (IAGén)en generative AI (GenAI)
ContexteIA
Branche de l'intelligence artificielle qui s'intéresse aux systèmes générant du contenu, comme du texte, du code, des images, de l'audio ou de la vidéo, en apprenant des régularités dans les données d'entraînement et en produisant de nouvelles sorties en réponse à une entrée ou à une requête.
interface de programmation d'application (API)en application programming interface (API)
Contexteinformatique
Interface normalisée qui permet à des applications logicielles de communiquer en envoyant des demandes et en recevant des réponses, sans avoir à connaître le fonctionnement interne de l'autre application.
Capacité de deux systèmes, applications ou outils ou plus à échanger de l'information et à exploiter ce qui est échangé.
Remarques En technologies de la traduction, l'interopérabilité permet à des ressources comme les textes bilingues, les mémoires de traduction, les fiches terminologiques et les données de projet de circuler entre outils, souvent grâce à des formats ou à des interfaces communs.
Unité de texte qu'un modèle de langue traite ou génère. Un jeton peut correspondre à un mot entier, à une partie de mot, à un signe de ponctuation ou à une séquence plus petite de caractères ou d'octets.
Remarques Chaque jeton appartient au vocabulaire du modèle et est représenté par un identifiant numérique. Les jetons ne coïncident donc pas avec les mots : un mot peut être représenté par un seul jeton ou divisé en plusieurs, et des modèles différents peuvent découper le même texte différemment.
Processus de conversion d'un texte en une séquence ordonnée de jetons qu'un modèle de langue peut traiter.
Remarques Un segmenteur applique au texte un vocabulaire et une procédure de découpage propres au modèle. Dans les modèles de langue modernes, des méthodes courantes comme l'encodage par paires d'octets apprennent des unités fréquentes à partir des données d'entraînement : des mots ou expressions courants peuvent ainsi être représentés par un seul jeton, tandis que des mots plus rares ou inconnus sont divisés en unités sous-lexicales, en caractères ou en octets. Comme les segmenteurs et leurs vocabulaires diffèrent, le même texte peut exiger un nombre de jetons différent selon les modèles ou les langues.
autres termes français attestés: segmentation en jetons textuels, conversion en jetons
Jetons générés au cours d'un processus de raisonnement intermédiaire avant que le modèle produise sa réponse finale.
Remarques Ils lui permettent d'effectuer un surcroît de calcul étape par étape au moment de l'inférence. Selon le modèle et l'interface, ces jetons peuvent être affichés comme trace de raisonnement, masqués ou représentés par un simple résumé ; ils peuvent néanmoins influer sur le temps de réponse, les limites de jetons et le coût. Le terme n'est pas complètement normalisé d'un fournisseur à l'autre. Les jetons de raisonnement ne doivent pas être interprétés littéralement comme les « pensées » d'un modèle, ni tenus pour une explication fidèle de la façon dont il est arrivé à sa réponse.
Portion d'un jeu de données servant à entraîner un modèle d'apprentissage automatique.
Remarques L'algorithme d'apprentissage traite ces données de façon répétée et ajuste les paramètres du modèle pour réduire ses erreurs ou améliorer sa performance sur l'objectif d'entraînement. En apprentissage supervisé, le jeu d'entraînement contient généralement des entrées associées aux sorties ou étiquettes attendues ; en apprentissage autosupervisé, les cibles sont dérivées automatiquement des données. Pour un modèle de langue, le jeu d'entraînement peut être un très grand corpus de texte converti en jetons, à partir duquel le modèle apprend à prédire des jetons.
autres termes français attestés: jeu d'entraînement, données d'entraînement
Portion d'un jeu de données tenue à l'écart tant de l'entraînement que de la sélection du modèle et servant à évaluer le modèle final. Son but est d'estimer la performance du modèle achevé sur de nouvelles données issues de la tâche ou de la population visée.
Remarques Un jeu de test ne doit pas chevaucher les données d'entraînement ni guider les choix d'architecture, d'hyperparamètres ou de requêtes : modifier un système à répétition en fonction des résultats de test transforme graduellement le jeu de test en jeu de validation et peut rendre la performance rapportée trop optimiste. La contamination des données d'entraînement produit le même problème si des exemples de test figurent dans les données d'entraînement du modèle. Un jeu de test n'est pas automatiquement représentatif du seul fait qu'il a été tenu à l'écart ; il doit aussi refléter les types d'entrées, de langues, de populations et de conditions dans lesquels le modèle est appelé à fonctionner.
autres termes français attestés: jeu de test, données de test
Portion d'un jeu de données tenue à l'écart des données servant à ajuster les paramètres d'un modèle et utilisée pendant le développement pour guider les choix concernant le modèle.
Remarques Les résultats de validation servent à comparer des versions du modèle, à choisir les hyperparamètres, à fixer des seuils de décision ou à décider quand arrêter l'entraînement. Même si le modèle n'apprend pas ordinairement ses paramètres directement des exemples de validation, des décisions répétées fondées sur la performance de validation adaptent indirectement le système final à ce jeu de données ; les résultats de validation ne doivent donc pas être présentés comme une estimation pleinement indépendante de la performance finale. La terminologie varie selon les disciplines, certaines publications appelant « jeu de test » des données qui servent en réalité à la validation ; ce glossaire maintient la distinction stricte entre les trois jeux.
autres termes anglais attestés: development set, dev set
autres termes français attestés: jeu de validation, données de validation, jeu de développement
Convention qui annote un texte avec des balises décrivant sa structure ou sa présentation, en gardant ces annotations distinctes du contenu lui-même ; HTML et XML en sont les exemples les plus connus.
langage de balisage extensible (XML)en eXtensible Markup Language (XML)
ContexteXMLbalisage
Langage de balisage et norme du W3C pour représenter des données structurées en texte brut : des éléments délimités par des balises, dotés d'attributs et imbriqués en hiérarchie.
Remarques Les formats d'échange TMX, TBX et XLIFF reposent tous sur XML.
langage HTML (HTML)en HyperText Markup Language (HTML)
ContextebalisageWeb
Langage de balisage des pages web : un vocabulaire d'éléments fixé par une norme, qui marque les titres, les paragraphes, les liens, les images et le reste, et qu'un navigateur affiche.
Remarques Ses noms d'éléments viennent de la norme, alors qu'un format XML définit les siens.
autres termes français attestés: langage de balisage hypertexte
Délai entre une entrée et la réponse du système; en reconnaissance de la parole en direct et en interprétation, temps qui s'écoule entre les mots prononcés et l'affichage de leur transcription ou de leur traduction.
autres termes français attestés: temps de latence
lemmeen lemma
Contextelinguistiquecorpus
Forme de base, ou forme de dictionnaire, sous laquelle sont regroupées les formes fléchies d'un mot : va, allons, allait et allé partagent le lemme aller.
Remarques Les outils de corpus utilisent la lemmatisation pour compter ou chercher toutes les formes d'un mot à la fois ; une liste de fréquences de lemmes répond à une autre question qu'une liste de fréquences de formes.
Position de largeur nulle entre un caractère de mot et un caractère qui n'en est pas un, notée \b dans une expression rationnelle; définie à partir de l'ensemble ASCII \w, si bien que les lettres accentuées ne comptent pas comme caractères de mot.
Étude interdisciplinaire du langage humain dans une perspective computationnelle, y compris l'élaboration de modèles computationnels des phénomènes linguistiques.
Remarques Les termes linguistique informatique et traitement automatique de la langue s'emploient de façon plus ou moins interchangeable.
Contextemodèles de langueapprentissage automatique
Relations mathématiques observées empiriquement qui décrivent comment la performance mesurée d'un modèle, ou son erreur, tend à évoluer quand augmentent des facteurs comme le nombre de paramètres, la quantité de données d'entraînement et les ressources de calcul consacrées à l'entraînement.
Remarques Ces relations aident les chercheurs à estimer les effets d'un passage à l'échelle et à répartir un budget d'entraînement fixe entre la taille du modèle et les données.
Règle ou structure numérique qui empêche une couche d'attention d'accorder de l'attention à certaines positions de jetons.
Remarques Par exemple, un masque d'attention causal bloque l'accès aux positions ultérieures pendant la prédiction du jeton suivant, tandis qu'un masque de remplissage empêche le modèle de prêter attention aux jetons de remplissage ajoutés pour égaliser la longueur des séquences. Le masque d'attention régit la circulation de l'information dans un calcul d'attention ; il diffère du masquage utilisé en modélisation du langage masqué, où des jetons d'entrée sont cachés ou modifiés pour créer une tâche de prédiction.
Méthode utilisée dans les réseaux de neurones pour aider un modèle à se concentrer sur les parties les plus pertinentes de l'entrée au moment de produire une sortie. Par exemple, lors de la traduction d'une phrase, le modèle « prête attention » aux mots qui comptent le plus pour le prochain mot traduit, ce qui améliore la précision et le traitement des longues séquences (d'après Stanford HAI, traduction libre).
médiocre en entrée, médiocre en sortie (GIGO)en garbage in, garbage out (GIGO)
Contexteinformatiquedonnées
Principe selon lequel la qualité et la fiabilité des sorties d'un système informatique dépendent largement de la qualité et de la pertinence de ses entrées.
Remarques En IA, des données inexactes, incomplètes, biaisées, périmées, non pertinentes ou non représentatives peuvent mener à des résultats peu fiables ou trompeurs.
mémoire de traduction (MT)en translation memory (TM)
ContexteTAOtraduction
Base de données bilingue de segments source déjà traduits et de leurs segments cibles correspondants, dans laquelle un système de mémoire de traduction cherche des correspondances exactes ou similaires pour un nouveau texte source.
Capacité d'un assistant d'IA à retenir de l'information d'interactions antérieures et à en récupérer les éléments pertinents dans des conversations ultérieures, ce qui lui permet d'assurer une continuité et de personnaliser ses réponses d'une session à l'autre.
Remarques La mémoire persistante repose habituellement sur le stockage et la récupération d'informations à l'extérieur du modèle de langue ; elle ne modifie pas ordinairement les paramètres entraînés du modèle, et persistante ne signifie pas nécessairement permanente.
* « mémoire persistante » est ma proposition : aucune banque de terminologie ne l'atteste.
métacaractèreen metacharacter
Contexteexpressions rationnelles
Caractère qui, dans une expression rationnelle, a une signification spéciale (comme ., *, [ ou ^) au lieu de se représenter lui-même ; une barre oblique inversée le ramène à sa valeur littérale.
Conscience et surveillance de ses propres processus cognitifs, souvent accompagnées de tentatives pour les réguler.
Remarques Elle comprend le jugement sur ce que l'on sait, l'évaluation de sa confiance, le repérage d'erreurs possibles et le changement de stratégie au besoin. En recherche sur l'IA, le terme s'emploie parfois par analogie pour des mécanismes ou des comportements par lesquels un système surveille ou régule des aspects de son propre traitement, comme estimer l'incertitude, vérifier une réponse ou changer de stratégie ; un tel comportement ne démontre pas en soi une conscience ni une connaissance de soi comparables à celles des humains.
métadonnéeen metadata
Contextedonnées
Information structurée qui décrit, identifie ou contextualise d'autres données. Dans un document balisé ou un format de traduction, les métadonnées peuvent indiquer la langue, l'auteur, la date de création, le type de fichier, l'identifiant d'un segment, son état de traduction, le domaine ou la provenance du contenu. Elles peuvent être stockées dans des éléments ou dans des attributs. On les distingue généralement du contenu principal à traduire, même si certaines de leurs valeurs peuvent elles-mêmes devoir être localisées.
Architecture de modèle de langue à transformeur qui enchaîne des blocs décodeurs sans encodeur distinct.
Remarques À chaque position, le masquage causal permet au modèle d'utiliser les positions antérieures de la séquence, mais l'empêche d'utiliser les positions ultérieures. Pendant la génération, le modèle utilise la requête et les jetons déjà générés pour prédire une distribution de probabilité du jeton suivant, choisit un jeton par une méthode de décodage, l'ajoute à la séquence et recommence. Cette architecture est largement utilisée pour les modèles de langue génératifs généralistes. « Antérieur » renvoie aux positions antérieures dans la séquence modélisée, pas nécessairement aux mots affichés à gauche, et le masquage causal n'oblige pas à traiter la requête un jeton à la fois : les représentations de ses jetons peuvent être calculées en parallèle tout en respectant la restriction d'accès aux positions ultérieures. Contrairement au décodeur d'un modèle encodeur-décodeur, un modèle à décodeur seul n'a normalement pas de couche d'attention croisée lisant la sortie d'un encodeur distinct.
* « modèle à décodeur seul » est ma proposition : aucune banque de terminologie ne l'atteste.
modèle à encodeur seul*en encoder-only model
Contextemodèles de langueapprentissage profond
Architecture de réseau de neurones qui traite une séquence d'entrée et produit une représentation contextuelle de chaque jeton, sans décodeur distinct pour générer une séquence de sortie.
Remarques Dans la forme bidirectionnelle courante du transformeur, chaque jeton peut être représenté à partir d'informations situées avant et après lui dans l'entrée. Les modèles à encodeur seul sont donc particulièrement utiles pour analyser ou représenter du texte, par exemple en classification, en extraction d'information, en similarité sémantique et en recherche ; BERT en est un exemple connu. Ces modèles ne sont généralement pas conçus pour générer un long texte un jeton à la fois, même si des composants à encodeur peuvent être intégrés à des systèmes génératifs.
* « modèle à encodeur seul » est ma proposition : aucune banque de terminologie ne l'atteste.
modèle à poids ouvertsen open-weight model
ContexteIA
Modèle d'IA dont les paramètres entraînés, appelés poids, sont offerts au téléchargement.
Remarques Les utilisateurs disposant des logiciels et des ressources de calcul voulus peuvent généralement exécuter le modèle sur leurs propres systèmes, et parfois l'inspecter, le modifier ou l'affiner ; les usages permis dépendent des conditions de diffusion des poids. La disponibilité des poids ne signifie pas nécessairement que les données d'entraînement, les méthodes de traitement des données, le code d'entraînement ou le processus complet de développement ont aussi été divulgués, et un modèle à poids ouverts peut être assorti de restrictions de licence sur l'usage commercial, la redistribution ou certaines applications. Un modèle à poids ouverts n'est pas automatiquement une IA à code source ouvert : selon l'Open Source AI Definition 1.0, celle-ci doit en plus garantir les libertés d'utiliser, d'étudier, de modifier et de partager le système, avec le code, les paramètres et une information suffisamment détaillée sur les données et le processus d'entraînement. Le qualificatif « à code source ouvert » ne doit donc pas s'employer du seul fait que les poids sont téléchargeables ; inversement, poids ouverts ne signifie pas nécessairement sans restriction, gratuit ni pleinement reproductible.
modèle de baseen base model
Contextemodèles de langue
Modèle de langue qui a terminé son préentraînement mais n'a pas encore reçu de postentraînement.
Remarques Il peut générer du texte en prédisant des jetons successifs, mais n'a pas reçu d'entraînement supplémentaire visant à améliorer le suivi d'instructions, l'alignement sur les préférences humaines ou le raisonnement complexe.
Modèle préentraîné servant de point de départ à de multiples applications en aval. Le terme met l'accent sur l'approche « entraîner une fois, adapter plusieurs fois » du développement de l'IA.
Remarques The term emphasizes the "train once, adapt many times" approach to AI development.
Modèle d'apprentissage automatique qui estime la probabilité de différentes séquences de langue.
Remarques À partir d'une séquence de jetons donnée en contexte, il attribue des probabilités aux jetons qui pourraient suivre. Ces probabilités servent à prédire ou à générer du texte et à comparer la vraisemblance de séquences complètes.
autres termes français attestés: modèle de langage
modèle de langue bidirectionnel*en bidirectional language model
Contextemodèles de langue
Modèle de langue qui peut utiliser le contexte des positions situées avant et après une position donnée pour calculer sa représentation ou sa prédiction.
Remarques Dans un encodeur de transformeur bidirectionnel, l'autoattention peut puiser dans toute la séquence d'entrée disponible. Cela est utile pour représenter et analyser du texte existant, comme dans BERT et d'autres modèles de langue masqués. Bidirectionnel ne signifie pas nécessairement que le texte est traité en deux passes distinctes ; dans un encodeur de transformeur, cela signifie que la représentation d'un jeton peut incorporer de l'information des deux côtés. Un modèle de langue bidirectionnel n'est pas nécessairement un modèle de langue masqué, même si la modélisation du langage masqué est une façon courante d'en entraîner un.
autres termes anglais attestés: bidirectional model
autres termes français attestés: modèle de langage bidirectionnel, modèle bidirectionnel
* « modèle de langue bidirectionnel » est ma proposition : aucune banque de terminologie ne l'atteste.
modèle de langue causal*en causal language model
Contextemodèles de langue
Modèle de langue qui prédit chaque jeton en n'utilisant que les positions qui le précèdent dans la séquence ; il ne peut pas utiliser les jetons ultérieurs pour cette prédiction.
Remarques Cette restriction rend le modèle apte à la génération autorégressive, où il génère un jeton, l'ajoute au contexte disponible, puis prédit le suivant. En modélisation de la langue, causal renvoie à la restriction d'accès aux positions ultérieures ; cela ne signifie pas que le modèle découvre des relations de cause à effet. « Modèle de langue causal » et « modèle de langue autorégressif » s'emploient souvent indifféremment : plus précisément, causal décrit la circulation d'information permise, autorégressif le processus de factorisation ou de génération.
autres termes français attestés: modèle de langage causal
* « modèle de langue causal » est ma proposition : aucune banque de terminologie ne l'atteste.
modèle de langue masquéen masked language model (MLM)
Contextemodèles de langue
Modèle de langue généralement construit avec un encodeur de transformeur bidirectionnel et préentraîné à reconstruire des jetons choisis qui ont été cachés ou modifiés dans un texte.
Remarques Pour prédire un jeton d'origine, le modèle peut utiliser le contexte visible avant et après sa position. Cet entraînement autosupervisé lui permet d'apprendre des représentations contextuelles de mots et de passages sans que chaque exemple soit étiqueté par des humains ; le modèle préentraîné peut ensuite être adapté à des tâches comme la classification de textes, l'extraction d'information, la similarité sémantique et la réponse aux questions. BERT et RoBERTa sont des modèles de langue masqués bien connus. Les jetons choisis ne sont pas tous remplacés par un jeton [MASK] visible : dans la procédure originale de BERT, certains sont remplacés par [MASK], d'autres par un jeton aléatoire, d'autres laissés tels quels, le modèle apprenant dans les trois cas à prédire l'original. Un modèle de langue masqué n'est pas synonyme de modèle à encodeur seul, et ces modèles servent généralement à produire des représentations contextuelles plutôt qu'à générer de longs passages de façon autorégressive, même s'ils peuvent remplir les positions masquées et que des méthodes génératives récentes s'appuient sur le masquage.
autres termes français attestés: modèle de langage masqué
Modèle de langue conçu pour améliorer sa performance sur des problèmes complexes en plusieurs étapes en recourant à un surcroît de calcul pendant l'inférence.
Remarques Ces modèles sont souvent postentraînés sur des tâches dont les réponses se vérifient automatiquement et peuvent générer des étapes intermédiaires avant leur réponse finale. Dans ce terme, raisonnement est une étiquette opérationnelle pour l'entraînement du modèle, son processus d'inférence et sa performance en résolution de problèmes : il n'établit pas que le modèle raisonne comme une personne, et une justification générée ne rend pas nécessairement compte fidèlement de la façon dont la réponse a été produite.
autres termes français attestés: modèle génératif de résolution de problèmes
Contextemodèles de langueapprentissage automatique
Modèle entraîné à attribuer une note numérique à une sortie candidate selon des critères d'évaluation appris.
Remarques Dans l'alignement des modèles de langue, les modèles de récompense sont couramment entraînés sur des réponses classées selon des préférences humaines. Leurs notes peuvent ensuite guider l'apprentissage par renforcement ou aider à choisir parmi plusieurs réponses candidates.
Architecture de réseau de neurones composée de deux parties reliées.
Remarques L'encodeur traite une séquence d'entrée et en produit des représentations contextuelles ; le décodeur utilise ces représentations, avec les jetons de sortie déjà produits, pour générer une séquence de sortie, un jeton à la fois dans la forme autorégressive courante. Comme l'entrée et la sortie peuvent différer en longueur, en ordre, en vocabulaire ou même en modalité, ces modèles conviennent aux tâches qui transforment une séquence en une autre, dont la traduction automatique, le résumé et la reconnaissance de la parole. Dans un modèle encodeur-décodeur à transformeur, l'encodeur applique normalement l'attention à toute la séquence d'entrée, tandis que le décodeur applique une autoattention causale à la sortie déjà générée et une attention croisée pour puiser l'information pertinente dans les représentations de l'encodeur. Des architectures encodeur-décodeur existaient avant le transformeur et peuvent aussi utiliser des réseaux récurrents ou convolutifs ; l'encodeur ne compresse pas nécessairement toute l'entrée en un seul vecteur fixe, et des variantes non autorégressives existent.
Modèle d'IA qui traite et met en relation l'information de deux modalités de données ou plus, comme le texte, les images, l'audio, la vidéo ou les données de capteurs.
Remarques Selon sa conception, il peut accepter plusieurs modalités en entrée, produire des sorties dans une ou plusieurs modalités, ou les deux.
modèle séquence à séquenceen sequence-to-sequence model
Contexteapprentissage profondmodèles de langue
Modèle qui projette une séquence d'entrée sur une séquence de sortie, dont la longueur ou la structure peut différer.
Remarques La plupart des modèles séquence à séquence actuels utilisent une architecture encodeur-décodeur. « Modèle séquence à séquence » décrit la relation entrée-sortie, « modèle encodeur-décodeur » l'architecture ; les deux s'emploient presque indifféremment, sans être strictement identiques.
modélisation du langage masquéen masked language modeling
Contextemodèles de langue
Objectif d'entraînement autosupervisé dans lequel des jetons choisis d'un texte sont cachés ou modifiés et où un modèle apprend à reconstruire les jetons d'origine à partir du contexte restant.
Remarques Dans la forme bidirectionnelle habituelle, la prédiction peut s'appuyer sur les jetons visibles situés avant et après chaque position choisie.
Processus par lequel un service en ligne examine le contenu et intervient pour faire respecter des exigences légales ou les règles de la plateforme.
Remarques Les interventions peuvent comprendre l'étiquetage du contenu, la réduction de sa visibilité, la restriction de son accès ou son retrait, et peuvent être effectuées par des réviseurs humains, des systèmes automatisés ou les deux.
Processus automatisé de récupération de contenu en ligne et d'extraction d'informations choisies, afin de les stocker, de les analyser ou de les réutiliser dans un autre contexte.
Remarques Un moissonneur peut recueillir du texte, des prix, des tableaux, des liens, des images ou des métadonnées, souvent en s'appuyant sur la structure de la page pour repérer l'information voulue. Le moissonnage peut viser un ensemble de pages connues ou se combiner à l'exploration du Web pour en découvrir d'autres ; son but principal est l'extraction de données, non la découverte de pages.
Se dit d'un mot absent du vocabulaire utilisé par un système de traitement de la langue donné.
Remarques Dans les systèmes à vocabulaire fixe au niveau des mots, un tel mot ne peut pas être représenté directement et est souvent remplacé par un symbole spécial de mot inconnu comme <UNK>. Les segmenteurs modernes, sous-lexicaux ou au niveau des octets, peuvent généralement représenter un mot inconnu comme une séquence de jetons connus plus petits : un mot peut donc être hors vocabulaire dans son ensemble sans être intraitable.
Suite de n éléments consécutifs d'un texte, généralement des mots : bigrammes (n = 2), trigrammes (n = 3), etc. En analyse de corpus, les n-grammes fréquents révèlent les expressions récurrentes et la phraséologie.
Remarques En modélisation de la langue, les modèles de n-grammes constituaient l'approche statistique standard avant les réseaux de neurones : ils estiment la probabilité de chaque mot à partir des n − 1 mots qui le précèdent.
Apparition individuelle d'un mot ou d'un autre élément dénombrable dans un texte.
Remarques Selon les conventions adoptées, les occurrences peuvent inclure les mots, les nombres, les signes de ponctuation et d'autres symboles, chaque apparition étant comptée séparément même quand la même forme revient plusieurs fois. Par exemple, cats chase cats contient trois occurrences de mots mais seulement deux types : cats et chase. L'occurrence est donc une apparition particulière dans un texte, tandis que le type est une forme distincte réalisée par une ou plusieurs occurrences.
autres termes anglais attestés: word token, instance
Structure de marché dans laquelle un petit nombre d'entreprises assure la majeure partie de l'offre d'un produit ou d'un service.
Remarques Comme les décisions de chacune peuvent toucher sensiblement les autres, les entreprises d'un oligopole tendent à décider en tenant compte des réactions probables de leurs concurrentes. À propos de l'IA, il faut préciser le marché visé : des conditions oligopolistiques peuvent exister sur des marchés comme les puces d'IA avancées, l'infonuagique ou le développement de modèles de fondation, mais il est généralement trop large de décrire tout le secteur de l'IA comme un seul oligopole.
optimisation automatique de requêtes*en automatic prompt optimization
Contexterequêtes
Utilisation d'un algorithme pour générer, évaluer et réviser itérativement des requêtes candidates afin d'améliorer la performance d'un modèle sur une tâche ou une mesure d'évaluation donnée.
* « optimisation automatique de requêtes » est ma proposition : aucune banque de terminologie ne l'atteste.
optimisation directe des préférences (DPO)en direct preference optimization (DPO)
Contextemodèles de langueapprentissage automatique
Méthode d'alignement sur les préférences qui entraîne un modèle de langue directement à partir de paires de réponses préférées et rejetées.
Remarques L'entraînement augmente la probabilité relative des réponses préférées tout en limitant l'écart entre le modèle obtenu et un modèle de référence. Contrairement aux méthodes ARRH courantes, la DPO n'exige ni modèle de récompense entraîné séparément, ni étape d'apprentissage par renforcement échantillonnant sans cesse le modèle en cours de mise à jour. La DPO élimine le modèle de récompense explicite, pas les hypothèses de la modélisation des préférences : ses résultats dépendent toujours de la qualité, de la couverture et des valeurs des données de préférence.
Valeur numérique apprise pendant l'entraînement d'un modèle et utilisée dans ses calculs.
Remarques Dans un réseau de neurones, les paramètres sont principalement des poids et des biais. Leur nombre total sert couramment de mesure de la taille d'un modèle.
Représentation numérique générée pour une occurrence particulière d'un jeton en tenant compte des autres jetons accessibles au modèle.
Remarques La représentation peut donc changer selon le contexte du jeton : bank peut recevoir des représentations différentes dans river bank et bank account. Dans un transformeur, chaque couche combine progressivement l'information des positions de jetons pertinentes, produisant des représentations de plus en plus contextualisées. Selon le modèle, le contexte accessible peut comprendre le texte qui précède, le texte qui suit, ou les deux. Contrairement à un plongement statique, un plongement contextuel est calculé pour une occurrence particulière plutôt que récupéré comme représentation permanente dans un vocabulaire. Les plongements contextuels peuvent encoder de l'information liée au sens d'un jeton, à son rôle grammatical et à ses relations avec d'autres parties du texte ; des couches différentes d'un modèle peuvent capter des informations différentes, de sorte qu'un plongement contextuel ne doit pas être compris comme une représentation complète ou directement interprétable du sens.
autres termes anglais attestés: contextualized word representation
Représentation numérique apprise d'un mot sous la forme d'un vecteur dense et court, c'est-à-dire une liste de nombres.
Remarques Les nombres sont appris à partir de régularités dans des données langagières plutôt qu'attribués à la main, et leur signification individuelle n'est généralement pas interprétable. Les mots qui apparaissent dans des contextes linguistiques semblables reçoivent en général des vecteurs semblables, ce qui permet de comparer les mots mathématiquement et de reconnaître des relations de sens ou d'usage grammatical. Les plongements lexicaux peuvent ainsi servir d'entrées à des tâches comme la classification de textes, la traduction et la génération de langue. Dans les méthodes statiques traditionnelles comme word2vec et GloVe, chaque type de mot possède un unique vecteur fixe, si bien que les différents sens d'un mot polysémique partagent la même représentation. Les modèles de langue modernes créent plutôt des plongements contextuels pour chaque occurrence de jeton, de sorte que la représentation peut varier selon le texte environnant.
autres termes français attestés: vecteur-mot, plongement de mots
plongement lexical statiqueen static word embedding
ContexteplongementsTAL
Représentation numérique qui attribue à chaque type de mot, c'est-à-dire à chaque mot distinct d'un vocabulaire, un unique vecteur fixe appris à partir des régularités d'un corpus.
Remarques Les mots qui apparaissent dans des contextes linguistiques semblables reçoivent en général des vecteurs semblables. Une fois appris, le vecteur d'un mot reste le même partout où ce mot apparaît : bank reçoit la même représentation dans river bank et bank account. Les plongements lexicaux statiques sont efficaces et peuvent capter de grandes relations sémantiques et grammaticales, mais ils ne peuvent pas distinguer directement les différents sens d'un mot polysémique. Word2vec et GloVe sont des méthodes bien connues pour les créer.
autres termes français attestés: plongement statique
pollution informationnelleen information pollution
Contexteéthique et sociétéIA
Dégradation d'un environnement informationnel par l'accumulation et la circulation de contenus faux, trompeurs, non pertinents, redondants, non sollicités ou autrement de faible valeur.
Remarques La pollution informationnelle rend l'information fiable et utile plus difficile à trouver ou à évaluer. L'IA générative peut l'intensifier en permettant de produire et de diffuser de tels contenus à grande échelle.
Propriété d'un mot ou d'un lemme qui possède deux sens apparentés ou plus.
Remarques Le sens visé se détermine ordinairement d'après le contexte où le mot apparaît. Par exemple, mouse peut désigner un animal ou, par un sens métaphorique apparenté, un périphérique d'ordinateur.
postéditionen post-editing
Contextetraduction automatiquetraduction
Correction humaine de la sortie brute d'une traduction automatique ; l'équivalent, pour la traduction automatique, de l'étape de révision en traduction humaine.
Entraînement supplémentaire appliqué à un modèle préentraîné pour adapter ses capacités ou son comportement aux usages visés.
Remarques Pour les modèles de langue modernes, il peut comprendre l'affinage par instructions, l'alignement sur les préférences et l'apprentissage par renforcement avec récompenses vérifiables. Ces étapes peuvent rendre un modèle de base plus apte à suivre des instructions, à produire des réponses préférées ou à résoudre certains types de problèmes. Postentraînement est un terme générique, et les organisations n'utilisent pas nécessairement les mêmes étapes ni le même ordre. L'apprentissage en contexte et la requête ordinaire ne relèvent pas du postentraînement, car ils ne modifient pas les paramètres du modèle. Dans certains contextes techniques, le terme s'emploie plus largement pour des traitements postérieurs à l'entraînement, comme la quantification ; la présente entrée vise le postentraînement comme étape du développement des modèles de langue.
prédiction du jeton suivant*en next-token prediction
Contextemodèles de langue
Tâche consistant à estimer les probabilités des jetons qui pourraient suivre une séquence de jetons donnée.
Remarques C'est un objectif d'entraînement courant des modèles de langue autorégressifs. Pendant la génération de texte, le modèle produit cette distribution de probabilité de façon répétée, une méthode de décodage choisit un jeton, et le jeton choisi s'ajoute au contexte pour la prédiction suivante.
autres termes anglais attestés: next-word prediction
Contextemodèles de langueapprentissage automatique
Étape initiale au cours de laquelle un modèle apprend des régularités générales et des représentations réutilisables à partir d'un grand jeu de données, souvent par apprentissage autosupervisé, avant toute adaptation ultérieure à des tâches ou à des usages particuliers.
Remarques Pour les modèles de langue autorégressifs, le préentraînement consiste typiquement à apprendre à prédire le jeton suivant à partir de son contexte.
Règle qui fixe l'ordre d'application des opérateurs d'une expression. Dans une expression rationnelle, cet ordre va des quantificateurs, qui portent sur le seul élément qui les précède, aux éléments écrits les uns à la suite des autres, puis à la barre verticale, dont la priorité est la plus faible et qui sépare donc tout ce qui est à sa gauche de tout ce qui est à sa droite. Les parenthèses s'appliquent avant tout cela, et c'est pourquoi /^(chat|chien)$/ et /^chat|chien$/ ne veulent pas dire la même chose.
autres termes anglais attestés: precedence
autres termes français attestés: préséance des opérateurs, priorité
Opérateur d'expression rationnelle indiquant combien de fois l'élément précédent peut se répéter ({n}, {n,m}, *, +, ?); gourmand par défaut (il capture le plus possible), il devient non gourmand avec un ? supplémentaire.
Processus consistant à utiliser l'information disponible pour tirer des conclusions ou progresser vers la solution d'un problème.
Remarques En IA, le raisonnement peut faire appel à des règles formelles, à l'inférence probabiliste, à des régularités ou représentations apprises, ou à une combinaison de ces méthodes. À propos des modèles de langue, le terme s'emploie souvent de façon opérationnelle pour décrire la performance sur des tâches exigeant plusieurs étapes reliées ; des réponses réussies ou des justifications générées ne démontrent pas nécessairement un raisonnement de type humain et ne révèlent pas les calculs internes réels du modèle.
* « raisonnement » est ma proposition : aucune banque de terminologie ne l'atteste.
réalité de terrainen ground truth
Contexteévaluationdonnées
Valeurs, étiquettes ou observations tenues pour la description correcte des cas d'un jeu de données.
Remarques Elles servent de cibles pendant l'entraînement ou de références pour évaluer les prédictions d'un modèle, et peuvent provenir de mesures directes, de dossiers vérifiés, de jugements d'experts, d'annotations humaines ou d'un processus d'arbitrage. Le mot « réalité » peut induire en erreur : ces données ne sont pas nécessairement infaillibles, les mesures pouvant être inexactes, les annotateurs pouvant se tromper et certaines tâches admettant plus d'une interprétation raisonnable. Dans les tâches subjectives, réduire plusieurs jugements à une seule étiquette de référence peut masquer des désaccords significatifs. « Réalité de terrain » et « référence » s'emploient souvent indifféremment ; une distinction éditoriale utile réserve la première aux valeurs de référence acceptées et la seconde au jeu de données, au processus d'annotation ou à la méthode de mesure faisant autorité.
Méthode de décodage qui conserve, à chaque étape de génération, un nombre fixe de séquences partielles prometteuses.
Remarques Elle prolonge ces candidates avec les jetons suivants possibles, note les séquences obtenues et ne retient que les mieux notées pour l'étape suivante, ce qui permet au décodeur de considérer plusieurs solutions au lieu de s'engager immédiatement sur un jeton. Le nombre de candidates conservées s'appelle la largeur du faisceau. La recherche en faisceau est une heuristique : rien ne garantit qu'elle trouve la meilleure séquence globale une fois écartés les chemins moins bien notés. Elle est particulièrement courante dans les tâches de génération contrainte comme la traduction automatique et la reconnaissance de la parole, l'échantillonnage étant généralement plus courant pour la génération conversationnelle ouverte.
autres termes français attestés: algorithme de recherche en faisceau
reconnaissance automatique de la parole (RAP)en automatic speech recognition (ASR)
Contexteparole
Technologie qui analyse la voix humaine captée au moyen d'un microphone pour la transcrire sous la forme d'un texte exploitable par une machine; aussi appelée transcription de la parole en texte (angl. speech-to-text, STT).
référence*en gold standard
Contexteévaluationdonnées
Meilleur jeu de données, annotation, mesure ou procédure de référence disponible pour évaluer les résultats d'un système.
Remarques En traitement automatique de la langue, il s'agit couramment d'un ensemble d'étiquettes produites ou arbitrées par des humains, tenues pour les sorties attendues d'une tâche. Qualifier une ressource de référence ne signifie pas qu'elle soit parfaitement correcte : ses annotations peuvent contenir des erreurs ou des biais, et une réponse arbitrée unique peut masquer des divergences légitimes entre annotateurs, surtout quand les jugements linguistiques ou sociaux sont ambigus.
* « référence » est ma proposition : aucune banque de terminologie ne l'atteste.
renseignements personnelsen personally identifiable information (PII)
Contextedonnéeséthique et société
Information qui permet d'identifier, de distinguer ou de retracer une personne, seule ou combinée à d'autres informations pouvant lui être reliées.
Remarques Elle comprend des identifiants directs, comme un numéro de passeport ou des données biométriques, ainsi que des informations qui peuvent devenir identifiantes en combinaison, comme une date de naissance, des lieux ou des caractéristiques démographiques.
Représentation dans laquelle un élément ou un concept est encodé par un motif de valeurs réparti sur plusieurs unités ou dimensions, chaque unité ou dimension contribuant à la représentation de plusieurs éléments.
Remarques Contrairement à une représentation locale, aucune unité ne représente à elle seule l'élément ou le concept entier. En TAL, les plongements utilisent typiquement des représentations réparties : l'information sur un mot ou un jeton est répartie sur de nombreuses dimensions du vecteur plutôt que stockée dans une seule dimension identifiable.
Entrée fournie à un système d'IA générative pour préciser une tâche, donner du contexte ou orienter la sortie.
Remarques Pour un modèle de langue, une requête peut contenir des instructions, des questions, des exemples, des données ou un texte à poursuivre. La requête devient une partie du contexte sur lequel le modèle conditionne la suite de sa génération de jetons.
Instruction fournie à un modèle de langue avant l'entrée de l'utilisateur, ou en parallèle, qui établit le rôle du modèle, sa tâche, ses règles de conduite, son ton ou d'autres éléments de contexte pour l'interaction.
Remarques Les applications l'insèrent couramment de façon automatique au début du contexte effectif du modèle. Une requête système est souvent, mais pas toujours, masquée ; sa priorité et sa persistance dépendent de l'application et de l'interface du modèle, et elle ne constitue pas une frontière de sécurité absolue.
Modèle d'apprentissage automatique composé de couches interconnectées de petites unités de calcul.
Remarques Chaque unité combine des valeurs d'entrée au moyen de poids numériques ajustables et transmet le résultat à d'autres unités. Pendant l'entraînement, le réseau ajuste ses poids pour améliorer sa performance sur une tâche. Le nom rappelle l'inspiration historique des neurones biologiques ; les réseaux de neurones modernes sont des systèmes de calcul mathématiques, et non des modèles réalistes du fonctionnement du cerveau humain.
autres termes français attestés: réseau de neurones artificiels
retour à la ligne automatiqueen word wrap
Contexteencodage du texteinformatique
Retour à la ligne ajouté par le logiciel et non tapé par l'utilisateur : quand une ligne atteint le bord de la fenêtre, ce qui ne tient pas passe à la rangée suivante de l'affichage. Rien n'est ajouté au texte lui-même, si bien que le même texte se coupe à d'autres endroits dans une fenêtre d'une autre largeur, dans un autre logiciel ou avec une autre police. Un saut de ligne tapé dans le texte, lui, est un caractère, et il ne bouge pas.
autres termes anglais attestés: word wrapping, wraparound, soft return
autres termes français attestés: retour automatique à la ligne, bouclage, renvoi à la ligne
Caractère qui termine une ligne dans un fichier, enregistré comme n'importe quel autre et invisible à l'écran. C'est lui qui découpe le fichier en lignes, si bien que leur nombre est fixe : deux sauts de ligne font trois lignes, quelle que soit la largeur de la fenêtre. Windows l'écrit au moyen de deux caractères, un retour chariot suivi d'un saut de ligne (CR LF), là où macOS et Linux n'en emploient qu'un (LF).
autres termes anglais attestés: hard return, newline
autres termes français attestés: retour à la ligne forcé, retour forcé, présentation de ligne
Portion de contenu à traduire qu'un outil de TAO traite comme une unité distincte aux fins de traduction, d'alignement, de stockage et de recherche de correspondances.
Remarques Le segment correspond souvent à une phrase, mais il peut aussi s'agir d'un titre, d'un élément de menu, d'un paragraphe ou d'une partie de phrase, selon la structure du document et les règles de segmentation employées.
Opération qui consiste à diviser le contenu à traduire en segments, qui correspondent plus ou moins aux phrases, aux titres et aux autres éléments textuels séparés.
Remarques Un outil de TAO peut se fonder sur la structure du document ainsi que sur des règles propres à chaque langue, et sur leurs exceptions, pour détecter les limites de phrases : il doit par exemple distinguer un point qui termine une phrase d'un point d'abréviation. La segmentation influe sur ce qui est enregistré dans la mémoire de traduction et sur les correspondances que l'outil pourra retrouver par la suite. Le format SRX est conçu pour échanger des règles de segmentation entre outils.
segmentation au niveau sous-lexicalen subword tokenization
Contextemodèles de langueTAL
Méthode de découpage du texte, apprise des données, en jetons souvent plus petits que les mots, comme des parties de mots fréquentes, des caractères ou des séquences d'octets.
Remarques Elle permet de représenter un mot inconnu comme une séquence d'unités connues plutôt que comme un seul jeton inconnu.
Processus de découpage d'un texte suivi en unités individuelles pouvant être comptées, annotées ou analysées.
Remarques Ces unités sont le plus souvent des mots et des signes de ponctuation, mais leurs frontières dépendent de la langue, du but de l'analyse et des conventions adoptées. Par exemple, il faut décider si la ponctuation se compte à part, si une contraction comme I'm représente un mot écrit ou deux unités grammaticales, et comment repérer les frontières de mots dans les langues qui ne séparent pas régulièrement les mots par des espaces.
autres termes français attestés: segmentation lexicale, segmentation
Degré de ressemblance de sens entre deux mots, expressions ou concepts.
Remarques En TAL fondé sur les plongements, la similarité sémantique est souvent estimée en comparant leurs vecteurs, généralement par la similarité cosinus. La proximité vectorielle est une estimation de la similarité sémantique, non sa définition. La similarité se distingue aussi de la parenté sémantique au sens large : doctor et hospital sont apparentés, mais pas similaires comme le sont doctor et physician.
sortie structuréeen structured output
Contexterequêtesinformatique
Sortie de modèle conforme à une structure prédéfinie et lisible par machine, comme un objet JSON aux champs et types de données spécifiés.
Remarques La structure peut être demandée dans la requête ou imposée pendant la génération par décodage contraint.
Production de parole artificielle à partir de n'importe quel texte (angl. text-to-speech, TTS), combinant un traitement linguistique, qui transforme le texte en une forme phonétique prononçable, et un traitement du signal, qui transforme cette forme en son; l'inverse de la reconnaissance automatique de la parole.
autres termes français attestés: synthèse vocale, synthèse texte-parole
système 1en System 1 thinking
Contextesciences cognitives
Mode de traitement cognitif rapide, automatique et intuitif, qui s'exerce avec peu d'effort délibéré.
Remarques À propos des modèles de langue, le système 1 sert souvent d'analogie utile, quoique imparfaite, pour les réponses rapides et directes générées principalement à partir de régularités apprises. Le terme vient des théories de la cognition humaine et son application à l'IA est métaphorique : elle n'implique pas que les modèles de langue possèdent des systèmes cognitifs humains, un effort conscient, une intuition ou une conscience de soi.
Mode de traitement cognitif lent, délibéré et analytique, qui exige une attention et un effort soutenus.
Remarques À propos des modèles de langue, le système 2 sert souvent d'analogie utile, quoique imparfaite, pour les processus qui consacrent un surcroît de calcul au raisonnement en plusieurs étapes, à l'évaluation ou à la vérification avant de produire une réponse. Le terme vient des théories de la cognition humaine et son application à l'IA est métaphorique : elle n'implique pas que les modèles de langue possèdent des systèmes cognitifs humains, un effort conscient, une intuition ou une conscience de soi.
tarification à l'usage selon le nombre de jetons*en token-based billing
ContexteIAinformatique
Méthode de tarification à l'usage dans laquelle le coût d'une demande au modèle se calcule d'après le nombre et la catégorie des jetons traités.
Remarques Les fournisseurs peuvent appliquer des tarifs différents aux jetons d'entrée, d'entrée en cache, de sortie visible et de raisonnement interne.
* « tarification à l'usage selon le nombre de jetons » est ma proposition : aucune banque de terminologie ne l'atteste.
taux d'erreur de motsen word error rate (WER)
Contexteparoleévaluation
Indicateur standard de la qualité d'une reconnaissance de la parole : proportion de mots substitués, supprimés et insérés dans la transcription automatique par rapport au nombre de mots d'une référence humaine; il mesure la fréquence des erreurs, pas leur gravité.
températureen temperature
Contextemodèles de langue
Réglage qui influence le caractère prévisible ou varié de la sortie d'un modèle de langue.
Remarques Au moment de choisir chaque nouveau jeton, le modèle attribue des probabilités différentes aux options disponibles. Une température plus basse le fait favoriser plus fortement les options les plus probables, produisant en général un texte plus prévisible et régulier ; une température plus élevée donne davantage de chances aux options moins probables, ce qui peut rendre la sortie plus variée ou surprenante, mais aussi moins cohérente ou exacte. La température agit sur la distribution de probabilité utilisée pendant la génération, mais ne garantit pas à elle seule une sortie déterministe, même réglée à zéro.
Norme fondée sur XML (ISO 30042) pour échanger des bases terminologiques : chaque entrée conceptuelle peut contenir les termes de plusieurs langues et des métadonnées riches comme des définitions, la partie du discours, le domaine et des notes d'usage.
Évaluation normalisée servant à mesurer et à comparer la performance de systèmes d'IA sur des tâches ou des capacités données.
Remarques Elle combine généralement un jeu de test (questions, exemples ou autre tâche) et une méthode de notation, comme l'exactitude. Un test de performances peut surestimer les capacités d'un modèle si son matériel de test figure dans les données d'entraînement (voir contamination des données). De plus, une forte performance à un test donné ne se traduit pas nécessairement par une forte performance en situation réelle.
autres termes français attestés: test d'évaluation des performances
Texte représenté par la seule suite de ses caractères, sans mise en forme ni mise en page propre. Un fichier en texte brut s'ouvre dans n'importe quel éditeur de texte, quel que soit le logiciel qui l'a produit, ce qui explique que les formats d'échange s'écrivent ainsi : les langages de balisage consignent la structure à l'intérieur du texte brut, en l'écrivant sous forme de caractères dans le texte lui-même.
traduction assistée par ordinateur (TAO)en computer-assisted translation (CAT)
ContexteTAOtraduction
Logiciel qui assiste un traducteur humain pendant le processus de traduction, généralement en divisant les textes en segments et en offrant des fonctions comme la recherche en mémoire de traduction, la gestion terminologique, les vérifications de cohérence et la gestion des fichiers.
Remarques Contrairement à la traduction automatique, le traducteur humain demeure responsable de produire et d'approuver la traduction, même si un outil de TAO peut intégrer des suggestions générées par la machine.
Utilisation d'un système informatique pour produire, dans une langue cible, un contenu qui rend un contenu exprimé dans une langue source.
Remarques La traduction automatique ne se réduit pas au remplacement de chaque mot source par un mot de la langue cible : le système doit aussi tenir compte des différences de sens, de grammaire, d'ordre des mots, d'expressions idiomatiques et de contexte entre les langues. La traduction automatique moderne est généralement effectuée par des modèles neuronaux qui génèrent une séquence en langue cible conditionnée par une séquence en langue source ; les modèles encodeur-décodeur ont été conçus spécialement pour ce type de tâche, même si les grands modèles de langue généralistes peuvent aussi traduire. La sortie peut être utilisée telle quelle pour l'accès à l'information ou la communication, ou comme premier jet qu'un traducteur humain révise. La traduction automatique diffère de la traduction assistée par ordinateur : dans la première, le système produit une traduction ; dans la seconde, l'outil appuie un traducteur humain, même s'il peut intégrer un système de traduction automatique parmi ses composants.
traduction parole à paroleen speech-to-speech translation (S2ST)
Contexteparoletraduction
Conversion d'un énoncé oral dans une langue en énoncé oral dans une autre langue, soit en enchaînant reconnaissance de la parole, traduction automatique et synthèse de la parole (cascade), soit par un modèle unique de bout en bout.
traitement automatique de la langue (TAL)en natural language processing (NLP)
ContexteTAL
Domaine interdisciplinaire qui développe et étudie des méthodes computationnelles pour analyser, traiter et générer le langage humain.
Remarques Les termes traitement automatique de la langue et linguistique informatique s'emploient de façon plus ou moins interchangeable.
Exécution simultanée de deux opérations de calcul ou plus, généralement en répartissant le travail entre plusieurs cœurs de processeur ou appareils de calcul.
Remarques En IA, il peut réduire le temps de calcul en permettant de traiter simultanément, plutôt que successivement, des calculs indépendants ou des portions de données. Pendant l'entraînement d'un transformeur, de nombreux calculs portant sur les jetons d'une séquence d'entrée peuvent être effectués en parallèle ; la capacité du modèle à représenter les relations entre jetons éloignés vient de son mécanisme d'attention, pas du traitement parallèle lui-même.
transformeuren transformer
Contexteapprentissage profondmodèles de langue
Architecture de réseau de neurones pour le traitement des séquences, comme le texte.
Remarques Elle se compose de blocs répétés combinant autoattention et réseaux de neurones à propagation avant. L'autoattention permet au modèle de déterminer quels autres jetons du contexte disponible sont les plus pertinents pour interpréter chaque jeton et de combiner l'information de ces positions. L'information positionnelle indique au modèle où se trouvent les jetons, l'attention ne représentant pas d'elle-même l'ordre de la séquence. En construisant des représentations contextuelles de plus en plus riches au fil des couches, les transformeurs peuvent modéliser les relations entre des parties d'un texte même très éloignées. Ils forment la base de la plupart des grands modèles de langue modernes.
Format normalisé, fondé sur XML, pour échanger des mémoires de traduction entre outils de TAO : un fichier TMX contient des unités de traduction dont les variantes peuvent couvrir un nombre illimité de langues.
Travail humain qui reste caché derrière des services numériques présentés comme automatisés.
Remarques En IA, il comprend la collecte, l'étiquetage ou la classification de données, la modération de contenu, l'évaluation des sorties de modèles et l'exécution de tâches que les systèmes automatisés ne peuvent pas traiter. Il est souvent organisé par des plateformes de travail numérique et effectué dans des conditions précaires ou mal payées.
Forme linguistique distincte relevée dans un texte ou un corpus, comptée une seule fois quel que soit son nombre d'apparitions.
Remarques Par exemple, cats chase cats contient trois occurrences de mots mais seulement deux types : cats et chase. Ce qui compte comme un même type dépend des conventions : les formes en majuscules et en minuscules peuvent être traitées comme un même type ou comme des types différents, et les formes fléchies peuvent être comptées séparément si elles n'ont pas été regroupées sous un lemme commun.
Enregistrement qui associe un segment de la langue source à son équivalent dans la langue cible, généralement accompagné de métadonnées.
Remarques Les limites de ces segments sont fixées lors de la segmentation. En TMX, l'élément tu regroupe les variantes propres à chaque langue, représentées par des éléments tuv contenant chacun un élément seg. Le segment contient donc du texte dans une langue donnée, tandis que l'unité de traduction enregistre la relation entre segments équivalents et peut comporter des variantes dans plus de deux langues. Le terme est employé ici au sens technique des mémoires de traduction ; il peut prendre des sens plus larges et quelque peu différents en traductologie.
Codage de caractères à longueur variable pour Unicode. Il représente chaque point de code Unicode valide au moyen d'une séquence de un à quatre octets. Les caractères du répertoire ASCII occupent un seul octet et conservent les mêmes valeurs qu'en ASCII, ce qui favorise la compatibilité. UTF-8 permet de représenter le même répertoire Unicode que UTF-16 et UTF-32, mais cela ne signifie pas que chaque caractère occupe un seul octet. Il est largement recommandé pour les contenus Web multilingues et l'échange de données.
* « UTF-8 » est ma proposition : aucune banque de terminologie ne l'atteste.
utilisation d'outilsen tool use
ContexteagentsIA
Capacité d'un modèle de langue ou d'un système d'IA à demander et à utiliser les résultats de ressources ou de logiciels externes pour accomplir une tâche.
Remarques Les outils peuvent être un moteur de recherche, une calculatrice, une base de données, un environnement d'exécution de code, un calendrier ou une interface de programmation d'applications externe. Dans un processus typique, le modèle choisit un outil disponible et génère une demande structurée avec les arguments nécessaires ; le logiciel qui entoure le modèle valide et exécute la demande, puis lui retourne le résultat, que le modèle peut intégrer à sa réponse ou utiliser pour décider d'une autre action. L'utilisation d'outils peut ainsi donner accès à de l'information à jour, à des calculs spécialisés et à des actions impossibles avec les seuls paramètres appris. Elle est plus large que l'appel de fonction, mécanisme technique courant pour exprimer une demande d'outil. Un seul appel d'outil ne fait pas nécessairement d'un système un agent : les systèmes agentiques planifient et coordonnent habituellement plusieurs appels ou actions dans le temps. Le modèle de langue propose généralement l'action plutôt que de l'exécuter directement, distinction importante pour la responsabilité et la sécurité, puisque le système environnant contrôle les permissions, valide les arguments et effectue les actions pouvant avoir des effets externes.
Capacité de systèmes d'IA à commander des interfaces informatiques au moyen de captures d'écran, de mouvements de souris et de saisies au clavier pour accomplir une tâche.
* « utilisation d'un ordinateur » est ma proposition : aucune banque de terminologie ne l'atteste.
utilisation équitableen fair use
Contextedroit
Doctrines apparentées du droit d'auteur qui permettent certains usages d'œuvres protégées sans l'autorisation du titulaire des droits.
Remarques Aux États-Unis, le fair use s'apprécie au cas par cas selon quatre facteurs légaux non exhaustifs, dont le but et la nature de l'usage, l'ampleur de l'extrait utilisé et son effet sur le marché potentiel de l'œuvre. Au Canada, l'utilisation équitable s'applique quand l'usage vise une fin prévue par la Loi sur le droit d'auteur (recherche, étude privée, éducation, parodie, satire, critique, compte rendu ou communication de nouvelles) et que l'utilisation est jugée équitable dans les circonstances. Bien que comparables, les deux régimes ont des exigences juridiques différentes et ne sont pas interchangeables.
Remarques En apprentissage automatique, un vecteur peut représenter les attributs d'un élément ou sa position dans un espace multidimensionnel.
vecteur 1 parmi nen one-hot vector
Contexteapprentissage automatiqueTAL
Vecteur dont tous les éléments valent 0, sauf un seul qui vaut 1. La position du 1 identifie un élément d'un ensemble fixe, comme une catégorie ou un jeton d'un vocabulaire.
Remarques Contrairement à un plongement, un vecteur 1 parmi n identifie un élément sans représenter les similarités ou les relations entre éléments.
vecteur creuxen sparse vector
Contexteapprentissage automatique
Vecteur dont la plupart des valeurs sont nulles (d'après Jurafsky et Martin, traduction libre).
Remarques Les représentations creuses peuvent être stockées et traitées efficacement en ne consignant que les valeurs non nulles et leurs positions.
Vecteur dont la plupart des composantes, ou toutes, sont des nombres réels non nuls.
Remarques En traitement automatique de la langue, les vecteurs denses sont souvent des représentations apprises, relativement courtes, de mots ou d'autres jetons. Leurs dimensions n'ont généralement pas d'interprétation évidente, mais le vecteur dans son ensemble peut représenter des similarités utiles entre éléments.
violation du droit d'auteuren copyright infringement
Contextedroitéthique et société
« La violation du droit d'auteur se produit lorsqu'une personne utilise du contenu protégé par le droit d'auteur d'une façon qui enfreint les droits accordés par la Loi sur le droit d'auteur. Il peut s'agir par exemple de copier ou de communiquer au public une œuvre protégée par le droit d'auteur (la totalité de l'œuvre ou une partie importante de celle-ci) sans l'autorisation du titulaire du droit d'auteur. » (gouvernement du Canada, citation directe).
Ensemble fixe des jetons qu'un segmenteur et un modèle de langue peuvent reconnaître et représenter.
Remarques Selon la méthode de segmentation, le vocabulaire peut contenir des mots complets, des parties de mots, des caractères individuels, des signes de ponctuation, des octets et des jetons spéciaux. Chaque élément du vocabulaire reçoit un identifiant numérique : le segmenteur convertit le texte d'entrée en ces identifiants, et le modèle de langue choisit dans le même vocabulaire quand il prédit des jetons. Le vocabulaire est normalement créé pendant l'entraînement du segmenteur, puis reste fixe pendant l'entraînement et l'utilisation du modèle.
autres termes français attestés: vocabulaire de jetons
XML Localization Interchange File Format (XLIFF)en XML Localization Interchange File Format (XLIFF)
Contexteformats d'échangetraduction
Format bilingue fondé sur XML pour faire circuler du contenu dans un flux de localisation : segments source et cible voyagent ensemble, avec des métadonnées de flux de travail comme le statut de traduction, contrairement aux formats d'échange de ressources linguistiques.