Techniques & Modèles
Transformer
Architecture de réseau de neurones fondatrice des LLM modernes, basée sur l'attention.
Définition
Le Transformer est une architecture de réseau de neurones introduite en 2017 qui repose sur le mécanisme d'« attention ». Contrairement aux modèles séquentiels (RNN), il traite l'ensemble des mots d'une phrase en parallèle, capturant les relations entre eux quelle que soit leur distance. C'est l'architecture sous-jacente de GPT, BERT, Claude et la quasi-totalité des LLM.
Et concrètement, en PME ?
Ce terme revient dès qu'on cadre un projet IA. Ce qui compte n'est pas de savoir le définir, mais de repérer s'il concerne vos processus : un audit part de vos tâches réelles et vous dit lesquelles relèvent de cette notion — et lesquelles n'en relèvent pas.
Voir en quoi consiste un audit IATermes liés
- LLM (Large Language Model)Modèle de langage de grande taille entraîné sur des milliards de documents pour générer et comprendre le texte.
- AttentionMécanisme qui permet au modèle de se concentrer sur les parties les plus pertinentes de l'entrée.