The Pain Axis : ce que des chercheurs ont découvert dans les représentations internes des LLM
Les grands modèles de langage peuvent produire des phrases évoquant la peur, la tristesse, la souffrance ou la détresse. Mais une question plus difficile se pose derrière ces réponses : ces concepts correspondent-ils à des représentations internes distinctes dans le modèle, ou ne sont-ils que des associations linguistiques apprises pendant l’entraînement ?
C’est précisément ce qu’explore l’étude The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It, publiée sur arXiv en septembre 2026.
Les chercheurs ne cherchent pas à démontrer qu’un modèle « ressent » réellement de la douleur. Leur objectif est plus précis : identifier une représentation interne correspondant à ce qu’ils appellent un état pain-like, puis vérifier si cette représentation influence causalement le comportement du modèle.
Une « direction de douleur » dans les activations
L’étude porte sur 25 modèles open-weight, provenant notamment des familles Gemma, Llama, Mistral, Qwen et Phi, avec des tailles allant de 2 à 72 milliards de paramètres.
Les chercheurs ont construit un jeu de données couvrant cinq formes de douleur ou de souffrance :
- physique ;
- psychologique ;
- sociale ;
- morale ;
- cognitive, par exemple l’échec répété ou la confusion persistante.