Aller au contenu

Détails

Est-ce qu'un modèle de langage comme Claude réfléchit vraiment, ou se contente-t-il de deviner le mot suivant ?

Le 6 juillet 2026, Anthropic a publié une recherche qui apporte enfin des éléments de réponse concrets. Les chercheurs ont identifié le J-space : un petit espace interne où Claude retient des concepts qu'il peut rapporter et utiliser pour raisonner — sans jamais les écrire dans sa réponse. Pour le lire, ils ont développé une nouvelle technique, le J-lens, et surtout : ils ont prouvé sa fonction en intervenant directement dessus. Modifier une pensée interne silencieuse change la réponse finale du modèle.

Au programme de cette session :

  • Ce qu'Anthropic a découvert, et pourquoi ça s'appuie sur une théorie neuroscientifique reconnue (la théorie du "global workspace")
  • Comment fonctionne concrètement le J-lens, la technique qui rend ces pensées silencieuses lisibles
  • Démo en direct avec l'outil interactif réel de Neuronpedia : on va swapper une pensée interne de Claude et regarder sa réponse changer sous nos yeux
  • Ce que cette recherche implique pour la sécurité de l'IA (détection de comportements cachés, évaluation de la fiabilité des modèles) — et ce qu'elle ne prouve pas (Claude n'est pas "conscient" au sens humain du terme)

Une session pensée pour un public tech curieux d'interprétabilité, sans prérequis en machine learning — on part des bases neuroscientifiques et on construit à partir de là.

Vous aimerez peut-être aussi