Google mesure le rappel caché des grands modèles d’IA

Illustration de connaissances stockées et de chemins de rappel dans un grand modèle d’IA
Illustration générée par RoboActu pour représenter le diagnostic du rappel factuel dans les grands modèles d’IA.

Google Research propose une manière plus fine de lire les erreurs factuelles des grands modèles d’IA. Dans un billet publié sur son blog de recherche, l’équipe présente le « knowledge profiling », un cadre d’évaluation qui cherche à distinguer deux causes souvent confondues : le modèle n’a jamais encodé une information, ou bien il l’a encodée mais ne parvient pas à la rappeler au bon moment.

Cette distinction est importante pour les systèmes d’IA utilisés en production. Si une réponse fausse vient d’un manque de connaissances dans les paramètres, il faut améliorer les données ou la capacité du modèle. Si l’information est déjà présente mais difficile à retrouver, les leviers se déplacent vers le post-entraînement, les méthodes de raisonnement, les invites et les mécanismes de récupération au moment de l’inférence.

WikiProfile teste les faits plutôt que les questions

Pour mener cette analyse, Google introduit WikiProfile, un benchmark construit à partir de 2 150 faits issus de Wikipédia. Chaque fait est associé à dix tâches qui testent l’encodage, le rappel et la reconnaissance. L’objectif n’est plus seulement de savoir si une question précise reçoit une bonne réponse, mais de classer l’état d’un fait dans le modèle.

Le cadre distingue notamment les échecs d’encodage, les échecs de rappel, le rappel direct, le rappel avec raisonnement et l’inférence sans encodage. Cette typologie permet de repérer les cas où un modèle reconnaît la bonne information lorsqu’elle lui est présentée, mais échoue à la produire spontanément dans une question ouverte.

Google indique avoir évalué treize modèles, avec et sans mode de raisonnement, et généré environ 4,5 millions de réponses notées automatiquement. Les modèles cités incluent Gemini, GPT-5 et la famille Gemma, ce qui donne au test un intérêt au-delà d’un seul fournisseur.

Le rappel devient le maillon faible

Le résultat central est que les grands modèles récents encodent déjà une grande partie des faits testés. D’après Google, Gemini-3-Pro et GPT-5 encodent 95 à 98 % des faits de WikiProfile. Pourtant, ils échouent encore à rappeler directement 26 à 34 % de ces faits. Même avec le raisonnement activé, il resterait 11 à 12 % d’échecs.

Cette lecture nuance les débats sur les hallucinations. Pour les modèles frontières, une partie croissante des erreurs ne viendrait pas de « rayonnages vides », selon l’analogie de Google, mais de « clés perdues » : les informations existent dans le modèle, mais la formulation, le sens de la question ou la rareté du fait rendent leur accès instable.

Un signal pour les agents et les produits

Cette approche intéresse directement les développeurs d’agents et d’assistants. Un modèle peut paraître fiable sur des questions fréquentes et directes, puis se dégrader sur des faits rares ou des questions inversées. Pour un produit, cela signifie que l’évaluation doit couvrir plusieurs formulations d’un même fait, et pas seulement une moyenne d’exactitude globale.

Google observe aussi que le raisonnement aide surtout à récupérer des faits déjà encodés mais difficiles d’accès. Cela plaide pour des systèmes capables d’adapter leur effort de raisonnement aux cas incertains, au lieu de l’activer partout ou de compter uniquement sur une réponse immédiate.

Notre analyse

Le point fort de cette publication est de déplacer la discussion de la simple performance vers le diagnostic. Pour les éditeurs de logiciels, la question devient : le modèle ignore-t-il le fait, ou l’interface d’interrogation ne lui donne-t-elle pas les bonnes conditions pour le récupérer ?

Cette nuance ne supprime pas le besoin de vérification externe, surtout pour les usages sensibles. Mais elle donne une grille plus utile pour concevoir des tests, décider quand appeler une recherche web ou un outil documentaire, et comprendre pourquoi un même modèle peut sembler à la fois très savant et étonnamment oublieux.

Le briefing RoboActu

L’essentiel de la robotique, une fois par semaine.

Une sélection courte des annonces, usages et robots à suivre.

Continuer sur ce sujet

Comparer les robots