Por qué los LLM fallan en hechos que ya tienen codificados: el problema está en el recall

Por qué los LLM fallan en hechos que ya tienen codificados: el problema está en el recall

Brain Code |

Cuando un modelo de lenguaje responde incorrectamente a una pregunta factual, existen al menos dos posibilidades: que nunca haya codificado ese conocimiento o que lo haya almacenado, pero no consiga recuperarlo cuando lo necesita.

Una investigación de Google Research apunta a que, en los modelos de frontera analizados, el segundo escenario explica una parte importante de los errores factuales. Modelos como Gemini-3-Pro y GPT-5 codifican entre el 95 % y el 98 % de los hechos evaluados, pero siguen sin poder recuperar directamente entre el 26 % y el 34 % de ellos. Incluso cuando utilizan capacidades de thinking, todavía fallan en un 11-12 %.

El resultado plantea una distinción relevante: el problema de la factualidad puede estar desplazándose desde adquirir conocimiento hacia ser capaz de utilizar el conocimiento que el modelo ya tiene codificado.

Codificar un hecho no significa poder recuperarlo

Las métricas tradicionales de precisión permiten saber si un modelo ha respondido correctamente, pero no explican por qué ha fallado.

Google Research distingue dos tipos de problemas:

  • Fallo de codificación: el hecho no parece estar representado en el modelo.
  • Fallo de recall o recuperación: el hecho está codificado, pero el modelo no consigue acceder a él ante una determinada pregunta.

La diferencia importa porque ambos problemas apuntan a intervenciones distintas. Los fallos de codificación pueden requerir aumentar el tamaño del modelo o ampliar la cobertura de los datos. Los fallos de recuperación, en cambio, también pueden abordarse mediante técnicas de post-entrenamiento o métodos aplicados durante la inferencia que ayuden al modelo a utilizar mejor lo que ya tiene codificado.

La investigación utiliza una analogía para explicar esta diferencia: unas estanterías vacías frente a unas llaves perdidas. En el primer caso, la información no está almacenada. En el segundo, está disponible, pero el modelo no encuentra cómo acceder a ella.

Knowledge profiling: analizar hechos en lugar de preguntas aisladas

Para estudiar esta diferencia, los investigadores proponen un framework denominado knowledge profiling.

En lugar de evaluar únicamente si un modelo responde correctamente a una pregunta concreta, el método intenta determinar cuál es el estado del hecho que hay detrás de esa pregunta.

Cada hecho puede clasificarse en uno de cinco perfiles:

  1. fallo de codificación;
  2. fallo de recall;
  3. recall directo;
  4. recall mediante thinking;
  5. inferencia sin codificación.

El objetivo es ofrecer un diagnóstico más preciso del comportamiento factual de los LLM que el que proporciona la precisión medida pregunta por pregunta.

Encoding, knowledge y recall: tres conceptos diferentes

El framework se apoya en tres nociones de comportamiento.

Encoding o codificación significa que el modelo puede reproducir correctamente un hecho cuando se sitúa en un contexto similar a aquellos en los que ese hecho podría haber aparecido durante el preentrenamiento.

Knowledge o conocimiento implica que el modelo puede responder correctamente a preguntas semánticamente equivalentes sobre un hecho, utilizando distintas formulaciones y diferentes direcciones de la relación.

Recall o recuperación se produce cuando el modelo conoce un hecho que previamente ha sido identificado como codificado. Si puede recuperarlo sin thinking, los investigadores hablan de direct recall.

El estudio también contempla situaciones en las que el modelo alcanza una respuesta correcta mediante thinking a pesar de que el hecho no haya sido identificado como codificado. Los autores denominan este caso inference without encoding, que puede producirse mediante razonamiento con otros hechos codificados o mediante estimaciones.

WikiProfile: 2.150 hechos y diez pruebas por hecho

Para aplicar este enfoque, Google Research creó WikiProfile, un benchmark construido a partir de hechos extraídos de Wikipedia.

Cada hecho consiste en una proposición que relaciona dos entidades y se asocia con diez tareas diferentes:

  • dos tareas para evaluar la codificación;
  • cuatro para evaluar el conocimiento;
  • cuatro variantes de opción múltiple para evaluar el reconocimiento.

El proceso de construcción incluye generación de preguntas directas e inversas, refinamiento, filtrado y una validación manual final. Tras este proceso, WikiProfile contiene 2.150 hechos.

Una evaluación de 13 modelos y unos 4,5 millones de respuestas

Los investigadores evaluaron 13 LLM, cada uno tanto con thinking como sin él.

Para cada combinación de modelo, hecho y tarea se generaron ocho respuestas. Estas fueron calificadas automáticamente mediante LLM utilizados como evaluadores.

En conjunto, el análisis produjo aproximadamente 4,5 millones de respuestas.

El principal resultado: la codificación está cerca de saturarse, el recall no

Los resultados muestran una diferencia clara en los modelos de frontera analizados.

Para Gemini-3-Pro y GPT-5, entre el 95 % y el 98 % de los hechos están codificados. Sin embargo, estos modelos no consiguen recuperar directamente entre el 26 % y el 34 % de esos hechos.

Incluso utilizando thinking, continúan sin recuperar entre el 11 % y el 12 %.

Para los investigadores, estos resultados sugieren que una proporción creciente de los errores factuales de los modelos de frontera no procede de conocimiento inexistente, sino de conocimiento almacenado que no resulta accesible de manera fiable.

Escalar el modelo mejora más el almacenamiento que el acceso

El análisis de la familia Gemma 3 refuerza este patrón.

A medida que aumenta el tamaño de los modelos, los fallos de codificación disminuyen considerablemente. Sin embargo, los problemas de recuperación continúan siendo relevantes y representan una proporción mayor de los errores restantes.

Dicho de otra forma, según los resultados del estudio, el escalado mejora más lo que un modelo almacena que su capacidad para acceder a ello.

Los hechos poco frecuentes también pueden estar codificados

La investigación analiza específicamente el comportamiento de los modelos ante hechos poco frecuentes.

Los resultados muestran que los hechos raros se codifican a tasas relativamente cercanas a las de los hechos más populares. La diferencia entre ambos grupos es mayor cuando se analiza la capacidad de recuperación.

Esto introduce un matiz en el problema de los hechos de larga cola: muchos de esos hechos no están ausentes de los parámetros del modelo, sino que son más difíciles de recuperar.

Las preguntas inversas revelan otro problema de recuperación

El trabajo también estudia las preguntas que invierten la dirección en la que se presenta una relación entre dos elementos.

En generación abierta, las preguntas inversas resultan sistemáticamente más difíciles que las preguntas directas. Sin embargo, cuando el modelo debe reconocer la respuesta correcta entre varias alternativas, las preguntas inversas no resultan más difíciles y, en algunos casos, son incluso más fáciles.

Esta diferencia es importante para los autores.

Si un modelo puede reconocer una respuesta correcta cuando aparece entre varias opciones, pero no puede generarla ante una pregunta formulada en dirección inversa, el problema no tiene por qué ser que ese conocimiento falte. El hecho puede estar codificado y ser reconocible, pero resultar difícil de recuperar cuando la consulta se aleja de la forma en la que apareció durante el entrenamiento.

El contexto en el que se aprendió un hecho influye en su recuperación

Los resultados sugieren que el recall está estrechamente relacionado con las condiciones en las que el modelo aprendió originalmente un hecho.

Cuando una consulta se distancia del contexto, la formulación o el orden con el que la información apareció durante el entrenamiento, recuperarla puede resultar más difícil.

Los hechos poco frecuentes y las preguntas formuladas en dirección inversa son los dos casos que la investigación destaca para mostrar este comportamiento.

El thinking puede actuar como mecanismo de recuperación

El estudio analiza también hasta qué punto el thinking permite recuperar conocimiento que inicialmente no resulta accesible.

Los resultados muestran que su efecto es mayor precisamente en las situaciones en las que el recall directo es más débil, especialmente en hechos poco frecuentes y preguntas inversas.

En los modelos optimizados para thinking, este proceso permite recuperar aproximadamente entre el 40 % y el 65 % de los hechos que estaban codificados pero no podían recuperarse directamente.

Por el contrario, solo permite recuperar entre el 5 % y el 15 % de los hechos no codificados.

Este patrón lleva a los investigadores a plantear que el thinking funciona principalmente como un mecanismo que facilita el acceso a información ya codificada, más que como un sistema dedicado principalmente a obtener esas respuestas mediante razonamientos complejos de varios pasos.

Thinking también tiene un coste

El uso de thinking no está exento de limitaciones.

Google Research señala que implica un coste computacional y que todavía no está claro cómo determinar exactamente cuándo debería activarse.

Por tanto, aunque puede recuperar una parte importante del conocimiento codificado pero inicialmente inaccesible, queda abierta la cuestión de cuándo resulta conveniente utilizar este mecanismo.

De adquirir más conocimiento a utilizar mejor el existente

La principal conclusión del estudio es que knowledge profiling permite separar problemas que las métricas convencionales de factualidad agrupan dentro de una misma respuesta incorrecta.

En los modelos de frontera analizados, la codificación factual se encuentra cerca de la saturación, mientras que la recuperación continúa teniendo margen de mejora.

Los resultados sugieren así que las futuras mejoras en factualidad podrían depender no solo de aumentar el tamaño de los modelos o los datos disponibles, sino también de mejorar la capacidad de los LLM para acceder al conocimiento que ya tienen codificado.

Fuente

Nitay Calderon y Gal Yona, “Empty shelves or lost keys? Recall is the bottleneck for parametric factuality”, Google Research, 12 de agosto de 2026.

Escribir un comentario