Modelos de fronteira conseguem recuperar até 65% dos fatos que não conseguem recordar diretamente — simplesmente pensando por mais tempo

✍️ Redação AR NEWS 24H ⏱️ 8 min de leitura
Modelos de fronteira conseguem recuperar até 65% dos fatos que não conseguem recordar diretamente — simplesmente pensando por mais tempo

Quando grandes modelos de linguagem (LLMs) apresentam erros, os desenvolvedores geralmente presumem que o modelo não possui os fatos necessários. As equipes de engenharia diagnosticam o erro como falta de conhecimento. A resposta padrão é aumentar o tamanho do modelo, expandir os dados de treinamento ou construir arquiteturas de recuperação complexas.

Um novo estudo realizado por pesquisadores do Google Research e do Technion demonstra que o conhecimento muitas vezes não está ausente. O modelo possui a informação codificada parametricamente, mas falha em apresentá-la durante a geração.

Os experimentos demonstram que modelos de ponta como o GPT-5 e o Gemini-3 codificam de 95% a 98% dos fatos testados. Isso indica que, em muitos casos, a recordação, e não a codificação, é o principal obstáculo para a precisão factual.

Ao entender como desbloquear o conhecimento existente por meio de computação em tempo de inferência, as equipes de engenharia podem criar aplicativos mais confiáveis sem necessariamente depender de modelos maiores ou bancos de dados externos.

Perfilamento de conhecimento: medindo o que os modelos realmente sabem

Para mapear essa lacuna entre armazenamento e recuperação, os pesquisadores propõem mudar o foco da avaliação da precisão em nível de pergunta para a análise de perfil em nível de fato. Em vez de simplesmente avaliar se um modelo de aprendizagem linear (LLM) responde a uma pergunta isolada corretamente ou incorretamente, a análise de perfil em nível de fato testa uma única informação subjacente em múltiplas condições, avaliando se o fato está armazenado nos parâmetros do modelo, se pode ser consultado de diferentes direções e formulações e qual o esforço computacional necessário para recuperá-lo.

Um modelo codifica um fato se puder reproduzi-lo com precisão quando preparado com seu contexto de treinamento original. Um modelo conhece um fato se puder responder de forma confiável a perguntas sobre ele em diferentes formulações e direções.

Falhas de codificação e de recuperação são indistinguíveis sob métricas de precisão, mas implicam limitações e soluções diferentes", escrevem os pesquisadores. "Falhas de codificação exigem intervenções pré-treinamento, como aumentar o tamanho do modelo ou a cobertura de dados. Falhas de recuperação sugerem intervenções pós-treinamento que geralmente melhoram a forma como os modelos utilizam o que já codificaram."

O Oasis fez seu primeiro show no clube Boardwalk. O modelo codifica o fato e o acessa facilmente para responder a perguntas diretas sem computação inferencial adicional.

O modelo não codifica nem conhece o fato. Ele não consegue completar uma frase no estilo da Wikipédia sobre os primeiros dias do Oasis, nem consegue responder a perguntas sobre o evento. Isso indica a necessidade de mais dados de pré-treinamento ou de maior capacidade do modelo.

O modelo tem a informação codificada, mas não consegue acessá-la. Ele consegue completar sem problemas o texto de treinamento original sobre o Oasis, mas falha ao responder à pergunta "Onde o Oasis fez seu primeiro show?", mesmo quando tem tempo para pensar.

O fato está codificado, mas inacessível à geração direta. Ele só é recuperado com sucesso quando o modelo usa computação em tempo de inferência, como a Cadeia de Pensamento, para preencher a lacuna. Os pesquisadores se referem a esse mecanismo como facilitação da recuperação. O modelo pode inicialmente falhar em responder à pergunta direta. Ao gerar pensamentos intermediários sobre a história inicial da banda em Manchester, ele se prepara estruturalmente para localizar e recuperar a resposta bloqueada.

O modelo nunca codificou explicitamente o fato sobre o Oasis. Em vez disso, ele responde à pergunta com sucesso fazendo uma suposição fundamentada ou raciocinando com base em outros fatos codificados que conhece. Ele pode deduzir a resposta encadeando pontos de dados separados, como "O Oasis se formou em Manchester", "o Boardwalk era uma famosa casa de shows dos anos 90" e "o Boardwalk recebeu shows de bandas emergentes no início de sua carreira".

Ilusões de escala, caudas longas e recuperações na ponta da língua

Os pesquisadores avaliaram 13 LLMs (Modelos de Aprendizagem Baseados em Lógica) em mais de 4 milhões de respostas. Eles usaram o WikiProfile, um banco de dados de referência contendo 2.150 fatos extraídos da Wikipédia, testando cada fato em formatos que variam desde o preenchimento exato do contexto até a verificação de múltipla escolha.

Para modelos de ponta como o GPT-5 e o Gemini-3, a codificação está próxima da saturação. Esses modelos codificam com sucesso de 95% a 98% dos fatos testados. No entanto, eles ainda falham em recordar diretamente de 26% a 34% desses fatos codificados sem pensar.

O raciocínio em tempo de inferência atua como um mecanismo vital de recuperação. Fornecer aos modelos esforço computacional extra recupera com sucesso de 40 a 65% dos fatos codificados que os modelos inicialmente não conseguem recordar diretamente. Os pesquisadores comparam isso ao estado de "ponta da língua" em humanos, onde o esforço deliberado, como refazer mentalmente o contexto, eventualmente ajuda a lembrar a informação.

Aumentar o tamanho do modelo não resolve automaticamente essa lacuna. Por exemplo, eles descobriram que aumentar o modelo Gemma3 de 1 bilhão para 27 bilhões de parâmetros reduziu as falhas de codificação de 85% para 23%. Mas, ao mesmo tempo, a proporção de falhas de recall aumentou, chegando a um pico de 40% sem qualquer planejamento prévio.

Isso sugere que o escalonamento resolve principalmente o problema de armazenamento, e não o de acesso. À medida que o modelo memoriza muito mais fatos, uma quantidade maior de conhecimento fica presa em um estado "codificado, mas inacessível".

A maior parte dos erros do modelo passa de dados faltantes para falhas de recuperação.

Nossos resultados sugerem que a capacidade de recordar informações está intimamente ligada às condições em que os fatos foram aprendidos, deteriorando-se quando as perguntas divergem dos padrões estabelecidos durante o treinamento", escrevem os pesquisadores. A forma como um usuário formula uma pergunta determina diretamente se o modelo consegue acessar a resposta armazenada.

Por exemplo, os experimentos mostraram que fatos raros são codificados em taxas semelhantes às de fatos populares. No entanto, eles encontraram uma grande diferença de recordação entre fatos de cauda longa e fatos altamente populares, que excede 25% para modelos de fronteira.

Da mesma forma, os modelos têm dificuldade em gerar respostas para perguntas inversas (ou seja, que perguntam sobre o sujeito em vez do objeto). Por exemplo, um modelo pode responder facilmente que o Oasis fez seu primeiro show no clube Boardwalk, mas não conseguir responder quem fez seu primeiro show naquele mesmo clube. Ao mesmo tempo, os mesmos modelos demonstram saber a resposta correta quando a mesma pergunta é feita em formato de múltipla escolha.

Enquanto essas falhas são frequentemente interpretadas como limitações da memorização ou da codificação bidirecional, nossos resultados sugerem um quadro diferente: fatos raros são frequentemente codificados, mas inacessíveis, e fatos inversos podem ser reconhecidos mesmo quando não podem ser gerados", escrevem os pesquisadores. "Isso reformula ambos os fenômenos como falhas de recordação, em vez de 'conhecimento ausente'."

O ROI do pensamento e dicas para desenvolvedores

As altas taxas de codificação dos modelos de vanguarda exigem uma mudança na forma como os desenvolvedores abordam a factualidade e a arquitetura do pipeline.

A reação padrão das empresas a alucinações costuma ser a implementação de Geração Aumentada por Recuperação (RAG), a expansão de bancos de dados vetoriais ou a ingestão de mais documentos de domínio. Embora necessário para atualizações em tempo real ou para dados totalmente ausentes, este estudo mostra que até 95-98% dos fatos padrão já estão codificados parametricamente. Muitas falhas podem ser recuperadas sem recuperação externa.

O raciocínio recuperou de 40 a 65% dos fatos codificados que os modelos não conseguiram recordar diretamente. No entanto, o raciocínio é computacionalmente caro. Uma arquitetura prática envolve uma chamada rápida ao modelo na primeira passagem, seguida de uma nova tentativa com maior esforço de raciocínio quando a confiança é baixa. As equipes podem otimizar os custos direcionando dinamicamente condições desafiadoras, como entidades raras ou perguntas inversas, para os modelos de raciocínio.

As métricas de precisão padrão mascaram as capacidades subjacentes do modelo. Os conjuntos de avaliação devem investigar o mesmo fato subjacente em diferentes formulações, contextos e direções para realmente entender o que um modelo sabe em comparação com o que ele pode acessar de forma confiável.

Como a recordação é altamente dependente do contexto, a formulação da pergunta determina o sucesso. Alterar a estrutura de uma pergunta, gerar um contexto intermediário relevante ou induzir o modelo a gerar uma cadeia de raciocínio antes de responder são mecanismos legítimos de confiabilidade que revelam informações que perguntas diretas não conseguem captar.

Limitações e conclusões práticas

O benchmark WikiProfile se baseia em fatos enciclopédicos da Wikipédia. Essas descobertas podem não ser perfeitamente generalizáveis para domínios empresariais proprietários ou altamente especializados. A capacidade de um modelo de armazenar e recuperar uma métrica interna específica da empresa pode se comportar de maneira diferente do seu processamento de dados enciclopédicos públicos.

AR NEWS 24H - Adicione como fonte preferida no Google
Adicione o AR NEWS como fonte favorita no Google News
🌐 Traduzido e adaptado
Adicionar como fonte preferida
AR NEWS 24H
Adicionar

Postar um comentário

0Comentários
* Por favor, não faça spam aqui. Todos os comentários são revisados ​​pelo administrador.