
Saiba mais: Foi somente após o lançamento do modelo Deepseek R1 que percebi que o aprendizado por reforço (RL) era nossa melhor chance de alcançar a Inteligência Artificial Geral (AGI) e, possivelmente, até mesmo a superinteligência.
Foi somente após o lançamento do modelo Deepseek R1 que percebi que o aprendizado por reforço (RL) era nossa melhor chance de alcançar a Inteligência Artificial Geral (AGI) e, possivelmente, até mesmo a superinteligência. Resumindo o passado (2019 a 2024): quando você realiza o pré-treinamento de um modelo de linguagem comum, o que você está fazendo é fazer com que o modelo preveja o próximo token em um conjunto de dados muito, muito grande.
Em teoria, a ideia é que o modelo de linguagem não apenas aprenda fatos sobre o mundo (veja isto) mas também seja capaz de criar um modelo interno do mundo e, assim, adquira o que coloquialmente chamamos de inteligência (veja isto). Ao aprender a prever o próximo token, ele consegue entender a lógica por trás disso e, portanto, é capaz de aprender habilidades presentes no conjunto de dados de pré-treinamento (exemplos incluem matemática, resumo de conteúdo, programação etc.
Aprofundando: Resumindo o passado (2019 a 2024): quando você realiza o pré-treinamento de um modelo de linguagem comum, o que você está fazendo é fazer com que o modelo preveja o próximo token em um conjunto de dados muito, muito grande.
). Mas o mero pré-treinamento não é suficiente. Modelos pré-treinados não são adequados para conversação porque o corpus em que esses modelos são treinados não contém dados conversacionais. O que acontece a seguir é o processo de conversão desses modelos massivos em algo que seja amigável à conversação.
O primeiro artigo sobre isso foi o InstructGPT, mas a ideia básica é clara: fazer um modelo fornecer respostas que os humanos preferem (sem se desviar muito do modelo base subjacente, que contém o raciocínio e os fatos). Então, outras coisas foram feitas para aumentar a inteligência do modelo (como ajuste fino em conjuntos de dados específicos para a tarefa), contratação de doutores para anotar dados etc.
Fechando: Em teoria, a ideia é que o modelo de linguagem não apenas aprenda fatos sobre o mundo (veja isto) mas também seja capaz de criar um modelo interno do mundo e, assim, adquira o que coloquialmente chamamos de inteligência (veja isto).
, tudo para aumentar a qualidade do corpus de treinamento. Empresas de treinamento de modelos usaram dados sintéticos (do próprio modelo de linguagem) para ajustar modelos menores e aprimorar o modelo de origem dos dados. Existem muitos outros truques na manga, mas esses são os que me vêm à mente agora.
Isso nos levou muito longe. Passamos do GPT-2 (que não conseguia contar até cinco corretamente) aumentando o tamanho do corpus, o número de parâmetros, implementando melhorias de eficiência (como o Flash Attention), inovações arquitetônicas como o MoE e assim por diante, para o GPT-4 e o Claude 3. 5 Sonnet, que são usados por milhões de desenvolvedores em todo o mundo para programação, e o matemático Terence Tao usou o GPT-4 como complemento na leitura e na escrita de artigos matemáticos.
Fonte original:
Reinforcement Learning is the Way to AGI
Categorias: Ciência, Descobertas, Conhecimento
Marcador: Notícias