AR NEWS 24h

AR News Notícias. Preenchendo a necessidade de informações confiáveis.

Maceió AL - -

Aprendizado por reforço é o caminho para a Inteligência Artificial Geral (AGI).

Resumo: Foi somente após o lançamento do modelo Deepseek R1 que percebi que o aprendizado por reforço (RL) era nossa melhor chance de alcançar a Inteligência...
Imagem ilustrativa — AR NEWS 24H
📷 Imagem ilustrativa — AR NEWS 24H

Saiba mais: Foi somente após o lançamento do modelo Deepseek R1 que percebi que o aprendizado por reforço (RL) era nossa melhor chance de alcançar a Inteligência Artificial Geral (AGI) e, possivelmente, até mesmo a superinteligência.

Foi somente após o lançamento do modelo Deepseek R1 que percebi que o aprendizado por reforço (RL) era nossa melhor chance de alcançar a Inteligência Artificial Geral (AGI) e, possivelmente, até mesmo a superinteligência. Resumindo o passado (2019 a 2024): quando você realiza o pré-treinamento de um modelo de linguagem comum, o que você está fazendo é fazer com que o modelo preveja o próximo token em um conjunto de dados muito, muito grande.

Em teoria, a ideia é que o modelo de linguagem não apenas aprenda fatos sobre o mundo (veja isto) mas também seja capaz de criar um modelo interno do mundo e, assim, adquira o que coloquialmente chamamos de inteligência (veja isto). Ao aprender a prever o próximo token, ele consegue entender a lógica por trás disso e, portanto, é capaz de aprender habilidades presentes no conjunto de dados de pré-treinamento (exemplos incluem matemática, resumo de conteúdo, programação etc.

Aprofundando: Resumindo o passado (2019 a 2024): quando você realiza o pré-treinamento de um modelo de linguagem comum, o que você está fazendo é fazer com que o modelo preveja o próximo token em um conjunto de dados muito, muito grande.

). Mas o mero pré-treinamento não é suficiente. Modelos pré-treinados não são adequados para conversação porque o corpus em que esses modelos são treinados não contém dados conversacionais. O que acontece a seguir é o processo de conversão desses modelos massivos em algo que seja amigável à conversação.

O primeiro artigo sobre isso foi o InstructGPT, mas a ideia básica é clara: fazer um modelo fornecer respostas que os humanos preferem (sem se desviar muito do modelo base subjacente, que contém o raciocínio e os fatos). Então, outras coisas foram feitas para aumentar a inteligência do modelo (como ajuste fino em conjuntos de dados específicos para a tarefa), contratação de doutores para anotar dados etc.

Fechando: Em teoria, a ideia é que o modelo de linguagem não apenas aprenda fatos sobre o mundo (veja isto) mas também seja capaz de criar um modelo interno do mundo e, assim, adquira o que coloquialmente chamamos de inteligência (veja isto).

, tudo para aumentar a qualidade do corpus de treinamento. Empresas de treinamento de modelos usaram dados sintéticos (do próprio modelo de linguagem) para ajustar modelos menores e aprimorar o modelo de origem dos dados. Existem muitos outros truques na manga, mas esses são os que me vêm à mente agora.

Isso nos levou muito longe. Passamos do GPT-2 (que não conseguia contar até cinco corretamente) aumentando o tamanho do corpus, o número de parâmetros, implementando melhorias de eficiência (como o Flash Attention), inovações arquitetônicas como o MoE e assim por diante, para o GPT-4 e o Claude 3. 5 Sonnet, que são usados ​​por milhões de desenvolvedores em todo o mundo para programação, e o matemático Terence Tao usou o GPT-4 como complemento na leitura e na escrita de artigos matemáticos.


Fonte original:
Reinforcement Learning is the Way to AGI

Categorias: Ciência, Descobertas, Conhecimento

Marcador: Notícias

Adicionar como fonte preferida
AR NEWS 24H
Adicionar

Postar um comentário

0Comentários
* Por favor, não faça spam aqui. Todos os comentários são revisados ​​pelo administrador.

Busque no AR NEWS 24H