AR NEWS 24h

AR News Notícias. Preenchendo a necessidade de informações confiáveis.

Maceió AL - -

Space XAI estreia Grok 4.6, ultrapassando o desempenho de Kimi K3 e igualando GPT-5.6 Sol para o terceiro melhor do mundo

📅 12 de agosto de 2026⏱ 5 min de leitura🌐 Traduzido e adaptado
Space XAI estreia Grok 4.6, ultrapassando o desempenho de Kimi K3 e igualando GPT-5.6 Sol para o terceiro melhor do mundo

A empresa de Elon Musk, SpaceXAI, anteriormente conhecida como xAI, lançou o Grok 4.6, seu mais recente modelo de IA de fronteira, com foco em agentes de longa duração, codificação e trabalho de conhecimento — e uma estratégia de preços projetada para tornar essas cargas de trabalho mais baratas de serem executadas. O modelo pontua 61 no Índice de Inteligência de Análise Artificial de terceiros, superando o popular modelo chinês de pesos abertos da Moonshot, Kimi K3, e empatando o GPT-5.6 Sol Max da rival OpenAI e melhorando cinco pontos em relação ao Grok 4.5 High. Claude Opus 5 e Fable 5 da Anthropic ocupam o primeiro e o segundo lugar, respectivamente.

Mais importante para as empresas que avaliam agentes de IA, o Grok 4.6 registra ganhos consideráveis em relação ao seu antecessor em benchmarks de codificação, terminal, conhecimento e agente, mantendo um preço de interface de programação de aplicativos (API) a partir de $ 2 por milhão de tokens de entrada e $ 6 por milhão de tokens de saída, tornando-se um modelo de fronteira de preço médio comparando as principais opções proprietárias e de código aberto, globalmente, de acordo com a análise da VentureBeat.

Modelo Entrada ($/1M) Saída ($/1M) Total ($/1M) $ 0,10 $ 0,20 $ 0,30 Meta MiniMax-V2.5 Flash $ 0,10 $ 0,30 $ 0,40 Xiaomi deepseek-v4-flash $ 0,14 $ 0,28 $ 0,42 DeepSeek deepseek-v4-pro $ 0,435 $ 0,87 $ 1,305 DeepSeek GPT-5.6 Lua $ 0,20 $ 1,20 $ 1,40 OOpenAI MiniMax-M3 $ 0,30 $ 1,20 $ 1,50 MiniMax LongCat-2.0 — promoção por tempo limitado $ 0,30 $ 1,20 $ 1,50 LongCat MiniMax-V2.5 $ 0,40 $ 2,00 $ 2,40 Xiaomi LongCat-2.0 — Grok 4.5, que a SpaceXAI lançou em julho como um modelo voltado para codificação, tarefas de agente e trabalho de conhecimento, e um dia após o lançamento do Grok Bot, um novo sistema para atribuir agentes de IA para concluir tarefas designadas como funcionários virtuais.

A maior mudança é o comportamento do agente, não apenas outro ponto de referência

SpaceXAI descreve o Grok 4.6 como sendo construído especificamente para permanecer na tarefa em sequências de trabalho mais longas, incluindo pesquisa de tópicos desconhecidos, análise de informações, navegação em bases de código e conversão de ideias de produtos em aplicações funcionais. A empresa afirma que submeteu o modelo a um treinamento suplementar mais longo do que o Grok 4.5, usando raciocínio e dados técnicos gerados pelo modelo com curadoria, juntamente com dados de engenharia e alterações em seu otimizador e receita de treinamento.

Em seguida, usou o Grok 4.5 para regenerar trajetórias supervisionadas de ajuste fino em níveis de raciocínio, chicotes de agentes, STEM, engenharia de software e trabalho de conhecimento, filtrando trajetórias problemáticas com verificações baseadas em modelos. O aprendizado por reforço também teve como alvo ambientes de agente que abrangem codificação geral, trabalho de conhecimento, otimização de kernel, desenvolvimento web e design auxiliado por computador. Isso é importante porque as implantações empresariais de IA estão cada vez mais indo além das interações isoladas de prompt e resposta em direção aos agentes que devem manter o estado, operar ferramentas, modificar códigos e se recuperar de problemas em caminhos de execução mais longos.

A SpaceXAI diz que durante seus testes, o Grok 4.6 mostrou mais autoteste e verificação em trajetórias mais longas, verificando seu próprio trabalho antes de prosseguir. Ele também relata primeiras tentativas mais fortes em projetos interativos e visuais do que o Grok 4.5. Essas são observações da empresa, e não garantias independentes do comportamento da produção, mas indicam onde a SpaceXAI concentrou o trabalho pós-treinamento do modelo.

Grok 4.6 chega à fronteira, mas não a varre

A melhoria do Grok 4.6 em relação ao Grok 4.5 neste momento da competição de modelos de IA não pode ser exagerada. De acordo com a Análise Artificial, o Grok 4.6 atinge uma pontuação Elo (preferência humana de resultados do modelo confronto direto, adaptado do xadrez) de 1.753 no GDPVal-AA v2, o benchmark que mede o desempenho em tarefas do mundo real como agendamento e diagramação, contra 1.526 para Grok 4.5, 1.728 para GPT-5.6 Sol Max e 1.741 para Fable 5 Max. Os resultados de codificação do SpaceXAI mostram uma melhoria geracional semelhante, mas mais competição na fronteira. Grok 4.6 pontua 69,9% no CursorBench v3.2, acima dos 66,7%, enquanto Fable 5 Max atinge 70,5%. No DeepSWE v1.1, Grok sobe acentuadamente de 54% para 65,9%, mas GPT-5.6 Sol Max lidera com 73%.

FrontierCode v1.1 Extended passa de 56,6% para 61,3%, em comparação com 60,6% para GPT-5.6 Sol Max e 63,6% para Fable 5 Max. Os benchmarks dos agentes contam praticamente a mesma história. Grok 4.6 atinge 57,5% em APEX-Agents, um aumento de 10,4 pontos em relação aos 47,1% do Grok 4.5, excedendo por pouco os 56,7% do GPT-5.6 Sol Max, mas atrás do Fable 5 Max com 59,2%. No APEX-SWE, Grok 4.6 sobe de 53,6% para 56,4%, enquanto Fable 5 Max pontua 58,8%. Terminal-Bench v3.0 expõe uma lacuna restante maior. Grok 4.6 melhora de 15,7% para 26%, mas GPT-5.6 Sol Max e Fable 5 Max pontuam 34,6% e 34,1%, respectivamente. Dois dos resultados mais fortes do Grok 4.6 vêm de um trabalho profissional de longo prazo.

Na pasta AA, ele obteve um Elo de 1.577, ultrapassando por pouco os 1.574 do Fable 5 Max e superando os 1.502 do GPT-5.6 Sol Max. No Harvey LAB, Grok 4.6 atinge 15,8%, contra 12,9% do Grok 4.5, 11,3% do Fable 5 Max e 2,5% do GPT-5.6 Sol Max.

ℹ️

Nota do editor: O AR NEWS 24H publica conteúdos baseados em fontes externas. As informações e opiniões presentes no material original são de responsabilidade de seus respectivos autores. Este conteúdo foi traduzido e adaptado para o português do Brasil com o auxílio de ferramentas automatizadas.

Adicionar como fonte preferida
AR NEWS 24H
Adicionar

Postar um comentário

0Comentários
* Por favor, não faça spam aqui. Todos os comentários são revisados ​​pelo administrador.

Busque no AR NEWS 24H