Mais importante para as empresas que avaliam agentes de IA, o Grok 4.6 registra ganhos consideráveis em relação ao seu antecessor em benchmarks de codificação, terminal, conhecimento e agente, mantendo um preço de interface de programação de aplicativos (API) a partir de $ 2 por milhão de tokens de entrada e $ 6 por milhão de tokens de saída, tornando-se um modelo de fronteira de preço médio comparando as principais opções proprietárias e de código aberto, globalmente, de acordo com a análise da VentureBeat.
Modelo Entrada ($/1M) Saída ($/1M) Total ($/1M) $ 0,10 $ 0,20 $ 0,30 Meta MiniMax-V2.5 Flash $ 0,10 $ 0,30 $ 0,40 Xiaomi deepseek-v4-flash $ 0,14 $ 0,28 $ 0,42 DeepSeek deepseek-v4-pro $ 0,435 $ 0,87 $ 1,305 DeepSeek GPT-5.6 Lua $ 0,20 $ 1,20 $ 1,40 OOpenAI MiniMax-M3 $ 0,30 $ 1,20 $ 1,50 MiniMax LongCat-2.0 — promoção por tempo limitado $ 0,30 $ 1,20 $ 1,50 LongCat MiniMax-V2.5 $ 0,40 $ 2,00 $ 2,40 Xiaomi LongCat-2.0 — Grok 4.5, que a SpaceXAI lançou em julho como um modelo voltado para codificação, tarefas de agente e trabalho de conhecimento, e um dia após o lançamento do Grok Bot, um novo sistema para atribuir agentes de IA para concluir tarefas designadas como funcionários virtuais.
A maior mudança é o comportamento do agente, não apenas outro ponto de referência
SpaceXAI descreve o Grok 4.6 como sendo construído especificamente para permanecer na tarefa em sequências de trabalho mais longas, incluindo pesquisa de tópicos desconhecidos, análise de informações, navegação em bases de código e conversão de ideias de produtos em aplicações funcionais. A empresa afirma que submeteu o modelo a um treinamento suplementar mais longo do que o Grok 4.5, usando raciocínio e dados técnicos gerados pelo modelo com curadoria, juntamente com dados de engenharia e alterações em seu otimizador e receita de treinamento.
Em seguida, usou o Grok 4.5 para regenerar trajetórias supervisionadas de ajuste fino em níveis de raciocínio, chicotes de agentes, STEM, engenharia de software e trabalho de conhecimento, filtrando trajetórias problemáticas com verificações baseadas em modelos. O aprendizado por reforço também teve como alvo ambientes de agente que abrangem codificação geral, trabalho de conhecimento, otimização de kernel, desenvolvimento web e design auxiliado por computador. Isso é importante porque as implantações empresariais de IA estão cada vez mais indo além das interações isoladas de prompt e resposta em direção aos agentes que devem manter o estado, operar ferramentas, modificar códigos e se recuperar de problemas em caminhos de execução mais longos.
A SpaceXAI diz que durante seus testes, o Grok 4.6 mostrou mais autoteste e verificação em trajetórias mais longas, verificando seu próprio trabalho antes de prosseguir. Ele também relata primeiras tentativas mais fortes em projetos interativos e visuais do que o Grok 4.5. Essas são observações da empresa, e não garantias independentes do comportamento da produção, mas indicam onde a SpaceXAI concentrou o trabalho pós-treinamento do modelo.
Grok 4.6 chega à fronteira, mas não a varre
A melhoria do Grok 4.6 em relação ao Grok 4.5 neste momento da competição de modelos de IA não pode ser exagerada. De acordo com a Análise Artificial, o Grok 4.6 atinge uma pontuação Elo (preferência humana de resultados do modelo confronto direto, adaptado do xadrez) de 1.753 no GDPVal-AA v2, o benchmark que mede o desempenho em tarefas do mundo real como agendamento e diagramação, contra 1.526 para Grok 4.5, 1.728 para GPT-5.6 Sol Max e 1.741 para Fable 5 Max. Os resultados de codificação do SpaceXAI mostram uma melhoria geracional semelhante, mas mais competição na fronteira. Grok 4.6 pontua 69,9% no CursorBench v3.2, acima dos 66,7%, enquanto Fable 5 Max atinge 70,5%. No DeepSWE v1.1, Grok sobe acentuadamente de 54% para 65,9%, mas GPT-5.6 Sol Max lidera com 73%.
FrontierCode v1.1 Extended passa de 56,6% para 61,3%, em comparação com 60,6% para GPT-5.6 Sol Max e 63,6% para Fable 5 Max. Os benchmarks dos agentes contam praticamente a mesma história. Grok 4.6 atinge 57,5% em APEX-Agents, um aumento de 10,4 pontos em relação aos 47,1% do Grok 4.5, excedendo por pouco os 56,7% do GPT-5.6 Sol Max, mas atrás do Fable 5 Max com 59,2%. No APEX-SWE, Grok 4.6 sobe de 53,6% para 56,4%, enquanto Fable 5 Max pontua 58,8%. Terminal-Bench v3.0 expõe uma lacuna restante maior. Grok 4.6 melhora de 15,7% para 26%, mas GPT-5.6 Sol Max e Fable 5 Max pontuam 34,6% e 34,1%, respectivamente. Dois dos resultados mais fortes do Grok 4.6 vêm de um trabalho profissional de longo prazo.
Na pasta AA, ele obteve um Elo de 1.577, ultrapassando por pouco os 1.574 do Fable 5 Max e superando os 1.502 do GPT-5.6 Sol Max. No Harvey LAB, Grok 4.6 atinge 15,8%, contra 12,9% do Grok 4.5, 11,3% do Fable 5 Max e 2,5% do GPT-5.6 Sol Max.
| ℹ️ | Nota do editor: O AR NEWS 24H publica conteúdos baseados em fontes externas. As informações e opiniões presentes no material original são de responsabilidade de seus respectivos autores. Este conteúdo foi traduzido e adaptado para o português do Brasil com o auxílio de ferramentas automatizadas. |
