A xAI colocou o Grok 4.5 na API em julho de 2026 com uma proposta direta: ser o modelo da empresa para programação, agentes e trabalho técnico. A ficha oficial informa uma janela de contexto de 500 mil tokens, entrada de texto e imagem, chamadas de funções, busca na web e no X, execução de código e três níveis de esforço de raciocínio.
O anúncio chama atenção pelos resultados apresentados em testes de engenharia, mas a parte mais importante para quem pretende usar o modelo está nos detalhes menos vistosos. O raciocínio não pode ser totalmente desligado, o nível padrão é alto, o preço muda quando o contexto passa de 200 mil tokens e a xAI recomenda uma chave estável de conversa para aumentar a chance de aproveitar o cache. Sem observar esses pontos, uma integração pode ficar mais lenta ou mais cara do que o orçamento inicial sugere.
Quando isso aconteceu
As páginas oficiais registram três momentos próximos. As notas de versão da API marcam a disponibilidade do Grok 4.5 em 8 de julho de 2026. O anúncio público do modelo é datado de 16 de julho. No dia seguinte, a xAI registrou a liberação no console da API para usuários da União Europeia.
Essa diferença de datas não muda o produto, mas ajuda a evitar um erro comum em notícias de IA: tratar o primeiro post encontrado como se ele representasse toda a distribuição. A chegada aconteceu em etapas, e a própria documentação foi atualizada ao longo daqueles dias.
A pauta continua atual em agosto porque o Grok 4.5 permanece listado como modelo disponível, alimenta o agente de programação Grok Build e aparece nas integrações indicadas pela empresa. Não estamos apresentando o lançamento de julho como uma novidade ocorrida hoje; estamos recuperando uma mudança ainda vigente e que não havia sido coberta pelo Bastidores da IA.
Um modelo voltado a tarefas que executam várias etapas
A xAI descreve o Grok 4.5 como um modelo para programação, engenharia, agentes e trabalho de conhecimento. Isso significa que o uso imaginado vai além de responder perguntas isoladas. Um agente pode ler arquivos, consultar fontes, executar código, chamar funções externas e revisar o resultado antes de entregar uma resposta.
Na API, o identificador documentado é grok-4.5. A empresa oferece suporte tanto à Responses API quanto ao formato Chat Completions. Entre as ferramentas listadas estão function calling, busca na web, busca no X e execução de código. A página oficial também informa corte de conhecimento em 1º de fevereiro de 2026, o que reforça a importância das ferramentas de busca quando a tarefa depende de acontecimentos posteriores.
O modelo também é usado no Grok Build, o agente de programação da xAI, e a documentação cita disponibilidade no Cursor, em complementos para Word, PowerPoint e Excel e por gateways de modelos. Isso amplia as maneiras de experimentar a tecnologia, mas não significa que todos esses ambientes ofereçam os mesmos limites, preços ou controles da API direta.
Raciocínio é obrigatório; o que muda é a intensidade
A documentação de raciocínio permite escolher entre low, medium e high. Se o desenvolvedor não definir nada, o nível alto é usado. Diferentemente de modelos que oferecem uma resposta sem raciocínio, no Grok 4.5 esse processamento não pode ser desativado.
Na prática, o nível baixo tende a fazer mais sentido em tarefas simples ou sensíveis à latência, enquanto o alto é reservado para problemas de várias etapas. Isso não é uma garantia de qualidade. É uma forma de controlar quanto processamento o modelo pode gastar antes da resposta.
O detalhe importa porque tokens de raciocínio também participam do consumo. Uma aplicação que deixa o padrão alto para classificar mensagens curtas, extrair um único campo ou executar uma chamada direta pode usar mais tempo e recursos do que precisa. O caminho seguro é testar o mesmo conjunto de tarefas nos três níveis, medindo correção, latência e custo.
Há ainda diferenças de parâmetros. A xAI informa que presencePenalty, frequencyPenalty e stop não podem ser usados com modelos de raciocínio; requisições que os incluam retornam erro. Migrar código de outro fornecedor apenas trocando a URL pode, portanto, não ser suficiente.
500 mil tokens de contexto, com uma mudança de preço no caminho
A ficha atual do modelo informa uma janela de 500 mil tokens. Em tese, isso abre espaço para repositórios maiores, documentos extensos e históricos longos de agentes. Mas a tabela de preços traz um corte importante em 200 mil tokens.
Na consulta realizada em 8 de agosto de 2026, a página oficial de preços mostrava US$ 2 por 1 milhão de tokens de entrada, US$ 0,30 para entrada em cache e US$ 6 por 1 milhão de tokens de saída no contexto curto. Quando o prompt alcança 200 mil tokens, a tabela passa para US$ 4 na entrada, US$ 0,60 no cache e US$ 12 na saída. A documentação diz que, cruzado esse limite, as tarifas de contexto longo valem para todos os tokens da requisição.
Isso muda a conta. Uma equipe pode imaginar que está pagando o preço básico pelos primeiros 199 mil tokens e apenas uma tarifa maior pelo excedente. Não é o que a tabela descreve. Passar do limiar altera a faixa da solicitação inteira.
Os valores são uma fotografia da página oficial nesta data e podem ser alterados. Também não incluem necessariamente cobranças por ferramentas, processamento prioritário ou produtos de terceiros. Antes de aprovar um projeto, é melhor estimar o fluxo completo: tamanho da entrada, raciocínio, saída, buscas, execução de código, repetições e falhas.
O cache pode reduzir custo, mas precisa ser tratado como parte da integração
A xAI recomenda o uso de prompt_cache_key na Responses API ou do cabeçalho x-grok-conv-id em Chat Completions. Esses identificadores ajudam a encaminhar uma sequência de conversa ao mesmo servidor e aumentam a chance de reutilizar o prefixo já processado.
O guia oficial de boas práticas de cache orienta manter um identificador estável, acrescentar novas mensagens sem alterar as anteriores e colocar instruções e documentos estáticos no início. A aplicação também deve acompanhar o campo de tokens em cache. Se ele permanece zerado, a economia prevista não está acontecendo.
Cache não é garantia. Rotas, expiração e mudanças no começo do prompt podem produzir uma perda de cache. Por isso, o sistema precisa continuar funcionando quando o conteúdo for cobrado como entrada normal. O desconto deve ser tratado como otimização mensurável, não como base única da viabilidade financeira.
Os benchmarks são da xAI, não um teste do Bastidores
No anúncio, a xAI publica comparações do Grok 4.5 em testes de engenharia de software, eficiência de tokens e tarefas de escritório. A empresa afirma que o modelo foi treinado em colaboração com o Cursor e apresenta resultados competitivos em avaliações de código e agentes.
Esses dados ajudam a entender onde a fabricante quer posicionar o produto, mas continuam sendo alegações do fornecedor. O Bastidores da IA não reproduziu os benchmarks nem executou uma avaliação independente para esta reportagem. Diferenças de ferramentas, limites, instruções e ambiente podem mudar o resultado.
Há outro cuidado: desempenho em um conjunto de tarefas não comprova segurança para modificar sistemas reais. Um agente com acesso a terminal, repositório, e-mail ou arquivos corporativos precisa de permissões mínimas, ambiente isolado, registro das ações e aprovação humana nos passos irreversíveis. Um modelo melhor em programação também pode produzir alterações erradas com mais convicção.
Por que isso ainda importa
O Grok 4.5 mostra como a disputa entre modelos está se deslocando da conversa para o trabalho executável. A lista de capacidades combina raciocínio, ferramentas, contexto longo e integração com ambientes de programação. Para empresas, a pergunta deixa de ser apenas “qual modelo escreve melhor?” e passa a incluir “qual fluxo ele consegue completar, com que permissão, custo e possibilidade de auditoria?”.
Também existe uma lição prática no preço por faixa. Contexto grande é atraente, mas não precisa ser preenchido em toda requisição. Busca por trechos relevantes, compactação de histórico e separação de tarefas podem produzir um sistema mais barato e controlável do que enviar tudo sempre.
Quem pretende avaliar o Grok 4.5 pode começar com um teste pequeno e repetível: escolher dez tarefas reais, definir critérios de sucesso, testar os três níveis de raciocínio, registrar tokens em cache, medir latência e revisar cada ação de ferramenta. Só depois faz sentido liberar contextos maiores ou acesso a sistemas internos.
O lançamento aconteceu em julho, mas suas decisões de arquitetura continuam atuais. A novidade não é apenas mais um número de versão. É um modelo que chega acompanhado de escolhas explícitas sobre raciocínio, cache, ferramentas e preço, quatro pontos que determinam se um agente funciona bem fora da demonstração.
