Voltar ao blog
Tiago Freitas

O que é o GPT-6.1 Sol, e onde mora o desconto de 95%

O que é o GPT-6.1 Sol, e onde mora o desconto de 95%

O que é o GPT-6.1 Sol?

GPT-6.1 Sol é o modelo de trabalho do dia a dia da OpenAI, anunciado em 29 de setembro de 2026. Cobra US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de saída, um quinto do preço do GPT-6 Astra, o modelo topo de linha. A OpenAI diz que ele chega perto do Astra em código e em uso de computador.

Token é o pedaço de texto que o modelo cobra, mais ou menos uma sílaba. Um milhão de tokens, escrito Mtok nas tabelas de preço, dá um livro grosso. Entrada é o que você manda, saída é o que ele responde.

Por que o nome apareceu em toda conversa depois do DevDay de 29 de setembro?

O DevDay 2026 aconteceu em 29 de setembro em San Francisco, com mais de 20 anúncios. O Sol foi o que mexe na fatura de quem já usa a API. No dia anterior, 28 de setembro, a OpenAI cancelou o GPT-6.1 Astra por falhas de segurança nas avaliações internas. O Sol ficou como a novidade utilizável.

No mesmo dia, a Agents API ganhou uso de computador, e a Decisions API entrou em preview limitado para classificar e rotear pedidos, trabalho que hoje muitas orgs fazem com tópicos do Agentforce ou ramos de Flow.

Onde mora o desconto de 95% e como não perder ele?

Entrada cacheada custa US$ 0,10 por Mtok, 95% abaixo da entrada normal e metade do que o GPT-6 Sol cobrava. Cache é o desconto por mandar de novo um texto que o fornecedor já viu: instrução do agente, regras de negócio, descrição dos objetos. A parte repetida sai barata.

A regra prática é a ordem do prompt. Bloco fixo no começo, o que varia no fim. Se você embaralha essa ordem entre chamadas, o cache não bate e você paga cheio. Um agente que repete 8 mil tokens de instrução em 50 mil chamadas no mês manda 400 Mtok: US$ 800 sem cache, US$ 40 com cache.

Vale olhar a coluna do meio da tabela também. Sonnet 5.5 (28/09), GPT-6.1 Sol (29/09) e Gemini 4 Argon (30/09) estão os três em US$ 2 / US$ 10. O preço de tabela parou de separar os fornecedores, e sobraram latência, onde o dado fica e em qual fornecedor a org já confia.

Como isso aparece num chamado de suporte?

Um analista abre um chamado no Service Cloud e pede o resumo do histórico da conta. O agente manda as mesmas 6 mil tokens de instrução que manda em todo chamado, mais o histórico daquele cliente. Com o bloco fixo na frente, só o histórico entra no preço cheio.

Isso é mensurável antes de trocar de modelo: conte quantos tokens do seu prompt são texto fixo. Se a maior parte for, a conta cai pelo cache, não pela mudança de fornecedor.