A Anthropic anunciou o Claude Opus 5.5, nova versão do modelo que reduz os preços de tokens de entrada e saída em 20% e corta em 60% o custo de leitura de dados armazenados em cache. Em um exemplo apresentado pela empresa, uma sessão que custava US$ 3,50 no Opus 5 passa a custar US$ 2,40 no Opus 5.5, uma redução de cerca de 31%. O Opus 5.5 já está disponível pela API e no Claude Code. Para assinantes dos planos Pro, Max e Team, a redução de custos aparece na forma de limites de uso maiores. Segundo a Anthropic, o mesmo orçamento pode render cerca de 25% mais uso do modelo. A nova versão também muda a forma como o Claude trabalha. O Opus 5.5 usa o recurso de thinking antes das respostas para analisar a tarefa e chegar ao resultado. A empresa também afirma que o modelo ficou mais eficiente no uso de tokens, o que ajuda a reduzir o custo de tarefas longas. Quanto custa o Claude Opus 5.5? O preço de entrada caiu de US$ 5 para US$ 4 por milhão de tokens, enquanto o custo dos tokens de saída passou de US$ 25 para US$ 20. A maior redução aparece nas leituras de cache, que baixaram de US$ 0,50 para US$ 0,20 por milhão de tokens, uma queda de 60%. A mudança favorece principalmente sessões longas, nas quais o Claude reaproveita grandes volumes de informações armazenadas em cache. Como a leitura desses dados ficou mais barata, tarefas com muito contexto podem ter uma redução significativa no custo, mesmo quando trabalham com milhões de tokens. Já tarefas concentradas na geração de respostas tendem a se beneficiar principalmente da redução de 20% no preço dos tokens de saída. Como economizar tokens no Claude? Além dos preços menores do Opus 5.5, algumas configurações do Claude Code ajudam a controlar o consumo de tokens, como: Escolha o nível de esforço adequado Use cada modelo para uma tarefa Aproveite o cache Faça auditoria dos prompts Acompanhe o uso de tokens Escolha o nível de esforço adequado O nível de esforço determina quanto o modelo deve investir no processo de pensamento, na geração de texto e no uso de ferramentas. Para tarefas simples, níveis menores podem evitar gastos desnecessários. O nível Low pode ser usado em trabalhos mecânicos, como renomear variáveis ou aplicar padrões conhecidos em vários arquivos. O Medium atende tarefas cotidianas com escopo bem definido, enquanto o High faz mais sentido em problemas que exigem uma análise maior do código. Níveis mais altos devem ficar para tarefas complexas, nas quais o modelo precisa analisar várias partes do projeto antes de tomar uma decisão. Use cada modelo para uma tarefa Outra forma de controlar o consumo é escolher o modelo de acordo com a dificuldade do trabalho. O Opus 5.5 pode ficar responsável pelas tarefas principais, como desenvolvimento de funcionalidades, revisão de código e trabalhos que exigem mais raciocínio, enquanto modelos, como Sonnet e Haiku, assumem atividades secundárias. Para pesquisas, leitura de logs e execução de testes, a recomendação é configurar subagentes no Sonnet ou Haiku, deixando a edição principal do código a cargo do Opus 5.5. A divisão reduz a necessidade de usar o modelo mais caro em tarefas que não precisam do mesmo nível de capacidade. Também é indicado manter o Opus 5.5 como modelo principal no dia a dia, mas alternar para o Fable 5.1 caso ele trave duas vezes no mesmo problema usando esforço High. O Fable 5.1 tem custo maior, de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, mas pode evitar ciclos repetidos de tentativa e erro em códigos complexos. Aproveite o cache O cache é especialmente importante em sessões longas. No Opus 5.5, a leitura de informações armazenadas custa US$ 0,20 por milhão de tokens, o equivalente a apenas 5% do preço de uma entrada nova. A duração do cache varia conforme a forma de acesso ao modelo: nos planos Pro, Max e Team, ele dura uma hora e na API o período padrão é de cinco minutos. Para aproveitar melhor esse mecanismo, vale evitar mudanças constantes nas definições de ferramentas e no prompt do sistema durante uma tarefa, já que alterações podem invalidar partes do cache. Alterar o nível de esforço no meio da sessão por comando também invalida o cache da conversa, fazendo com que a próxima operação tenha de regravar o contexto. Quando o cache expira ou é invalidado por uma mudança de configuração, a regravação custa entre 1,25 e 2 vezes o preço de um token de entrada comum. Em contextos grandes, uma única regravação pode custar o equivalente a até 25 leituras de cache. No Claude Code, o comando /compact ajuda a reduzir o histórico usado pela conversa e o /clear inicia uma tarefa sem carregar o contexto anterior. O tamanho do arquivo CLAUDE.md também merece atenção. A recomendação é mantê-lo abaixo de 200 linhas para evitar o carregamento de informações desnecessárias a cada requisição. Os servidores MCP que não estão em uso também podem aumentar o volume de dados enviado ao modelo. Desativá-los com o comando /mcp reduz esse carregamento automático. No entanto, conectar ou desconectar servidores MCP durante uma sessão e alternar entre modelos são outras ações que podem reiniciar o cache da conversa. Faça auditoria dos prompts Prompts muito longos ou com instruções repetidas também podem aumentar o consumo. O comando /claude-api prompt-audit identifica problemas que podem fazer o modelo gastar tokens sem melhorar o resultado. Entre os pontos analisados estão instruções contraditórias e regras de verificação que aumentam o número de etapas de uma tarefa. Em testes de migração, a Anthropic registrou redução adicional de até 9% nos custos após a limpeza dos prompts. Acompanhe o uso de tokens O acompanhamento do consumo ajuda a encontrar tarefas que gastam mais do que o esperado. O comando /usage mostra informações sobre o uso da sessão, incluindo o consumo de tokens e a participação do cache. Sessões que fogem muito do padrão podem indicar loops de repetição, uso excessivo de ferramentas ou um nível de esforço maior do que o necessário para aquela tarefa. A análise desses casos ajuda a ajustar as configurações e evitar desperdícios nas próximas execuções. Se você gostou do conteúdo, talvez também se interesse por conferir “O custo invisível dos tokens: por que a conta da IA não para de subir?”. {{WHATSAPP_CHANNEL}}

A Anthropic anunciou o Claude Opus 5.5, nova vers o do modelo que reduz os pre os de tokens de entrada e sa da em 20% e corta em 60% o custo de leitura de dados armazenados em cache. Em um exemplo apresentado pela empresa, uma sess o que custava US$ 3,50 no Opus 5 passa a custar US$ 2,40 no Opus 5.5, uma redu o de cerca de 31%. O Opus 5.5 j est dispon vel pela API e no Claude Code. Para assinantes dos planos Pro, Max e Team, a redu o de custos aparece na forma de limites de uso maiores. Segundo a Anthropic, o mesmo or amento pode render cerca de 25% mais uso do modelo. A nova vers o tamb m muda a forma como o Claude trabalha. O Opus 5.5 usa o recurso de thinking antes das respostas para analisar a tarefa e chegar ao resultado. A empresa tamb m afirma que o modelo ficou mais eficiente no uso de tokens, o que ajuda a reduzir o custo de tarefas longas. Quanto custa o Claude Opus 5.5? O pre o de entrada caiu de US$ 5 para US$ 4 por milh o de tokens, enquanto o custo dos tokens de sa da passou de US$ 25 para US$ 20. A maior redu o aparece nas leituras de cache, que baixaram de US$ 0,50 para US$ 0,20 por milh o de tokens, uma queda de 60%. A mudan a favorece principalmente sess es longas, nas quais o Claude reaproveita grandes volumes de informa es armazenadas em cache. Como a leitura desses dados ficou mais barata, tarefas com muito contexto podem ter uma redu o significativa no custo, mesmo quando trabalham com milh es de tokens. J tarefas concentradas na gera o de respostas tendem a se beneficiar principalmente da redu o de 20% no pre o dos tokens de sa da. Como economizar tokens no Claude? Al m dos pre os menores do Opus 5.5, algumas configura es do Claude Code ajudam a controlar o consumo de tokens, como: Escolha o n vel de esfor o adequado Use cada modelo para uma tarefa Aproveite o cache Fa a auditoria dos prompts Acompanhe o uso de tokens Escolha o n vel de esfor o adequado O n vel de esfor o determina quanto o modelo deve investir no processo de pensamento, na gera o de texto e no uso de ferramentas. Para tarefas simples, n veis menores podem evitar gastos desnecess rios. O n vel Low pode ser usado em trabalhos mec nicos, como renomear vari veis ou aplicar padr es conhecidos em v rios arquivos. O Medium atende tarefas cotidianas com escopo bem definido, enquanto o High faz mais sentido em problemas que exigem uma an lise maior do c digo. N veis mais altos devem ficar para tarefas complexas, nas quais o modelo precisa analisar v rias partes do projeto antes de tomar uma decis o. Use cada modelo para uma tarefa Outra forma de controlar o consumo escolher o modelo de acordo com a dificuldade do trabalho. O Opus 5.5 pode ficar respons vel pelas tarefas principais, como desenvolvimento de funcionalidades, revis o de c digo e trabalhos que exigem mais racioc nio, enquanto modelos, como Sonnet e Haiku, assumem atividades secund rias. Para pesquisas, leitura de logs e execu o de testes, a recomenda o configurar subagentes no Sonnet ou Haiku, deixando a edi o principal do c digo a cargo do Opus 5.5. A divis o reduz a necessidade de usar o modelo mais caro em tarefas que n o precisam do mesmo n vel de capacidade. Tamb m indicado manter o Opus 5.5 como modelo principal no dia a dia, mas alternar para o Fable 5.1 caso ele trave duas vezes no mesmo problema usando esfor o High. O Fable 5.1 tem custo maior, de US$ 10 por milh o de tokens de entrada e US$ 50 por milh o de tokens de sa da, mas pode evitar ciclos repetidos de tentativa e erro em c digos complexos. Aproveite o cache O cache especialmente importante em sess es longas. No Opus 5.5, a leitura de informa es armazenadas custa US$ 0,20 por milh o de tokens, o equivalente a apenas 5% do pre o de uma entrada nova. A dura o do cache varia conforme a forma de acesso ao modelo: nos planos Pro, Max e Team, ele dura uma hora e na API o per odo padr o de cinco minutos. Para aproveitar melhor esse mecanismo, vale evitar mudan as constantes nas defini es de ferramentas e no prompt do sistema durante uma tarefa, j que altera es podem invalidar partes do cache. Alterar o n vel de esfor o no meio da sess o por comando tamb m invalida o cache da conversa, fazendo com que a pr xima opera o tenha de regravar o contexto. Quando o cache expira ou invalidado por uma mudan a de configura o, a regrava o custa entre 1,25 e 2 vezes o pre o de um token de entrada comum. Em contextos grandes, uma nica regrava o pode custar o equivalente a at 25 leituras de cache. No Claude Code, o comando /compact ajuda a reduzir o hist rico usado pela conversa e o /clear inicia uma tarefa sem carregar o contexto anterior. O tamanho do arquivo CLAUDE.md tamb m merece aten o. A recomenda o mant -lo abaixo de 200 linhas para evitar o carregamento de informa es desnecess rias a cada requisi o. Os servidores MCP que n o est o em uso tamb m podem aumentar o volume de dados enviado ao modelo. Desativ -los com o comando /mcp reduz esse carregamento autom tico. No entanto, conectar ou desconectar servidores MCP durante uma sess o e alternar entre modelos s o outras a es que podem reiniciar o cache da conversa. Fa a auditoria dos prompts Prompts muito longos ou com instru es repetidas tamb m podem aumentar o consumo. O comando /claude-api prompt-audit identifica problemas que podem fazer o modelo gastar tokens sem melhorar o resultado. Entre os pontos analisados est o instru es contradit rias e regras de verifica o que aumentam o n mero de etapas de uma tarefa. Em testes de migra o, a Anthropic registrou redu o adicional de at 9% nos custos ap s a limpeza dos prompts. Acompanhe o uso de tokens O acompanhamento do consumo ajuda a encontrar tarefas que gastam mais do que o esperado. O comando /usage mostra informa es sobre o uso da sess o, incluindo o consumo de tokens e a participa o do cache. Sess es que fogem muito do padr o podem indicar loops de repeti o, uso excessivo de ferramentas ou um n vel de esfor o maior do que o necess rio para aquela tarefa. A an lise desses casos ajuda a ajustar as configura es e evitar desperd cios nas pr ximas execu es. Se voc gostou do conte do, talvez tamb m se interesse por conferir “O custo invis vel dos tokens: por que a conta da IA n o para de subir?”. {{WHATSAPP_CHANNEL}}