GPT-6 Astra: preço na API, planos e como calcular o custo
Quanto custa o GPT-6 Astra: US$ 10 por milhão de tokens de entrada e US$ 50 de saída na API, cache, Fast, Bedrock e cálculos hipotéticos para estimar o gasto.
O GPT-6 Astra custa, na API padrão da OpenAI, US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Quem usa o Astra pelo ChatGPT não é cobrado por token: o acesso vem dentro de um plano pago, com limites de uso e, em alguns planos, créditos adicionais opcionais. Neste guia você vê os preços oficiais, entende o que é token, aprende a fórmula de custo e confere três cálculos hipotéticos para estimar o seu gasto.
Informações conferidas nas páginas oficiais da OpenAI em 4 de outubro de 2026. Recursos, planos e preços mudam; confirme na fonte.
Para saber o que é o modelo antes de olhar o custo, veja GPT-6 Astra: o que é, o que muda e quem pode usar.
Duas formas de pagar pelo GPT-6 Astra
- Dentro de um plano do ChatGPT. O Astra aparece em planos pagos, no Work e no Codex (e como "GPT-6 Pro" no Chat de alguns planos). Plus e Business Standard têm uso limitado do Astra, com créditos adicionais opcionais. Free e Go não o incluem. Os valores mensais dos planos devem ser consultados na página oficial de planos; neste artigo não há preço de plano e não há preço em reais. O acesso por plano está em como acessar o GPT-6 Astra no ChatGPT.
- Por token, via API ou nuvem. Desenvolvedores e empresas pagam pelo volume de texto processado, na API da OpenAI ou em provedores como o Amazon Bedrock. É o preço de que trata o restante do artigo.
Preços da API da OpenAI
Segundo a página da OpenAI sobre o Astra para trabalho, os preços por milhão de tokens são:
| Item | Preço por 1 milhão de tokens |
|---|---|
| Entrada padrão | US$ 10,00 |
| Saída padrão | US$ 50,00 |
| Entrada em cache (leitura) | US$ 1,00 |
| Escrita de cache | US$ 12,50 |
Pela página de lançamento, há também o modo Fast: 2 vezes a velocidade pelo dobro do preço padrão, ou seja, US$ 20 de entrada e US$ 100 de saída por milhão de tokens.
Quatro termos para ler essa tabela:
- Token: pedaço de texto que o modelo lê e escreve, que pode ser parte de uma palavra, uma palavra curta ou pontuação. O preço é cobrado por tokens, não por palavras.
- Entrada: tudo o que você envia (instruções, documentos, histórico da conversa).
- Saída: o que o modelo escreve de volta. É cinco vezes mais cara que a entrada no Astra.
- Cache de prompt: o modelo guarda um trecho fixo do seu pedido (por exemplo, um manual longo) para não reprocessá-lo a cada chamada. Ler do cache custa menos; gravar no cache custa um pouco mais na primeira vez.
Preços no Amazon Bedrock
O Astra também está no Amazon Bedrock desde 8 de setembro de 2026. A página do modelo na AWS separa o preço pelo tamanho do contexto e pelo tipo de roteamento:
| Contexto | Global (CRIS) | In-Region ou Geo |
|---|---|---|
| Curto (até 272 mil tokens) | US$ 10 entrada e US$ 50 saída | US$ 11 entrada e US$ 55 saída |
| Longo (acima de 272 mil tokens) | US$ 20 entrada e US$ 75 saída | US$ 22 entrada e US$ 82,50 saída |
Valores por milhão de tokens. Dois detalhes:
- "Global (CRIS)" e "In-Region ou Geo" são as duas opções de roteamento que a AWS lista. Pela tabela, a segunda custa 10% a mais (conta direta sobre os valores). Para saber qual atende às suas regras de localização de dados, consulte a documentação da AWS.
- O nível Ultrafast custa 6 vezes o padrão correspondente. Os níveis de serviço Priority e Flex não são suportados no Bedrock.
Como calcular o custo de uma tarefa
A conta usa os tokens enviados e recebidos e o preço de cada um:
custo = (tokens de entrada / 1.000.000 x preço da entrada)
+ (tokens de saída / 1.000.000 x preço da saída)
Para entrada em cache, use o preço de cache sobre os tokens lidos dele. Para estimar seus tokens, rode algumas tarefas reais e anote os números de entrada e saída que a plataforma informar. Se o modelo gera texto de raciocínio interno, confira na documentação da OpenAI como ele entra na contagem de saída.
Três cálculos hipotéticos
Os exemplos usam os preços oficiais desta página, mas as tarefas e os volumes são inventados para ilustrar a conta.
Cálculo hipotético 1: a mesma tarefa em quatro modelos
Tarefa com 200 mil tokens de entrada e 20 mil tokens de saída (por exemplo, analisar um conjunto grande de documentos e devolver um relatório).
| Modelo (preços de API por milhão de tokens) | Entrada | Saída | Total |
|---|---|---|---|
| GPT-6 Astra (US$ 10 e US$ 50) | US$ 2,00 | US$ 1,00 | US$ 3,00 |
| GPT-6.1 Sol (US$ 2 e US$ 10) | US$ 0,40 | US$ 0,20 | US$ 0,60 |
| Claude Opus 5.5 (US$ 4 e US$ 20) | US$ 0,80 | US$ 0,40 | US$ 1,20 |
| Claude Fable 5.1 (US$ 10 e US$ 50) | US$ 2,00 | US$ 1,00 | US$ 3,00 |
Os preços do GPT-6.1 Sol vêm da página de lançamento dele, e os dos modelos Claude, da página de preços da Anthropic. É só aritmética: o preço não diz nada sobre qualidade nem sobre quantos tokens cada modelo consome para fazer a mesma tarefa. Para a comparação entre as famílias, veja Astra, Claude Opus 5.5 e Gemini.
Cálculo hipotético 2: assistente com um manual fixo e cache
Um assistente interno responde 50 perguntas sobre um manual de 100 mil tokens. Cada pergunta acrescenta 1 mil tokens de entrada e gera 2 mil tokens de saída.
- Sem cache: 50 chamadas com 101 mil tokens de entrada = 5,05 milhões de tokens x US$ 10 = US$ 50,50. Saída: 100 mil tokens x US$ 50 por milhão = US$ 5,00. Total: US$ 55,50.
- Com cache (supondo que as 50 chamadas ocorram dentro do prazo de validade do cache): uma escrita de 100 mil tokens x US$ 12,50 por milhão = US$ 1,25; 49 leituras de 100 mil tokens = 4,9 milhões x US$ 1 = US$ 4,90; 50 mil tokens novos de entrada x US$ 10 = US$ 0,50; saída = US$ 5,00. Total: US$ 11,65.
Nesse cenário, o cache deixa o gasto em menos de um quarto do valor, porque o trecho repetido é a maior parte da entrada. Se o trecho fixo for pequeno ou mudar a cada chamada, a economia some.
Cálculo hipotético 3: velocidade e contexto longo custam mais
Com a tarefa do primeiro cálculo (200 mil tokens de entrada e 20 mil de saída):
- Modo Fast na API da OpenAI (2x o preço): US$ 3,00 x 2 = US$ 6,00.
- Bedrock, Ultrafast, Global, contexto curto (6x): US$ 3,00 x 6 = US$ 18,00.
Agora uma tarefa com 300 mil tokens de entrada e 20 mil de saída no Bedrock, que passa do limite de 272 mil e entra na faixa de contexto longo:
- Global: 0,3 x US$ 20 = US$ 6,00; 0,02 x US$ 75 = US$ 1,50. Total: US$ 7,50.
- In-Region ou Geo: 0,3 x US$ 22 = US$ 6,60; 0,02 x US$ 82,50 = US$ 1,65. Total: US$ 8,25.
Esse cálculo supõe que a chamada inteira seja cobrada na faixa de contexto longo. A lição prática: o preço por token da faixa longa é o dobro do da faixa curta no Global (US$ 20 contra US$ 10 de entrada), então, se der para dividir o material e ficar abaixo de 272 mil tokens, o custo por token cai. Confirme na documentação da AWS como a cobrança é aplicada antes de planejar volume.
Como reduzir o custo
- Use cache quando uma parte grande do pedido se repete (manuais, regras, base de conhecimento).
- Ajuste o esforço de raciocínio. No guia da OpenAI para a família GPT-6, o esforço Low é indicado para extrair fatos ou fazer pequenas edições, e níveis mais altos para depuração difícil e análise profunda. Na migração do GPT-5.6, a documentação da API da OpenAI orienta manter o esforço atual como base e testar um nível abaixo.
- Escolha o modelo certo para cada etapa. O GPT-6.1 Sol custa um quinto do Astra na API e, segundo a OpenAI, tem inteligência próxima à dele para código, uso de computador e trabalho profissional. O Luna é indicado pela OpenAI para tarefas focadas, em volume. Os detalhes estão em Astra, GPT-6.1 Sol e GPT-5.6 Sol.
- Limite a saída. Peça respostas objetivas e em formato fixo. Como a saída custa cinco vezes mais que a entrada, texto desnecessário pesa.
- Evite modos mais caros por hábito. Fast e Ultrafast só valem quando a velocidade tem valor real para o seu fluxo.
- Meça antes de escalar. Rode uma amostra pequena, calcule o custo por tarefa e só então multiplique pelo volume.
Para estruturar essa conta como retorno sobre investimento, veja ROI de inteligência artificial. Para implementar, o guia de GPT-6 Astra na API cobre cache e configuração.
Quando o Astra compensa
| Situação | O que considerar |
|---|---|
| Tarefa longa e difícil, com custo alto de erro | O preço por token pesa menos que o retrabalho; vale testar o Astra |
| Tarefa de código, pesquisa ou uso de computador em que o GPT-6.1 Sol já resolve | O GPT-6.1 Sol custa um quinto na API; compare os resultados antes de pagar mais |
| Tarefa simples e repetida em grande volume | Um modelo menor tende a fechar a conta melhor |
| Contexto acima de 272 mil tokens no Bedrock | O preço sobe de faixa; avalie dividir o material |
| Uso pontual por pessoa, sem API | O plano com Astra pode ser mais simples que montar uma integração |
| Orçamento muito apertado | Comece pelo modelo mais barato que atenda e suba só se necessário |
A decisão final deve vir de um teste com a sua tarefa: qualidade do resultado, tokens consumidos e tempo de revisão humana. Para uma visão dos riscos e dos casos em que o Astra não é a melhor escolha, veja limitações do GPT-6 Astra e quando não usar.
Perguntas frequentes
Artigos relacionados
GPT-6 Astra: o que é, o que muda e quem pode usar
GPT-6 Astra é o modelo mais capaz da OpenAI para código, pesquisa e tarefas de várias etapas. Veja o que é, ficha técnica, onde usar, preço e para quem serve.
Como acessar o GPT-6 Astra no ChatGPT: Chat, Work e Codex por plano
Veja onde o GPT-6 Astra aparece no ChatGPT em cada plano (Chat, Work e Codex), por que o Plus não o vê no Chat e o que checar se ele não aparece na sua conta.
GPT-6 Astra vs GPT-6.1 Sol vs GPT-5.6 Sol: qual modelo da OpenAI escolher
Astra, GPT-6.1 Sol, GPT-6 Sol, Luna ou GPT-5.6 Sol? Veja onde cada modelo aparece no ChatGPT, quanto custa na API e qual escolher para cada tipo de tarefa.