GPT-6 Astra na API: modelo, parâmetros, preços, Bedrock e migração do GPT-5.6
Guia da API do GPT-6 Astra: ID gpt-6-astra, Responses API, níveis de esforço, contexto de 1,05 mi de tokens, cache, Bedrock, Agents API e migração do GPT-5.6.
Para usar o GPT-6 Astra na API da OpenAI, o nome do modelo é gpt-6-astra, a chamada deve passar pela Responses API se você quiser ferramentas, e o esforço de raciocínio vai de low a max (o valor none não é aceito). A janela de contexto é de 1.050.000 tokens, com até 128.000 tokens de saída. Este guia reúne o que a documentação oficial diz sobre parâmetros, preços, Amazon Bedrock, Azure, Agents API e migração do GPT-5.6, e fecha com um checklist para colocar em produção.
Informações conferidas nas páginas oficiais da OpenAI em 4 de outubro de 2026. Recursos, planos e preços mudam; confirme na fonte. Para a visão geral do modelo, veja GPT-6 Astra: o que é, o que muda e quem pode usar.
Um aviso sobre acesso: no anúncio de lançamento, em 3 de setembro, a OpenAI disse que a API começaria com parceiros selecionados e seria ampliada depois. A página de lançamento cita a API entre as formas de disponibilidade, mas confirme no painel da sua conta se o modelo já aparece para você.
Ficha técnica do modelo
Segundo a ficha do modelo no Amazon Bedrock, com o contexto e a saída máxima confirmados também em um anúncio da OpenAI na comunidade de desenvolvedores:
| Item | Valor |
|---|---|
| ID na API da OpenAI | gpt-6-astra |
| ID no Bedrock | openai.gpt-6-astra |
| Janela de contexto | 1.050.000 tokens |
| Saída máxima | 128.000 tokens |
| Corte de conhecimento | 30/04/2026 |
| Entrada | Texto e imagem |
| Saída | Apenas texto (sem áudio, vídeo ou imagem) |
Token é o pedaço de texto que o modelo processa (aproximadamente uma sílaba ou palavra curta) e a unidade de cobrança. A janela de contexto é o total de tokens que cabem de uma vez, somando o que você envia e o que o modelo devolve.
Responses API ou Chat Completions
A documentação do modelo indica o Astra "para o trabalho mais exigente de raciocínio, código e profissional" (tradução nossa) e diz que a Responses API é o caminho para chamada de ferramentas. A Chat Completions só serve quando você não usa ferramentas. Se o seu sistema atual usa Chat Completions com funções, planeje a mudança.
Ferramentas e recursos listados como suportados:
- uso de computador (computer use);
- Structured Outputs (respostas em formato estruturado definido por você);
- streaming (resposta chegando aos poucos);
- Programmatic Tool Calling;
- orquestração de vários agentes (multi-agent orchestration);
- prompt caching;
- raciocínio persistido (persisted reasoning);
- compaction (compactação do contexto);
- pro mode.
A documentação lida não detalha o funcionamento de cada item aqui; para a sintaxe de cada um, consulte o guia oficial.
Esforço de raciocínio
O Astra não aceita none. Os valores aceitos são low, medium, high, xhigh e max. O guia oficial da família GPT-6 associa os níveis a tipos de tarefa: Low para extrair fatos ou fazer pequenas edições; Medium para planejar uma funcionalidade ou comparar opções; High para depuração difícil, análise mais profunda ou revisão cuidadosa; Extra high e Max quando o High não basta. Em geral, mais esforço de raciocínio costuma aumentar o tempo de resposta e o consumo de tokens, e portanto o custo (observação nossa, não da documentação consultada); meça isso no seu caso.
Preços e cache
Preço padrão, por milhão de tokens, segundo a OpenAI:
| Item | US$ por 1 milhão de tokens |
|---|---|
| Entrada | 10 |
| Saída | 50 |
| Entrada em cache | 1 |
| Escrita de cache | 12,50 |
O modo Fast entrega 2x a velocidade por 2x o preço padrão, segundo a página de lançamento. A explicação completa de custos está em GPT-6 Astra: preço. Para escolher o modelo pelo custo, veja a comparação com o GPT-6.1 Sol e o GPT-5.6 Sol.
Cálculo hipotético, só aritmética com os preços oficiais: uma chamada com 200 mil tokens de entrada e 20 mil de saída custa 200.000 x 10 / 1.000.000 = US$ 2,00 de entrada, mais 20.000 x 50 / 1.000.000 = US$ 1,00 de saída, total de US$ 3,00. Se, em outra chamada, 150 mil dos 200 mil tokens de entrada forem lidos do cache, a entrada passa a ser 50.000 x 10 / 1.000.000 = US$ 0,50 mais 150.000 x 1 / 1.000.000 = US$ 0,15, totalizando US$ 0,65, e com a saída de US$ 1,00 a chamada fica em US$ 1,65. Esse segundo cálculo ignora o custo de escrita de cache da chamada anterior.
Migração do GPT-5.6 para o Astra
Os passos 1 a 3 abaixo vêm da documentação oficial; o 4 é recomendação nossa:
- Troque o parâmetro
prompt_cache_retentionporprompt_cache_options.ttl, com o valor"30m". - Mantenha o nível de esforço que você já usava como ponto de partida.
- Teste também um nível abaixo do atual; se a qualidade se mantiver, você pode economizar.
- Rode a sua própria bateria de testes antes de trocar o modelo em produção.
Também vale revisar os prompts. A OpenAI diz que o Astra tem mais probabilidade de pedir esclarecimentos. Se você quer que o modelo conclua a tarefa sem parar para perguntar, a documentação sugere instruções como "bias towards action and carry the user's intended task to completion" (em tradução livre: tenda a agir e leve a tarefa pretendida pelo usuário até o fim). O guia da família GPT-6 também avisa que instruções excessivamente específicas podem atrapalhar, pois os modelos entendem melhor nuances e ambiguidade.
Exemplo ilustrativo de requisição
Exemplo ilustrativo; confira a documentação para nomes exatos de campos e para o parâmetro de esforço de raciocínio. As páginas oficiais lidas citam o ID do modelo e o campo prompt_cache_options.ttl; o campo input é apenas ilustrativo:
{
"model": "gpt-6-astra",
"input": "Resuma o texto abaixo em 5 tópicos e liste dúvidas que ficaram em aberto: [texto]",
"prompt_cache_options": { "ttl": "30m" }
}
O nível de esforço (low, medium, high, xhigh ou max) entra nessa requisição pelo campo indicado na documentação oficial. Nunca coloque chaves de API no código-fonte nem em prompts.
Amazon Bedrock
O Astra está no Amazon Bedrock desde 8 de setembro de 2026, com ID openai.gpt-6-astra. A ficha da AWS informa fim de vida "não antes de 8 de setembro de 2027" (EOL no sooner than). Pontos de atenção:
- Contexto curto (até 272 mil tokens): Global CRIS a US$ 10 de entrada e US$ 50 de saída; In-Region ou Geo a US$ 11 e US$ 55.
- Contexto longo (acima de 272 mil tokens): Global a US$ 20 e US$ 75; In-Region ou Geo a US$ 22 e US$ 82,50.
- Ultrafast custa 6x o preço padrão correspondente.
- Os tiers Priority e Flex não são suportados no Bedrock.
Na prática, encher a janela de 1,05 milhão de tokens no Bedrock pode custar mais por token do que um prompt curto. Segundo a ficha da AWS, o modelo tem inferência in-region em us-east-1 e us-west-2 (esta última apenas no tier Standard) e inferência cross-region Geo ou Global em regiões dos EUA, do Canadá, da União Europeia e da Ásia-Pacífico. A lista de regiões muda com o tempo; confirme na documentação da AWS antes de planejar residência de dados.
Azure
A OpenAI cita o Microsoft Azure entre as plataformas onde o Astra está disponível. Não há, nas fontes lidas, detalhes de regiões, preços ou limites no Azure; consulte a documentação da Microsoft.
Agents API (beta)
A Agents API está em beta e é descrita como "agentes de nuvem duráveis com um harness Codex gerenciado" (tradução nossa). Um agente é um programa de IA que executa várias etapas e usa ferramentas por conta própria. Pontos oficiais:
- Uso via cabeçalho
OpenAI-Beta: agents=v1. - A residência de dados é apenas nos EUA.
- Não há retenção zero de dados (ZDR) nessa API.
Por isso, se você depende de ZDR ou de residência de dados em outra região, a Agents API pode não servir. A OpenAI diz que há zero data retention para clientes elegíveis da API em geral; a exceção acima vale para a Agents API em beta. Para decisões de privacidade, leia também IA e privacidade.
Checklist de produção
- Custos: estime o gasto por tarefa com a fórmula de tokens (veja GPT-6 Astra: preço), defina limites de gasto e alertas e use cache para prefixos repetidos.
- Esforço: comece baixo e suba só onde a qualidade pedir; registre o nível usado em cada chamada.
- Modelo certo por tarefa: use um modelo menor ou o GPT-6.1 Sol quando o Astra for exagero. Veja a comparação.
- Logs: guarde requisição, versão do prompt, nível de esforço, tokens e resultado, sem registrar dados pessoais ou segredos.
- Aprovação humana: para ações que gastam dinheiro, alteram dados, enviam mensagens ou mexem em contas, exija confirmação de uma pessoa.
- Escopo das ferramentas: dê ao agente só as permissões necessárias, com credenciais de menor privilégio.
- Testes: monte um conjunto de casos reais e compare com o modelo atual antes de migrar. Os números de benchmark da OpenAI são alegações da empresa, e nenhuma avaliação independente foi lida para este artigo.
- Segurança: a OpenAI classifica o Astra no nível Crítico em cibersegurança e diz que as verificações podem interromper trabalho legítimo. Se o seu produto lida com segurança, trate recusas e interrupções como cenário esperado. Veja limitações e quando não usar o Astra.
- Plano B: tenha um modelo alternativo e trate erros de limite e indisponibilidade.
Se o seu uso é programação dentro do ChatGPT, e não integração por API, o caminho é o Codex: veja GPT-6 Astra no Codex.
Perguntas frequentes
Artigos relacionados
GPT-6 Astra: o que é, o que muda e quem pode usar
GPT-6 Astra é o modelo mais capaz da OpenAI para código, pesquisa e tarefas de várias etapas. Veja o que é, ficha técnica, onde usar, preço e para quem serve.
GPT-6 Astra: preço na API, planos e como calcular o custo
Quanto custa o GPT-6 Astra: US$ 10 por milhão de tokens de entrada e US$ 50 de saída na API, cache, Fast, Bedrock e cálculos hipotéticos para estimar o gasto.
GPT-6 Astra no Codex: como programar com o modelo e quando vale usar
Veja o que é o Codex, quais modelos ele oferece (Astra, GPT-6.1 Sol, Sol e Luna), como escolher o esforço de raciocínio e um prompt pronto para código.