ChatGPT

GPT-6 Astra na API: modelo, parâmetros, preços, Bedrock e migração do GPT-5.6

Guia da API do GPT-6 Astra: ID gpt-6-astra, Responses API, níveis de esforço, contexto de 1,05 mi de tokens, cache, Bedrock, Agents API e migração do GPT-5.6.

Equipe Foco em IA9 min de leitura

Para usar o GPT-6 Astra na API da OpenAI, o nome do modelo é gpt-6-astra, a chamada deve passar pela Responses API se você quiser ferramentas, e o esforço de raciocínio vai de low a max (o valor none não é aceito). A janela de contexto é de 1.050.000 tokens, com até 128.000 tokens de saída. Este guia reúne o que a documentação oficial diz sobre parâmetros, preços, Amazon Bedrock, Azure, Agents API e migração do GPT-5.6, e fecha com um checklist para colocar em produção.

Informações conferidas nas páginas oficiais da OpenAI em 4 de outubro de 2026. Recursos, planos e preços mudam; confirme na fonte. Para a visão geral do modelo, veja GPT-6 Astra: o que é, o que muda e quem pode usar.

Um aviso sobre acesso: no anúncio de lançamento, em 3 de setembro, a OpenAI disse que a API começaria com parceiros selecionados e seria ampliada depois. A página de lançamento cita a API entre as formas de disponibilidade, mas confirme no painel da sua conta se o modelo já aparece para você.

Ficha técnica do modelo

Segundo a ficha do modelo no Amazon Bedrock, com o contexto e a saída máxima confirmados também em um anúncio da OpenAI na comunidade de desenvolvedores:

ItemValor
ID na API da OpenAIgpt-6-astra
ID no Bedrockopenai.gpt-6-astra
Janela de contexto1.050.000 tokens
Saída máxima128.000 tokens
Corte de conhecimento30/04/2026
EntradaTexto e imagem
SaídaApenas texto (sem áudio, vídeo ou imagem)

Token é o pedaço de texto que o modelo processa (aproximadamente uma sílaba ou palavra curta) e a unidade de cobrança. A janela de contexto é o total de tokens que cabem de uma vez, somando o que você envia e o que o modelo devolve.

Responses API ou Chat Completions

A documentação do modelo indica o Astra "para o trabalho mais exigente de raciocínio, código e profissional" (tradução nossa) e diz que a Responses API é o caminho para chamada de ferramentas. A Chat Completions só serve quando você não usa ferramentas. Se o seu sistema atual usa Chat Completions com funções, planeje a mudança.

Ferramentas e recursos listados como suportados:

  • uso de computador (computer use);
  • Structured Outputs (respostas em formato estruturado definido por você);
  • streaming (resposta chegando aos poucos);
  • Programmatic Tool Calling;
  • orquestração de vários agentes (multi-agent orchestration);
  • prompt caching;
  • raciocínio persistido (persisted reasoning);
  • compaction (compactação do contexto);
  • pro mode.

A documentação lida não detalha o funcionamento de cada item aqui; para a sintaxe de cada um, consulte o guia oficial.

Esforço de raciocínio

O Astra não aceita none. Os valores aceitos são low, medium, high, xhigh e max. O guia oficial da família GPT-6 associa os níveis a tipos de tarefa: Low para extrair fatos ou fazer pequenas edições; Medium para planejar uma funcionalidade ou comparar opções; High para depuração difícil, análise mais profunda ou revisão cuidadosa; Extra high e Max quando o High não basta. Em geral, mais esforço de raciocínio costuma aumentar o tempo de resposta e o consumo de tokens, e portanto o custo (observação nossa, não da documentação consultada); meça isso no seu caso.

Preços e cache

Preço padrão, por milhão de tokens, segundo a OpenAI:

ItemUS$ por 1 milhão de tokens
Entrada10
Saída50
Entrada em cache1
Escrita de cache12,50

O modo Fast entrega 2x a velocidade por 2x o preço padrão, segundo a página de lançamento. A explicação completa de custos está em GPT-6 Astra: preço. Para escolher o modelo pelo custo, veja a comparação com o GPT-6.1 Sol e o GPT-5.6 Sol.

Cálculo hipotético, só aritmética com os preços oficiais: uma chamada com 200 mil tokens de entrada e 20 mil de saída custa 200.000 x 10 / 1.000.000 = US$ 2,00 de entrada, mais 20.000 x 50 / 1.000.000 = US$ 1,00 de saída, total de US$ 3,00. Se, em outra chamada, 150 mil dos 200 mil tokens de entrada forem lidos do cache, a entrada passa a ser 50.000 x 10 / 1.000.000 = US$ 0,50 mais 150.000 x 1 / 1.000.000 = US$ 0,15, totalizando US$ 0,65, e com a saída de US$ 1,00 a chamada fica em US$ 1,65. Esse segundo cálculo ignora o custo de escrita de cache da chamada anterior.

Migração do GPT-5.6 para o Astra

Os passos 1 a 3 abaixo vêm da documentação oficial; o 4 é recomendação nossa:

  1. Troque o parâmetro prompt_cache_retention por prompt_cache_options.ttl, com o valor "30m".
  2. Mantenha o nível de esforço que você já usava como ponto de partida.
  3. Teste também um nível abaixo do atual; se a qualidade se mantiver, você pode economizar.
  4. Rode a sua própria bateria de testes antes de trocar o modelo em produção.

Também vale revisar os prompts. A OpenAI diz que o Astra tem mais probabilidade de pedir esclarecimentos. Se você quer que o modelo conclua a tarefa sem parar para perguntar, a documentação sugere instruções como "bias towards action and carry the user's intended task to completion" (em tradução livre: tenda a agir e leve a tarefa pretendida pelo usuário até o fim). O guia da família GPT-6 também avisa que instruções excessivamente específicas podem atrapalhar, pois os modelos entendem melhor nuances e ambiguidade.

Exemplo ilustrativo de requisição

Exemplo ilustrativo; confira a documentação para nomes exatos de campos e para o parâmetro de esforço de raciocínio. As páginas oficiais lidas citam o ID do modelo e o campo prompt_cache_options.ttl; o campo input é apenas ilustrativo:

{
  "model": "gpt-6-astra",
  "input": "Resuma o texto abaixo em 5 tópicos e liste dúvidas que ficaram em aberto: [texto]",
  "prompt_cache_options": { "ttl": "30m" }
}

O nível de esforço (low, medium, high, xhigh ou max) entra nessa requisição pelo campo indicado na documentação oficial. Nunca coloque chaves de API no código-fonte nem em prompts.

Amazon Bedrock

O Astra está no Amazon Bedrock desde 8 de setembro de 2026, com ID openai.gpt-6-astra. A ficha da AWS informa fim de vida "não antes de 8 de setembro de 2027" (EOL no sooner than). Pontos de atenção:

  • Contexto curto (até 272 mil tokens): Global CRIS a US$ 10 de entrada e US$ 50 de saída; In-Region ou Geo a US$ 11 e US$ 55.
  • Contexto longo (acima de 272 mil tokens): Global a US$ 20 e US$ 75; In-Region ou Geo a US$ 22 e US$ 82,50.
  • Ultrafast custa 6x o preço padrão correspondente.
  • Os tiers Priority e Flex não são suportados no Bedrock.

Na prática, encher a janela de 1,05 milhão de tokens no Bedrock pode custar mais por token do que um prompt curto. Segundo a ficha da AWS, o modelo tem inferência in-region em us-east-1 e us-west-2 (esta última apenas no tier Standard) e inferência cross-region Geo ou Global em regiões dos EUA, do Canadá, da União Europeia e da Ásia-Pacífico. A lista de regiões muda com o tempo; confirme na documentação da AWS antes de planejar residência de dados.

Azure

A OpenAI cita o Microsoft Azure entre as plataformas onde o Astra está disponível. Não há, nas fontes lidas, detalhes de regiões, preços ou limites no Azure; consulte a documentação da Microsoft.

Agents API (beta)

A Agents API está em beta e é descrita como "agentes de nuvem duráveis com um harness Codex gerenciado" (tradução nossa). Um agente é um programa de IA que executa várias etapas e usa ferramentas por conta própria. Pontos oficiais:

  • Uso via cabeçalho OpenAI-Beta: agents=v1.
  • A residência de dados é apenas nos EUA.
  • Não há retenção zero de dados (ZDR) nessa API.

Por isso, se você depende de ZDR ou de residência de dados em outra região, a Agents API pode não servir. A OpenAI diz que há zero data retention para clientes elegíveis da API em geral; a exceção acima vale para a Agents API em beta. Para decisões de privacidade, leia também IA e privacidade.

Checklist de produção

  1. Custos: estime o gasto por tarefa com a fórmula de tokens (veja GPT-6 Astra: preço), defina limites de gasto e alertas e use cache para prefixos repetidos.
  2. Esforço: comece baixo e suba só onde a qualidade pedir; registre o nível usado em cada chamada.
  3. Modelo certo por tarefa: use um modelo menor ou o GPT-6.1 Sol quando o Astra for exagero. Veja a comparação.
  4. Logs: guarde requisição, versão do prompt, nível de esforço, tokens e resultado, sem registrar dados pessoais ou segredos.
  5. Aprovação humana: para ações que gastam dinheiro, alteram dados, enviam mensagens ou mexem em contas, exija confirmação de uma pessoa.
  6. Escopo das ferramentas: dê ao agente só as permissões necessárias, com credenciais de menor privilégio.
  7. Testes: monte um conjunto de casos reais e compare com o modelo atual antes de migrar. Os números de benchmark da OpenAI são alegações da empresa, e nenhuma avaliação independente foi lida para este artigo.
  8. Segurança: a OpenAI classifica o Astra no nível Crítico em cibersegurança e diz que as verificações podem interromper trabalho legítimo. Se o seu produto lida com segurança, trate recusas e interrupções como cenário esperado. Veja limitações e quando não usar o Astra.
  9. Plano B: tenha um modelo alternativo e trate erros de limite e indisponibilidade.

Se o seu uso é programação dentro do ChatGPT, e não integração por API, o caminho é o Codex: veja GPT-6 Astra no Codex.

Perguntas frequentes

#GPT-6 Astra#API OpenAI#Responses API#Amazon Bedrock#desenvolvedores#migração
Compartilhar artigo