Pular para o conteúdo

Tradução de protocolos

Qualquer modelo em qualquer endpoint, o que é encaminhado sem alterações e o que a tradução não consegue preservar.

Todos os modelos podem ser acessados por qualquer endpoint. Solicitar um modelo Claude por /v1/responses ou um modelo GPT por /v1/messages é uma solicitação compatível.

Isso permite que um cliente que usa um protocolo acesse modelos de fornecedores que usam outro, sem precisar executar um segundo gateway.

Endpoint Protocolo Clientes típicos
/v1/chat/completions Chat Completions da OpenAI SDKs da OpenAI, OpenClaw, Hermes, maioria dos editores
/v1/messages Messages da Anthropic SDKs da Anthropic, Claude Code
/v1/responses Responses da OpenAI Codex, SDKs mais recentes da OpenAI

As credenciais são aceitas como Authorization: Bearer, x-api-key ou api-key, porque os clientes divergem quanto a qual formato enviar.

Quando nada é traduzido

Se o endpoint e o provedor do modelo já usam o mesmo protocolo, o corpo da solicitação é encaminhado em vez de ser reconstruído. Apenas o ID do modelo é reescrito.

Pontos de interrupção de cache, assinaturas de raciocínio e campos que Webway desconhece chegam ao provedor sem alterações, e um recurso lançado pelo provedor depois da publicação desta página funciona no mesmo dia em que é lançado.

O que a tradução não consegue preservar

Fora desse caminho, alguns elementos não têm equivalente no protocolo de destino:

  • Pontos de interrupção de cache são descartados quando o destino é Chat Completions, que não tem cache_control. Nesse caso, os provedores armazenam dados em cache implicitamente, portanto a perda é de controle, não financeira.
  • Assinaturas de raciocínio são a prova do provedor de que um bloco de raciocínio foi devolvido sem modificações. Elas são específicas do provedor que as emitiu e não podem ser transferidas para o protocolo de outro, portanto são descartadas em vez de falsificadas.
  • previous_response_id é recusado com um 400. Webway não armazena o estado da conversa; envie o array input completo. Ignorar esse campo descartaria silenciosamente seu histórico.

Ferramentas, resultados de ferramentas, imagens, prompts do sistema, motivos de interrupção, ordem do streaming e contagens de tokens são preservados nos dois sentidos.

Contagem de tokens

/v1/messages/count_tokens está disponível para todos os modelos, inclusive aqueles cujos provedores não oferecem esse recurso, para que o medidor de contexto do Claude Code funcione em todos eles. As contagens desses modelos são estimativas.

A entrada armazenada em cache é cobrada pela tarifa de cache, e as gravações em cache, pela tarifa de gravação. O uso é normalizado antes de chegar à sua fatura: a Anthropic exclui os tokens armazenados em cache de input_tokens, enquanto a OpenAI os inclui em prompt_tokens, e GET /v1/models publica cada tarifa separadamente.