Produto Cloudflare

Conheça o
AI Gateway

Observe e controle suas aplicações de IA com analytics, caching, rate limiting e fallback de modelos.

Analogia

Imagine um pedágio inteligente para chamadas de IA. Todo carro (request) passa por ele, é inspecionado, contado, e pode até pegar um atalho (cache). Você tem controle total sobre o tráfego sem precisar mudar os carros.

Role para baixo
1Visão Geral

O que é o AI Gateway?

Pense assim...

O AI Gateway é como um pedágio inteligente para suas chamadas de IA. Todo 'carro' (request) passa por ele, é inspecionado, contado, e pode até pegar um atalho (cache). Você tem controle total sobre o tráfego sem precisar modificar os carros.

O AI Gateway da Cloudflare permite que você observe e controle suas aplicações de IA. Conecte suas apps ao Gateway e tenha visibilidade completa sobre como as pessoas estão usando sua aplicação.

📊

Observabilidade

Veja métricas de requests, tokens, custos e erros em tempo real

Performance

Cache respostas frequentes e reduza latência dramaticamente

🛡️

Controle

Rate limiting, fallbacks e roteamento inteligente

🔌

Uma linha de código

Integração instantânea sem mudar sua lógica de aplicação

2Provedores de IA

Conecte com Qualquer Provedor

Pense assim...

É como um adaptador universal de tomadas. Você conecta uma vez ao AI Gateway e ele 'fala' com qualquer provedor de IA — OpenAI, Anthropic, Google, ou até modelos open-source na edge.

O AI Gateway suporta os principais provedores de IA do mercado. Use a mesma interface para acessar diferentes modelos e troque entre eles sem mudar seu código.

Sua AppFrontend / BackendAI GatewayCloudflareOpenAIGPT-4, GPT-3.5AnthropicClaudeGoogleGeminiWorkers AICloudflare

Clique em um nó para ver mais detalhes

Provedores Suportados

OAI
OpenAI
A
Anthropic
G
Google
CF
Workers AI
Az
Azure OpenAI
AWS
AWS Bedrock
R
Replicate
+
E mais...
3Observabilidade

Analytics em Tempo Real

Pense assim...

É como o painel do seu carro: você vê quantos quilômetros rodou (requests), quanto gastou de combustível (tokens), e se alguma luz de alerta acendeu (erros). Tudo em tempo real.

Visualize métricas detalhadas sobre o uso da sua aplicação de IA. Entenda padrões de tráfego, consumo de tokens e identifique problemas antes que afetem seus usuários.

Como funcionam os Analytics

📊
Coleta
📈
Métricas
📱
Dashboard
💡
Insights

Cada request é registrado

Requests

Total de chamadas

Tokens

Consumo detalhado

Custos

Por provedor/modelo

Erros

Monitoramento

4Performance

Caching Inteligente

Pense assim...

Sabe quando você pergunta a mesma coisa duas vezes e seu amigo responde 'já te disse!'? O cache faz isso — guarda a resposta e entrega instantaneamente na próxima vez. Zero tokens gastos.

O AI Gateway pode cachear respostas de provedores de IA, servindo-as diretamente do cache da Cloudflare para requests idênticos. Isso significa respostas mais rápidas e economia significativa.

Como funciona o Caching

📤
Request
🔍
Cache Check
Cache Hit!
💰
Economia

App envia pergunta para o AI Gateway

Latência Reduzida

Respostas do cache chegam em milissegundos, não segundos

💰

Economia de Custos

Requests cacheados não consomem tokens do provedor

⚙️

TTL Configurável

Defina por quanto tempo cada resposta fica no cache

Ideal para:

  • Bots de suporte com opções de resposta limitadas
  • FAQs e perguntas frequentes
  • Traduções de textos estáticos
  • Respostas padronizadas em aplicações
5Controle de Tráfego

Rate Limiting

Pense assim...

Como o controle de lotação de uma balada. Se entrar gente demais, você fecha a porta por um tempo. Isso protege você de gastos excessivos e comportamento suspeito.

Controle o tráfego que chega à sua aplicação definindo limites de requests por período. Previna custos inesperados e proteja contra abuso.

Como funciona o Rate Limiting

📥
Requests
🔢
Contador
🛑
Limite
🛡️
Proteção

Múltiplas requisições chegam

📊Fixed Window

Limite baseado em janelas de tempo fixas. Ex: máximo de 100 requests entre 12:00-12:10, depois reseta para 12:10-12:20.

Exemplo: 100 requests / 10 minutos

📈Sliding Window

Limite baseado nos últimos X minutos. Mais preciso e suave, evita picos de requests na borda das janelas.

Exemplo: máximo 100 requests nos últimos 10 minutos
6Roteamento Inteligente

Dynamic Routing

Pense assim...

Como um GPS inteligente que muda a rota conforme o trânsito. Se um modelo está lento ou fora do ar, o Gateway automaticamente tenta outro. Você define as regras, ele executa.

Crie fluxos de roteamento visuais ou via JSON. Defina condições, quotas, e fallbacks sem tocar no código da aplicação.

Como funciona o Dynamic Routing

📤
Request
⚖️
Avaliação
🎯
Decisão
🔄
Fallback

App envia requisição

🎯

Roteamento Condicional

Direcione usuários pagos para modelos premium, gratuitos para modelos básicos

⚖️

A/B Testing

Teste diferentes modelos com porcentagens de tráfego

🔄

Fallbacks Automáticos

Se um provedor falha, tente outro automaticamente

💵

Budget Limits

Defina limites de custo por usuário, projeto ou time

7BYOK & Unified Billing

Segurança & Gerenciamento de Chaves

Pense assim...

Você guarda suas chaves no cofre da Cloudflare, não no bolso onde podem ser roubadas. O Gateway injeta as credenciais no momento certo, sem expor nos headers.

Centralize o gerenciamento de API keys e simplifique o billing com opções flexíveis.

🔐

BYOK (Bring Your Own Keys)

Secrets Store

Armazene suas API keys de forma segura no Secrets Store da Cloudflare. O Gateway injeta as credenciais em runtime — sem chaves em texto plano nos requests.

💳

Unified Billing

Créditos Centralizados

Elimine API keys individuais completamente. Use créditos pré-pagos da Cloudflare para Workers AI e provedores terceiros suportados.

8Integração

Como Começar

Pense assim...

É como trocar o endereço de entrega dos seus pedidos. O conteúdo é o mesmo, só muda para onde vai. Uma linha de código e você está usando o AI Gateway.

A integração é simples: altere a URL base das suas chamadas de API. Todo o resto permanece igual.

Opção 1: Provider-specific endpoint

Mudança mínima no código javascript
// Antes: chamando OpenAI diretamente
const response = await fetch('https://api.openai.com/v1/chat/completions', {
  headers: { 'Authorization': 'Bearer sk-...' },
  // ...
});

// Depois: uma linha de mudança para usar AI Gateway
const response = await fetch('https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai/chat/completions', {
  headers: { 'Authorization': 'Bearer sk-...' },
  // ... mesmo payload
});

Opção 2: REST API Unificada

Uma API para todos os provedores bash
// Usando a REST API unificada da Cloudflare
curl -X POST "https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions" \
  --header "Authorization: Bearer {cloudflare_token}" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "openai/gpt-4.1-mini",
    "messages": [{"role": "user", "content": "Olá!"}]
  }'