Cost Optimization

Preços e Economia de Prompt Caching: Anthropic vs OpenAI vs DeepSeek

Resposta Rápida: O prompt caching reduz os custos de entrada em APIs de LLM entre 50% e 90% e corta a latência TTFT em até 85% ao reutilizar tensores do KV cache entre requisições. A Anthropic oferece 90% de desconto de leitura com breakpoints explícitos (a partir de 1.024 tokens). A OpenAI fornece 50% de desconto automático sem taxa de escrita. A DeepSeek viabiliza 80% a 90% de economia com limite ultra baixo de 64 tokens e persistência NVMe.


1. Introdução: A economia do estado em APIs de LLM sem estado (Stateless)

As APIs modernas de Grandes Modelos de Linguagem (LLMs) são historicamente concebidas como sem estado (stateless): cada requisição HTTP POST enviada para /v1/chat/completions ou /v1/messages deve fornecer o histórico de diálogo completo, instruções de sistema, esquemas de ferramentas e documentos contextuais. Embora esse modelo simplifique o balanceamento de carga e o escalonamento horizontal em clusters de GPUs, ele impõe um custo computacional e financeiro gigantesco a fluxos de trabalho com agentes autônomos.

Em loops de agentes autônomos — como Claude Code, Roo Code, Aider, Devin ou pipelines corporativos de RAG — o agente retransmite repetidamente prompts de sistema idênticos, definições OpenAPI e estruturas de repositórios. No 15º turno de uma sessão típica de engenharia de software, 95% a 98% dos tokens transmitidos são prefixos estáticos que o modelo já ingeriu anteriormente.

No modelo tradicional, os provedores em nuvem cobravam a tarifa cheia por cada token a cada interação, obrigando os aceleradores a recalcularem multiplicações de matrizes pesadas (fase de prefill) sobre contexto inalterado. O Prompt Caching resolve essa ineficiência de forma definitiva. Ao reter os tensores Key-Value (KV) pré-computados na memória HBM da GPU, na memória RAM do servidor ou em unidades SSD NVMe ultrarrápidas, o motor de inferência ignora o prefill redundante.

Equipes de engenharia que aplicam prompt caching sistemático alcançam rotineiramente cortes de 60% a 88% nas faturas de API, reduzindo o Time-to-First-Token (TTFT) de vários segundos para algumas centenas de milissegundos.


2. Análise Arquitetural: Mecânica do KV Cache e o Gargalo do Prefill

Para dominar a economia do prompt caching, os engenheiros devem compreender a física computacional da inferência Transformer em aceleradores modernos (NVIDIA H100/B200, Google TPU v5e/v6e).

Pipeline Tradicional Sem Estado:
[Prompt estático + Esquemas de ferramentas + Histórico (64.000 tokens)]
                                    │
                                    ▼
                 [Fase Prefill Completa (O(N²) FLOPs)]
             Multiplicação densa de matrizes recalcula Q, K, V
                                    │
                                    ▼
                     [Primeiro token gerado (TTFT: 2.8s)]
                     [Custo: Tarifa base cheia × 64.000 tokens]

Pipeline com Prompt Caching Ativado:
[Prefixo estático (60.000 tokens)] ──► [Hash do prefixo coincide!] ──► [Carregar tensores KV em cache]
                                                                                │ (Evita FLOPs de matrizes)
[Query dinâmica (4.000 tokens)]   ──► [Prefill apenas para o delta] ───────────┤
                                                                                ▼
                                                               [Primeiro token gerado (TTFT: 0.35s)]
                                                               [Custo: Tarifa leitura × 60k + Base × 4k]

O gargalo computacional da Self-Attention

Na autoatenção multi-head padrão, os tokens de entrada são projetados nas matrizes Query ($Q$), Key ($K$) e Value ($V$):

$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$

Na fase de prefill, a GPU processa todos os tokens simultaneamente. Como a autoatenção avalia as relações cruzadas entre cada par de tokens, o número de operações em ponto flutuante (FLOPs) escala quadraticamente em relação ao comprimento da sequência $N$:

$$\text{FLOPs}_{\text{prefill}} \approx 2 \cdot P \cdot N^2 + 4 \cdot N \cdot d_{\text{model}} \cdot d_{\text{ffn}}$$

Para um modelo de 70 bilhões de parâmetros com um prompt de 64.000 tokens, o prefill requer aproximadamente $5.8 \times 10^{14}$ operações de ponto flutuante antes de emitir a primeira palavra.

Na fase de decodificação (decode), os tokens são gerados de forma sequencial. Para evitar recalcular tokens passados, os vetores de ativação $K$ e $V$ são armazenados na memória: este é o KV Cache. A pegada de memória por token em $L$ camadas com $H_{kv}$ cabeças de dimensão $D$ é:

$$\text{Memory}_{\text{KV}} = 2 \times 2 \times L \times H_{kv} \times D \quad \text{(bytes em FP16 / BF16)}$$

O Prompt Caching estende esse KV cache para além dos limites de uma única requisição. Havendo correspondência de hash criptográfico, os tensores são carregados diretamente da memória, eliminando a fase de prefill.


3. Matriz Comparativa entre Provedores: Anthropic vs OpenAI vs DeepSeek

Dimensão Arquitetural Anthropic Claude OpenAI (GPT-4o / o1 / o3) DeepSeek (V3 / V4 / R1)
Mecanismo de Ativação Breakpoints explícitos (cache_control) Automático por prefixo comum Automático por prefixo comum
Limite Mínimo de Ativação 1.024 tokens (Sonnet/Opus)
2.048 tokens (Haiku)
1.024 tokens 64 tokens (Alinhamento de bloco)
Granularidade dos Blocos Breakpoints explícitos (máx. 4/requisição) Incrementos de 128 tokens após 1.024 Exatamente blocos de 64 tokens
Tempo de Vida (TTL) 5 minutos (efêmero padrão)
1 hora (nível estendido)
5 a 10 minutos (descarte dinâmico LRU) Horas ou persistente (NVMe multinível)
Renovação de TTL Reiniciado em 5m/1h a cada hit Renovação contínua sob chamadas Retido de forma persistente em SSD
Sobretaxa de Escrita (Write) +25% (1.25x tarifa base para 5m)
+100% (2.0x base para 1h)
$0.00 (1.0x tarifa base de entrada) $0.00 (1.0x tarifa base, sem sobretaxa)
Desconto de Leitura (Read) 90% de desconto (0.10x tarifa base) 50% de desconto (0.50x tarifa base) 75% a 90% de desconto (0.10x–0.25x base)
Custos de Armazenamento Inclusos na sobretaxa de escrita Gratuito Gratuito (descarregado em NVMe)
Redução de Latência (TTFT) Até 85% mais rápido Até 50% mais rápido Até 80% mais rápido

4. Tabela Geral de Tarifas por Modelo (USD por 1M de tokens)

Modelo Entrada Padrão ($/1M) Escrita ($/1M) Leitura ($/1M) Desconto de Leitura Saída Padrão ($/1M) Limite Mínimo
Claude 3.5 / 3.7 Haiku $0.80 $1.00 (5m) / $1.60 (1h) $0.08 90.0% $4.00 2.048 tokens
Claude 3.7 Sonnet $3.00 $3.75 (5m) / $6.00 (1h) $0.30 90.0% $15.00 1.024 tokens
Claude 3 Opus / Opus 4.6 $15.00 $18.75 (5m) / $30.00 (1h) $1.50 90.0% $75.00 1.024 tokens
OpenAI GPT-4o mini $0.15 $0.15 $0.075 50.0% $0.60 1.024 tokens
OpenAI GPT-4o $2.50 $2.50 $1.25 50.0% $10.00 1.024 tokens
OpenAI o1 $15.00 $15.00 $7.50 50.0% $60.00 1.024 tokens
OpenAI o3-mini $1.10 $1.10 $0.55 50.0% $4.40 1.024 tokens
DeepSeek V3 / V4 (Fora de Pico) $0.14 $0.14 $0.014 90.0% $0.28 64 tokens
DeepSeek V3 / V4 (Pico) $0.27 $0.27 $0.027 90.0% $1.10 64 tokens
DeepSeek R1 (Raciocínio) $0.55 $0.55 $0.14 74.5% $2.19 64 tokens
Google Gemini 2.5 Flash $0.15 $0.15 $0.0375 75.0% $0.60 32.768 tokens
Google Gemini 2.5 Pro $1.25 $1.25 $0.3125 75.0% $5.00 32.768 tokens

5. Formalização Matemática e Ponto de Equilíbrio (Break-Even)

Cálculo do ponto de equilíbrio ($N^*$)

Para a Anthropic com 25% de taxa de escrita ($R_{\text{write}} = 1.25 R_{\text{base}}$, $R_{\text{read}} = 0.10 R_{\text{base}}$):

$$1.25 + 0.10(N - 1) \le N \implies 1.15 \le 0.90N \implies N \ge \frac{1.15}{0.90} \approx 1.278$$

Teorema 1: Com o TTL de 5 minutos da Anthropic, o prompt caching é rentável a partir da segunda requisição (N = 2).

Para o TTL estendido de 1 hora ($R_{\text{write}} = 2.0 R_{\text{base}}$):

$$2.0 + 0.10(N - 1) \le N \implies 1.90 \le 0.90N \implies N \ge 2.11$$

Teorema 2: Com o TTL de 1 hora da Anthropic, o ponto de equilíbrio é superado na terceira requisição (N = 3).

Limite assintótico de 90% de economia

Para sessões longas ($N \to \infty$):

$$\lim_{N \to \infty} S(N) = 1 - \frac{R_{\text{read}}}{R_{\text{base}}}$$

  • Anthropic e DeepSeek: $1 - 0.10 = \mathbf{90.0\%}$ de economia máxima.
  • OpenAI: $1 - 0.50 = \mathbf{50.0\%}$ de economia máxima.

6. Exemplos de Implementação de Código

Anthropic Claude (Python)

import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-3-7-sonnet-20250219",
    max_tokens=2048,
    system=[
        {
            "type": "text",
            "text": "Especificações de arquitetura do sistema...\n" * 400,
            "cache_control": {"type": "ephemeral"} # Breakpoint
        }
    ],
    messages=[{"role": "user", "content": "Refatore o middleware de autenticação."}]
)
print("Tokens lidos do cache:", getattr(response.usage, "cache_read_input_tokens", 0))

OpenAI (TypeScript / Node.js)

import OpenAI from "openai";
const openai = new OpenAI();

const res = await openai.chat.completions.create({
  model: "gpt-4o",
  messages: [
    { role: "system", content: "Diretrizes estáticas de suporte...\n".repeat(400) },
    { role: "user", content: "Consultar histórico de pedidos" }
  ]
});
console.log("Tokens em cache:", (res.usage as any)?.prompt_tokens_details?.cached_tokens ?? 0);

7. Casos de Uso Reais e Retorno de Investimento

  • Agentes de programação (Claude Code, monorepo de 250k linhas): 20 engenheiros reduziram o gasto mensal de $29.700 para $4.334 / mês (85.4% de economia líquida).
  • RAG sobre documentos extensos (OpenAI GPT-4o): 50.000 consultas mensais sobre manuais normativos caíram de $5.625 para $2.975,63 / mês (47.1% de economia).
  • Atendimento ao cliente em massa (DeepSeek V3/V4): 2 milhões de conversas mensais passaram de $3.360 para $378,34 / mês (88.7% de economia).

8. Cinco Antipadrões que Quebram o Cache

  1. Timestamps dinâmicos no prompt de sistema: Alteram o hash SHA-256 a cada segundo, zerando a taxa de acerto do cache.
  2. Ordem aleatória na lista de ferramentas (Tools): A serialização JSON desordenada invalida o hash. Ordene sempre alfabeticamente.
  3. Variáveis dinâmicas inseridas no início ou no meio: O cache exige prefixo comum rígido. Mantenha os dados dinâmicos estritamente no final.
  4. Ignorar o vencimento do TTL de 5 minutos: Se houver pausas longas entre turnos, utilize o TTL estendido de 1 hora.
  5. Não atingir o limite mínimo de 1.024 tokens: Textos menores não ativam o cache na Anthropic ou OpenAI.

9. Veredito e Recomendações LLMPodium

  • Para agentes autônomos de código: A Anthropic Claude 3.7 Sonnet oferece o maior retorno graças ao desconto de 90% na leitura.
  • Para pipelines existentes sem refatoração: A OpenAI GPT-4o garante 50% de economia direta com zero alteração de código.
  • Para volumes astronômicos ao menor custo: O DeepSeek V3/V4 é imbatível com seu limite de 64 tokens e leitura a $0.014/1M.
← Todos os artigos
0 / 4