Быстрый ответ: Prompt caching снижает расходы на входные токены LLM API на 50–90% и сокращает задержку TTFT до 85% за счет сохранения тензоров KV-кэша между запросами. Anthropic дает 90% скидку на чтение с явными точками кэширования (порог от 1024 токенов). OpenAI автоматически дает скидку 50% без наценки на запись. DeepSeek обеспечивает экономию 80–90% при пороге от 64 токенов.
1. Введение: экономика состояния в stateless LLM API
Современные API больших языковых моделей (LLM) исторически построены по принципу отсутствия состояния (stateless architecture): каждый HTTP-запрос POST к эндпоинтам /v1/chat/completions или /v1/messages обязан передавать полную историю диалога, системные инструкции, спецификации инструментов и контекст документов. Хотя архитектура без состояния упрощает балансировку нагрузки, горизонтальное масштабирование и отказоустойчивость кластеров GPU, она налагает колоссальные вычислительные и финансовые издержки на многошаговые агентские сценарии.
В автономных циклах разработки и RAG-системах — таких как Claude Code, Roo Code, Aider, Devin или корпоративные поисковые ассистенты — агент на каждом шаге повторно передает неизменные системные промпты, схемы OpenAPI, манифесты Model Context Protocol (MCP) и снимки структуры репозитория. К 15-му шагу типичной задачи разработки от 95% до 98% всех передаваемых токенов составляют статический префикс, который модель уже неоднократно обрабатывала.
Раньше облачные провайдеры взимали полную базовую стоимость за каждый входной токен на каждом шаге, принуждая инференс-кластеры выполнять ресурсоемкие матричные вычисления (фазу префилла) над неизменным контекстом. Кэширование промптов (Prompt Caching) устраняет эту неэффективность. Сохраняя предварительно рассчитанные тензоры Key-Value (KV) статических префиксов в быстрой памяти GPU HBM, оперативной памяти хоста или на энергонезависимых NVMe SSD, провайдеры исключают избыточные вычисления префилла.
Экономический эффект масштабен: инженерные команды при правильной организации prompt caching добиваются снижения общего счета за API на 60–88%, одновременно сокращая время генерации первого токена (TTFT) с нескольких секунд до нескольких сотен миллисекунд.
2. Архитектура: механика KV-кэша и узкое место фазы Prefill
Чтобы понимать экономику prompt caching, разработчику необходимо представлять физические ограничения инференса трансформеров на современных ускорителях (NVIDIA H100/B200, Google TPU v5e/v6e, AMD MI300X).
Традиционный инференс без кэширования (Stateless):
[Статичный системный промпт + схемы инструментов + история (64k токенов)]
│
▼
[Полная фаза Prefill (O(N²) FLOPs)]
Матричные умножения пересчитывают Q, K, V
│
▼
[Генерация первого токена (TTFT: 2.8s)]
[Стоимость: Базовый тариф × 64 000 токенов]
Инференс с Prompt Caching:
[Статичный префикс (60k токенов)] ──> [Совпадение хэша префикса!] ──> [Загрузка готовых тензоров KV]
│ (Вычисления пропущены)
[Динамический запрос (4k токенов)] ──> [Prefill только для дельты] ───────────┤
▼
[Генерация первого токена (TTFT: 0.35s)]
[Стоимость: Тариф чтения × 60k + Базовый × 4k]
Узкое место механизма внимания (Self-Attention)
В стандартном многоголовом механизме внимания входные токены проецируются в матрицы Query ($Q$), Key ($K$) и Value ($V$) размерности $d_k$:
$$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$$
Во время фазы префилла (prefill) графический процессор обрабатывает все токены промпта параллельно. Поскольку механизм внимания вычисляет взаимодействия между каждой парой токенов, вычислительная сложность растет квадратично относительно длины входного контекста:
$$\text{FLOPs}_{\text{prefill}} \approx 2 \cdot P \cdot N^2 + 4 \cdot N \cdot d_{\text{model}} \cdot d_{\text{ffn}}$$
где $N$ — длина контекста в токенах, а $P$ — число параметров модели. Для промпта объемом 64 000 токенов на модели в 70 миллиардов параметров фаза префилла требует около $5.8 \times 10^{14}$ операций с плавающей запятой еще до генерации хотя бы одного токена ответа.
Во время фазы генерации (decode) токены генерируются последовательно, один за другим. Чтобы не пересчитывать предшествующие токены, движок сохраняет векторы активаций $K$ и $V$ в памяти — это и есть KV-кэш. Объем памяти, занимаемый KV-кэшем на один токен для модели с $L$ слоями, $H_{kv}$ головами key-value и размерностью головы $D$, рассчитывается как:
$$\text{Memory}_{\text{KV}} = 2 \times 2 \times L \times H_{kv} \times D \quad \text{(байты в формате FP16 / BF16)}$$
Для современных моделей с архитектурой Grouped-Query Attention (GQA) или Multi-Head Latent Attention (MLA) контекст в 100 000 токенов требует от 1.2 до 4.8 ГБ памяти на одну активную пользовательскую сессию.
Prompt caching переносит этот KV-кэш между независимыми HTTP-запросами. Когда поступающий запрос совпадает по криптографическому хэшу префикса с уже существующим блоком KV в памяти сервера, инференс-движок загружает сохраненные тензоры напрямую, минуя фазу ресурсоемких матричных вычислений.
3. Архитектурная матрица провайдеров: Anthropic, OpenAI и DeepSeek
Три ведущих поставщика моделей используют принципиально разные архитектурные концепции кэширования, минимальные пороги активации, политики хранения TTL, наценки за запись и скидки на чтение.
| Архитектурный параметр | Anthropic Claude | OpenAI (GPT-4o / o1 / o3) | DeepSeek (V3 / V4 / R1) |
|---|---|---|---|
| Механизм активации | Явные маркеры (cache_control) |
Полностью автоматическое совпадение | Полностью автоматическое совпадение |
| Минимальный порог | 1 024 токена (Sonnet/Opus) 2 048 токенов (Haiku) |
1 024 токена | 64 токена (Гранулярность блока) |
| Гранулярность шага | Блоки точек останова (до 4 на запрос) | Шаг в 128 токенов сверх 1 024 | Точное выравнивание по блокам 64 токена |
| Время жизни кэша (TTL) | 5 минут (по умолчанию) 1 час (расширенный тариф) |
5–10 минут (динамический алгоритм LRU) | Часы / персистентно (многоуровневый NVMe) |
| Сброс таймера TTL | Обновляется на 5м / 1ч при каждом хите | Продлевается при последующих запросах | Сохраняется на быстрых дисках |
| Наценка за запись в кэш | +25% (1.25x базовой цены для 5m) +100% (2.0x базовой цены для 1h) |
$0.00 (1.0x базовой цены входа) | $0.00 (1.0x базовой цены, без доплат) |
| Скидка на чтение из кэша | Скидка 90% (0.10x базовой цены) | Скидка 50% (0.50x базовой цены) | Скидка 75–90% (0.10x–0.25x базовой цены) |
| Плата за хранение | Включена в наценку за запись | Бесплатно | Бесплатно (на дисках NVMe) |
| Сокращение задержки (TTFT) | До 85% быстрее | До 50% быстрее | До 80% быстрее |
Детальный анализ архитектурных подходов
#### 1. Anthropic Claude (Модель явного контроля)
Anthropic использует концепцию точечного управления кэшем. Разработчики вручную встраивают блок "cache_control": {"type": "ephemeral"} в системные инструкции, описания инструментов или реплики пользователя.
- Точки останова (Breakpoints): В одном запросе можно объявить до 4 точек кэширования.
- Минимальный порог: Промпт должен содержать не менее 1 024 токенов для Sonnet и Opus или 2 048 токенов для Haiku. Префиксы меньшего размера тарифицируются по стандартной цене без кэширования.
- Тарификация: Первичная запись в кэш стоит на 25% дороже базового ввода ($3.75 за 1M против $3.00 за 1M на Sonnet при TTL 5 минут). Последующие попадания в течение 5 минут получают феноменальную скидку 90% ($0.30 за 1M). Опциональный расширенный TTL на 1 час стоит 2.0x базового ввода ($6.00 за 1M на Sonnet), но защищает от сброса кэша при долгих паузах.
#### 2. OpenAI (Модель автоматического прозрачного кэширования) OpenAI внедрила автоматическое кэширование префиксов для моделей GPT-4o, GPT-4o mini, o1 и o3-mini.
- Автоматическое обнаружение: Разработчику не требуется изменять схему JSON. Если первые 1 024 токена запроса побайтово совпадают с ранее отправленным префиксом, кэш активируется прозрачно.
- Гранулярность: Совпадение рассчитывается блоками по 128 токенов сверх базовых 1 024.
- Тарификация: OpenAI не взимает наценку за запись в кэш. Первая отправка тарифицируется по стандартной базовой цене ($2.50 за 1M на GPT-4o). Попадания в кэш получают фиксированную скидку 50% ($1.25 за 1M на GPT-4o).
- TTL: Скользящее окно от 5 до 10 минут под управлением серверного алгоритма вытеснения LRU.
#### 3. DeepSeek (Высокоплотная многоуровневая архитектура) Компания DeepSeek первой реализовала многоуровневое контекстное кэширование на базе архитектур V3, V4 и R1, объединив Multi-Head Latent Attention (MLA) с дисковым хранением на локальных накопителях NVMe.
- Сверхмалый порог: В то время как Anthropic и OpenAI требуют 1 024 токена, DeepSeek активирует кэширование всего от 64 токенов, что в точности соответствует размеру аппаратного блока KV.
- Нулевая наценка и рекордно низкие тарифы: Запись стоит ровно столько же, сколько стандартный ввод ($0.14–$0.27 за 1M токенов). Чтение из кэша падает до беспрецедентных $0.014–$0.028 за 1M токенов (скидка 90% на исходно сверхдешевую модель).
- Персистентность: Неактивные тензоры KV выгружаются из дорогой памяти GPU HBM на сверхбыстрые диски NVMe PCIe Gen5, сохраняя доступность кэша часами без взимания платы за хранение.
4. Сравнительная матрица тарифов по моделям
Ниже представлена эталонная матрица стоимости prompt caching среди актуальных моделей рынка (в долларах США за 1M токенов):
| Модель | Базовый Input ($/1M) | Запись в кэш ($/1M) | Чтение из кэша ($/1M) | Скидка на чтение | Output ($/1M) | Мин. порог кэша |
|---|---|---|---|---|---|---|
| Claude 3.5 / 3.7 Haiku | $0.80 | $1.00 (5m) / $1.60 (1h) | $0.08 | 90.0% | $4.00 | 2 048 токенов |
| Claude 3.7 Sonnet | $3.00 | $3.75 (5m) / $6.00 (1h) | $0.30 | 90.0% | $15.00 | 1 024 токена |
| Claude 3 Opus / Opus 4.6 | $15.00 | $18.75 (5m) / $30.00 (1h) | $1.50 | 90.0% | $75.00 | 1 024 токена |
| OpenAI GPT-4o mini | $0.15 | $0.15 | $0.075 | 50.0% | $0.60 | 1 024 токена |
| OpenAI GPT-4o | $2.50 | $2.50 | $1.25 | 50.0% | $10.00 | 1 024 токена |
| OpenAI o1 | $15.00 | $15.00 | $7.50 | 50.0% | $60.00 | 1 024 токена |
| OpenAI o3-mini | $1.10 | $1.10 | $0.55 | 50.0% | $4.40 | 1 024 токена |
| DeepSeek V3 / V4 (Off-Peak) | $0.14 | $0.14 | $0.014 | 90.0% | $0.28 | 64 токена |
| DeepSeek V3 / V4 (Peak) | $0.27 | $0.27 | $0.027 | 90.0% | $1.10 | 64 токена |
| DeepSeek R1 (Reasoning) | $0.55 | $0.55 | $0.14 | 74.5% | $2.19 | 64 токена |
| Google Gemini 2.5 Flash | $0.15 | $0.15 | $0.0375 | 75.0% | $0.60 | 32 768 токенов |
| Google Gemini 2.5 Pro | $1.25 | $1.25 | $0.3125 | 75.0% | $5.00 | 32 768 токенов |
5. Математические формулы и доказательство 90% экономии
Понимание реальной окупаемости prompt caching требует строгого математического описания расходов.
Единая модель расчета стоимости сессии
Определим переменные:
- $T_{\text{static}}$ — объем неизменных токенов префикса (системный промпт, схемы инструментов, репозиторий, документы)
- $T_{\text{dynamic}, i}$ — количество динамических токенов на шаге $i$ (реплика пользователя, промежуточные рассуждения, история)
- $T_{\text{out}, i}$ — объем выходных токенов на шаге $i$
- $R_{\text{base}}$ — базовый тариф за входной токен ($/токен)
- $R_{\text{write}}$ — тариф на запись в кэш ($/токен)
- $R_{\text{read}}$ — тариф на чтение из кэша ($/токен)
- $R_{\text{out}}$ — тариф на выходные токены ($/токен)
- $N$ — общее количество шагов диалога в сессии
#### 1. Стоимость сессии без кэширования (Uncached) В стандартном режиме все накопленные токены оплачиваются по тарифу $R_{\text{base}}$ на каждом шаге:
$$\text{Cost}_{\text{uncached}} = \sum_{i=1}^{N} \left( \left( T_{\text{static}} + \sum_{k=1}^{i} T_{\text{dynamic}, k} \right) R_{\text{base}} + T_{\text{out}, i} R_{\text{out}} \right)$$
При среднем значении динамических токенов $\bar{T}_{\text{dyn}}$ за шаг:
$$\text{Cost}_{\text{uncached}} = N \cdot T_{\text{static}} R_{\text{base}} + \frac{N(N+1)}{2} \bar{T}_{\text{dyn}} R_{\text{base}} + N \cdot \bar{T}_{\text{out}} R_{\text{out}}$$
#### 2. Стоимость сессии с Prompt Caching Когда префикс $T_{\text{static}}$ записывается в кэш на шаге 1 и считывается на всех последующих $N - 1$ шагах:
$$\text{Cost}_{\text{cached}} = \left( T_{\text{static}} R_{\text{write}} + (N - 1) T_{\text{static}} R_{\text{read}} \right) + \sum_{i=1}^{N} \left( \left(\sum_{k=1}^{i} T_{\text{dynamic}, k}\right) R_{\text{base}} + T_{\text{out}, i} R_{\text{out}} \right)$$
Расчет точки безубыточности ($N^*$)
Для провайдеров вроде OpenAI и DeepSeek, у которых $R_{\text{write}} = R_{\text{base}}$, кэширование выгодно всегда: точка безубыточности составляет $N^* = 2$ (чистая экономия начинается уже со 2-го запроса).
Для Anthropic, где запись стоит на 25% дороже базового ввода ($R_{\text{write}} = 1.25 \times R_{\text{base}}$ при 5-минутном TTL), определим минимальное число шагов, при котором кэширование окупается:
$$\text{Cost}_{\text{cached}}(T_{\text{static}}) \le \text{Cost}_{\text{uncached}}(T_{\text{static}})$$
$$T_{\text{static}} R_{\text{write}} + (N - 1) T_{\text{static}} R_{\text{read}} \le N \cdot T_{\text{static}} R_{\text{base}}$$
Разделим обе части на $T_{\text{static}} R_{\text{base}}$, учитывая, что $R_{\text{write}} / R_{\text{base}} = 1.25$, а $R_{\text{read}} / R_{\text{base}} = 0.10$:
$$1.25 + 0.10(N - 1) \le N$$
$$1.25 + 0.10N - 0.10 \le N \implies 1.15 \le 0.90N \implies N \ge \frac{1.15}{0.90} \approx 1.278 \text{ шага}$$
Теорема 1: При 5-минутном TTL у Anthropic кэширование окупается ровно за 2 запроса. Любая сессия с 2 и более обращениями приносит чистую финансовую экономию.
Для тарифа с 1-часовым TTL ($R_{\text{write}} / R_{\text{base}} = 2.0$):
$$2.0 + 0.10(N - 1) \le N \implies 1.90 \le 0.90N \implies N \ge 2.11 \text{ шага}$$
Теорема 2: При 1-часовом TTL у Anthropic точка окупаемости наступает ровно на 3-м запросе.
Доказательство асимптоты 90% экономии
Какова теоретически достижимая предельная экономия на статическом префиксе?
Определим коэффициент экономии $S(N)$:
$$S(N) = 1 - \frac{\text{Cost}_{\text{cached}}(T_{\text{static}})}{\text{Cost}_{\text{uncached}}(T_{\text{static}})} = 1 - \frac{R_{\text{write}} + (N - 1) R_{\text{read}}}{N \cdot R_{\text{base}}}$$
При длине сессии, стремящейся к бесконечности ($N \to \infty$):
$$\lim_{N \to \infty} S(N) = 1 - \lim_{N \to \infty} \left( \frac{R_{\text{write}} - R_{\text{read}}}{N \cdot R_{\text{base}}} + \frac{R_{\text{read}}}{R_{\text{base}}} \right) = 1 - \frac{R_{\text{read}}}{R_{\text{base}}}$$
Для Anthropic и DeepSeek, где $R_{\text{read}} / R_{\text{base}} = 0.10$:
$$\lim_{N \to \infty} S(N) = 1 - 0.10 = 0.90 \quad \mathbf{(90.0\%\text{ экономии})}$$
Для OpenAI, где $R_{\text{read}} / R_{\text{base}} = 0.50$:
$$\lim_{N \to \infty} S(N) = 1 - 0.50 = 0.50 \quad \mathbf{(50.0\%\text{ экономии})}$$
6. Примеры интеграции в коде и параметры API
Anthropic Claude: управление точками кэширования (Python)
import os
import anthropic
client = anthropic.Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
# Большой системный промпт (более 1024 токенов)
LARGE_SYSTEM_PROMPT = "Вы ведущий архитектор... " + ("правило\n" * 400)
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
max_tokens=2048,
system=[
{
"type": "text",
"text": LARGE_SYSTEM_PROMPT,
# Явная точка кэширования системного промпта
"cache_control": {"type": "ephemeral"}
}
],
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "Схема репозитория:\n" + ("interface User { id: string; }\n" * 200),
# Вторая точка кэширования для большой схемы
"cache_control": {"type": "ephemeral"}
},
{
"type": "text",
"text": "Напиши метод репозитория для поиска активных пользователей."
}
]
}
]
)
# Проверка телеметрии использования кэша
usage = response.usage
print(f"Базовый ввод: {usage.input_tokens}")
print(f"Запись в кэш: {getattr(usage, 'cache_creation_input_tokens', 0)}")
print(f"Чтение из кэша: {getattr(usage, 'cache_read_input_tokens', 0)}")
print(f"Выходные токены: {usage.output_tokens}")
OpenAI: автоматическое выравнивание префиксов (Node.js)
import OpenAI from "openai";
const openai = new OpenAI({ apiKey: process.env.OPENAI_API_KEY });
const STATIC_SYSTEM_PROMPT = "Вы ассистент технической поддержки. Инструкции:\n" + "Правило...\n".repeat(400);
async function callChat(userQuery: string) {
const completion = await openai.chat.completions.create({
model: "gpt-4o",
messages: [
// 1. Статический префикс (>= 1 024 токенов) — кэшируется автоматически
{ role: "system", content: STATIC_SYSTEM_PROMPT },
// 2. Динамический запрос пользователя строго в конце массива
{ role: "user", content: userQuery },
],
});
const usage = completion.usage;
console.log(`Всего входных токенов: ${usage?.prompt_tokens}`);
// @ts-ignore - чтение зафиксированных кэшированных токенов
console.log(`Токенов из кэша: ${usage?.prompt_tokens_details?.cached_tokens ?? 0}`);
}
DeepSeek: интеграция через стандартный SDK
from openai import OpenAI
deepseek_client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# DeepSeek автоматически кэширует префиксы длиннее 64 токенов
response = deepseek_client.chat.completions.create(
model="deepseek-chat",
messages=[
{"role": "system", "content": "Вы финансовый аналитик. " + ("Финансовый отчет...\n" * 300)},
{"role": "user", "content": "Проанализируй обязательства в третьем квартале."}
]
)
usage = response.usage
hit_tokens = getattr(usage, "prompt_cache_hit_tokens", 0)
miss_tokens = getattr(usage, "prompt_cache_miss_tokens", 0)
print(f"Хит кэша DeepSeek: {hit_tokens} токенов (по тарифу $0.014/1M)")
print(f"Промах кэша DeepSeek: {miss_tokens} токенов (по тарифу $0.14/1M)")
7. Практические кейсы из индустрии и реальная экономия
Команда LLMPodium исследовала три высоконагруженных сценария за 30-дневный период.
Кейс 1: Автономный агент разработки (Claude Code в монорепозитории 250k LOC)
- Нагрузка: 20 инженеров используют Claude Code CLI, в среднем 25 шагов на задачу, 12 задач в день.
- Объем контекста: 75 000 токенов (дерево репозитория, AST-индексы, спецификации инструментов).
- Затраты без кэша: $3.00/1M $\times 75\text{k} \times 25 \text{ шагов} \times 12 \times 20 \times 22 \text{ дня} = \mathbf{\$29 700/\text{месяц}}$.
- Затраты с Prompt Caching:
- Шаг 1: запись 75 000 токенов @ $3.75/1M = $0.281
- Шаги 2–25: чтение 75 000 токенов @ $0.30/1M = $\$0.0225 \times 24 = \$0.540$
- Суммарный ввод на задачу: $0.821 (вместо $5.625 без кэширования).
- Итоговый счет: $\mathbf{\$4 334/\text{месяц}}$ (чистая экономия бюджета 85.4%).
Кейс 2: Корпоративный RAG по длинным документам (OpenAI GPT-4o)
- Нагрузка: Поиск по 45 000-токенному регуляторному регламенту при 50 000 запросов клиентов в месяц.
- Затраты без кэша: $2.50/1M $\times 45\text{k} \times 50 000 = \mathbf{\$5 625/\text{месяц}}$ на входные токены.
- С автоматическим кэшированием OpenAI:
- Процент попадания в кэш: 94.2%.
- Вход без кэша: $5.8\% \times 50\text{k} \times 45\text{k} \times \$2.50 / 1\text{M} = \$326.25$
- Вход из кэша: $94.2\% \times 50\text{k} \times 45\text{k} \times \$1.25 / 1\text{M} = \$2 649.38$
- Итоговые затраты: $\mathbf{\$2 975.63/\text{месяц}}$ (экономия 47.1%).
Кейс 3: Массовая служба клиентской поддержки (DeepSeek V3 / V4)
- Нагрузка: 2 000 000 диалогов в месяц с общим корпусом документации в 12 000 токенов.
- Затраты без кэша: $0.14/1M $\times 12\text{k} \times 2 000 000 = \mathbf{\$3 360/\text{месяц}}$.
- С контекстным кэшированием DeepSeek:
- Процент попадания в кэш: 98.6%.
- Хиты: $98.6\% \times 2\text{M} \times 12\text{k} \times \$0.014 / 1\text{M} = \$331.30$
- Промахи: $1.4\% \times 2\text{M} \times 12\text{k} \times \$0.14 / 1\text{M} = \$47.04$
- Итоговые затраты: $\mathbf{\$378.34/\text{месяц}}$ (экономия 88.7%).
8. Пять критических антипаттернов, ломающих кэш
Даже опытные архитекторы допускают незаметные инженерные ошибки, приводящие к сбросу кэша и резкому росту счетов.
- Динамические временные метки в системном промпте: Добавление строки вида
Текущее время: 2026-09-02 14:32:11в системный промпт изменяет криптографический SHA-256 префикс каждую секунду, снижая процент хитов кэша до 0%. Передавайте текущее время исключительно в теле последнего сообщения пользователя. - Нестабильный порядок описания инструментов (Tools): Сериализация инструментов из несортированных словарей Python или динамических схем JSON меняет очередность ключей (
search,bash,read_file). Всегда сортируйте массив инструментов по алфавиту перед отправкой запроса. - Внедрение динамических переменных в середину промпта: Prompt caching работает строго по принципу общего префикса. Если изменился токен №500, все сохраненные тензоры KV с токена №501 по токен №100 000 инвалидируются. Никогда не размещайте ID сессий, токены авторизации или пользовательские счетчики перед большими корпусами данных.
- Превышение 5-минутного окна TTL: В диалоговых приложениях пользователи нередко делают паузы в 6–10 минут между репликами. На Anthropic это приводит к сбросу кэша и повторной оплате наценки 1.25x на следующем шаге. Для длительных сессий используйте 1-часовой расширенный TTL или фоновые keepalive-запросы.
- Попытка кэшировать объем ниже порога: Попытка кэшировать 800 токенов на Anthropic или OpenAI завершится незаметным промахом, поскольку обе системы требуют минимум 1 024 токена для активации механизма. Всегда проверяйте метрики телеметрии (
cache_read_input_tokensилиcached_tokens) в продакшене.
9. Стратегическое дерево решений и вердикт LLMPodium
Выбор подходящей модели и стратегии кэширования зависит от объема контекста, интервалов между запросами и требований к скорости:
[Поток запросов]
│
┌───────────────────────┴───────────────────────┐
▼ ▼
[Префикс < 1 024 токенов] [Префикс >= 1 024 токенов]
│ │
▼ ▼
Превышает ли 64 токена? Каков интервал между
│ запросами?
┌───────┴───────┐ │
▼ ▼ ┌───────────────┴───────────────┐
[ДА] [НЕТ] ▼ ▼
DeepSeek V3/V4 Обычный ввод [Интервал < 5 мин] [Интервал > 10 мин]
(Хит из диска) (Без кэша) │ │
┌───────┴───────┐ ┌───────┴───────┐
▼ ▼ ▼ ▼
Anthropic Sonnet OpenAI GPT-4o Anthropic 1-ч DeepSeek V3/V4
(Скидка 90%) (Без наценки) (Длинный TTL) (NVMe кэш)
Итоговый вердикт LLMPodium
- Для автономных агентов разработки (Coding Agents): Anthropic Claude 3.7 Sonnet с явными маркерами
cache_controlостается непревзойденным лидером. Скидка 90% на чтение превращает разорительные $30 в день на разработчика в скромные $3.50. - Для конвейеров без дополнительных трудозатрат: OpenAI GPT-4o обеспечивает максимальное удобство. Автоматическое распознавание префиксов без наценок на запись и без правок в коде гарантирует 50% экономии на типовых нагрузках.
- Для сверхмасштабных корпоративных систем: DeepSeek V3/V4 — абсолютный чемпион по экономике. С порогом в 64 токена, хранением на дисках NVMe и ценой чтения $0.014 за 1M токенов DeepSeek снижает стоимость работы с окнами в 100k+ токенов в 10–50 раз по сравнению с западными аналогами.