Бенчмарки

Размеры контекстного окна LLM и лидерборд Needle in a Haystack

### Краткий ответ: Контекстные окна от 1M+ токенов и точность извлечения

В 2026 году контекстные окна объемом 1M+ токенов полностью готовы к промышленной эксплуатации (production-ready) в Gemini 2.5 Flash (2M), Code-SuperNova (1M), Claude 3.7 Sonnet (200k–1M расширенный) и Kimi K2.5 (2M). Хотя показатели извлечения по одному ключу (Single-Needle NIAH) превышают 99% у всех четырех моделей, ассоциативное извлечение нескольких ключей (Multi-Needle) резко деградирует за пределами 256k токенов: точность поиска падает на величину от 14% до 38% в зависимости от глубины запроса.


1. Обзор: Эра контекста от 1M+ токенов в 2026 году

Границы длинного контекста больших языковых моделей кардинально расширились. Если в 2023–2024 годах окна в 32k и 128k токенов считались архитектурными вехами, то к концу 2026 года производственные системы штатно обрабатывают целые монорепозитории Git, финансовую отчетность за несколько лет и сотни юридических договоров в одном промпте.

Во главе этой архитектурной революции стоят четыре ключевых семейства моделей:

  1. Google Gemini 2.5 Flash & Pro (2M токенов): Первопроходец промышленной нативной мультимодальной обработки 2 097 152 токенов с линейной маршрутизацией внимания (linear attention routing) и аппаратно ускоренным инференсом на TPU v6e.
  2. Code-SuperNova 1M (1 048 576 токенов): Специализированная модель для разработчиков, предварительно обученная на графах мультирепозиториев с AST-токенизацией и поддержкой Fill-in-the-Middle (FIM) на всем объеме контекста.
  3. Anthropic Claude 3.7 Sonnet (200k нативно / 1M расширенная бета): Гибридная архитектура с поддержкой динамического бюджета рассуждений (thought-budget reasoning) и бета-контекстным окном в 1M токенов со скидкой 90% на кэширование промптов.
  4. Moonshot AI Kimi K2.5 (2M токенов): Передовая двуязычная (китайско-английская) модель с нативным длинным контекстом, использующая модификации RingAttention и селективную разреженную маршрутизацию в пространстве состояний (sparse state-space routing).

Однако заявленное контекстное окно в 1M или 2M токенов не гарантирует, что модель способна безошибочно извлекать, анализировать или обобщать информацию, скрытую в таком массиве данных. Реальная эффективность использования контекста определяется кривыми деградации синтетических бенчмарков Needle In A Haystack (NIAH) («Иголка в стоге сена»), потерями при перекрестных ссылках между документами, ограничениями пропускной способности памяти и суровой экономической реальностью затрат на обработку промптов.


2. Количественная матрица: лидерборд контекстных окон 1M+

Для комплексной оценки передовых моделей с длинным контекстом необходимо проанализировать точность извлечения одиночных фактов (single-needle recall), синтез по множеству документов, пропускную способность инференса (токенов в секунду, TPS), время до первого токена (TTFT) и экономику кэширования промптов.

Модель и контекстное окно Single-Needle NIAH (1M) Multi-Needle NIAH (1M, 5 иголок) LiveCodeBench v6 (Long-Repo) TTFT при 1M токенов (p50) Output TPS Вход / 1M (без кэша) Вход / 1M (с кэшем) Выход / 1M
Gemini 2.5 Flash (2M) 99.8% 94.2% 66.4% 1.85s 148 tps $0.30 $0.075 $1.20
Code-SuperNova 1M (1M) 99.4% 95.1% 71.8% 2.40s 112 tps $0.80 $0.160 $3.20
Claude 3.7 Sonnet (1M расш.) 99.6% 93.8% 71.2% 4.10s 78 tps $3.00 $0.300 $15.00
Kimi K2.5 (2M) 99.1% 89.6% 63.5% 2.90s 96 tps $0.25 $0.100 $1.00
GPT-4.1 (базовый 128k) 98.2% (@128k) 88.0% (@128k) 62.1% 1.20s 82 tps $2.50 $1.250 $10.00

Ключевые выводы бенчмарка:

  • Code-SuperNova 1M демонстрирует наивысшие показатели удержания нескольких фактов (95.1%) и результат в LiveCodeBench (71.8%) на масштабных репозиториях. Это подтверждает, что оптимизированное под код маскирование внимания на базе AST сохраняет синтаксические зависимости на протяжении 1M токенов.
  • Gemini 2.5 Flash лидирует по скорости генерации (148 TPS) и рекордно низкому TTFT (1.85 с для 1M токенов) благодаря глубокой аппаратной оптимизации под TPU v6e и субквадратичным слоям внимания.
  • Claude 3.7 Sonnet обеспечивает наиболее глубокий концептуальный синтез и рассуждение по сложной технической документации, однако цена входных токенов без кэширования ($3.00 за 1M) делает обязательным внедрение архитектуры с кэшированием промптов.
  • Kimi K2.5 предлагает самую агрессивную базовую цену ($0.25 за вход / $1.00 за выход на миллион токенов) и выдающееся качество двуязычного (китайский/английский) извлечения до 1M токенов, но демонстрирует заметную деградацию при поиске нескольких фактов за пределами 1.5M токенов.

3. Подробный разбор ключевых моделей

+---------------------------------------------------------------------------------------------------+
|                            АРХИТЕКТУРНЫЕ ПРОФИЛИ МОДЕЛЕЙ С КОНТЕКСТОМ 1M+                         |
+---------------------------------------------------------------------------------------------------+
| Модель                | Размер окна   | Механизм внимания         | Сжатие / разреженность KV     |
+-----------------------+---------------+---------------------------+-------------------------------+
| Gemini 2.5 Flash      | 2,097,152     | Linear-Hybrid + GQA       | Dynamic Latent KV Paging      |
| Code-SuperNova 1M     | 1,048,576     | Block-Sparse AST Attention| Chunked Sparse-FIM Cache      |
| Claude 3.7 Sonnet     | 1,000,000     | Extended RoPE + GQA       | Tiered Ephemeral KV Cache     |
| Kimi K2.5             | 2,097,152     | RingAttention + Dual-SSM  | Continuous State-Space Chunks |
+-----------------------+---------------+---------------------------+-------------------------------+

Google Gemini 2.5 Flash (2 млн токенов)

Gemini 2.5 Flash воплощает передовую высокоэффективную архитектуру от Google. Сочетая Grouped-Query Attention (GQA) с проприетарными линейно-гибридными подуровнями внимания, Gemini 2.5 Flash преодолевает квадратичный барьер вычислительной сложности $O(N^2)$. При инференсе с длинным контекстом объем потребляемой памяти масштабируется квазилинейно:

$$\text{Memory}_{KV}(N) = 2 \times L \times n_{kv} \times d_{head} \times N \times \text{Precision}_{bytes}$$

Для 2 млн токенов при точности FP8 с $L=64$ слоями, $n_{kv}=8$ головками и $d_{head}=128$ несжатый KV-кэш требовал бы приблизительно:

$$2 \times 64 \times 8 \times 128 \times 2,097,152 \times 1 \approx 274.8 \text{ GB}$$

Gemini 2.5 Flash решает эту проблему на кластерах TPU v6e с помощью динамического латентного пейджинга KV-кэша и квантования активаций, сжимая активный объем хранения KV менее чем до 38 ГБ при сохранении задержки p50 TTFT ниже 2 секунд.

Code-SuperNova 1M (1 млн токенов)

Созданная специально для задач программной инженерии на уровне enterprise-систем, модель Code-SuperNova 1M оптимизирована для компиляции целых репозиториев, обхода AST и глубокого анализа графов межфайловых вызовов. Конвейер ее обучения включает:

  • Chunked Fill-In-The-Middle (FIM): одновременная работа более чем с 50 взаимосвязанными файлами.
  • Block-Sparse AST Attention: токены, представляющие определения символов, сигнатуры функций и операторы импорта, получают глобальные якоря внимания, тогда как плотные реализации функций внутри сторонних зависимостей подвергаются ленивому сжатию.
  • Детерминированное восстановление синтаксиса: предотвращает галлюцинации сигнатур API при разрешении импортов, расположенных за 800 тыс. токенов до текущей позиции в промпте.

Anthropic Claude 3.7 Sonnet (200 тыс. нативный / 1 млн бета)

Claude 3.7 Sonnet объединяет ведущий гибридный механизм рассуждений Anthropic (с настраиваемыми токенами размышления) с расширенным контекстным окном в 1 млн токенов. Anthropic применяет продвинутую интерполяцию Rotary Position Embedding (RoPE) на базе метода YaRN с тонко настроенной калибровкой частот:

$$\theta_i' = \theta_i \cdot \left(1 - \gamma\right) + \gamma \cdot \frac{\theta_i}{s}$$

Это предотвращает потерю высокочастотного позиционного различия между удаленными сегментами контекста. Работая в режиме расширенного контекста, Claude 3.7 Sonnet сохраняет строгую семантическую согласованность, что делает ее приоритетной моделью для автономной отладки критически важных систем и многоуровневого аудита архитектуры.

Moonshot AI Kimi K2.5 (2 млн токенов)

Moonshot AI стала первопроходцем в области распределенной обработки длинного контекста с помощью топологий RingAttention, распределяя измерение последовательности по кластерам взаимосвязанных GPU через высокоскоростные интерконнекты (NVLink/InfiniBand). Kimi K2.5 комбинирует трансформерные блоки с селективными слоями пространства состояний (SSM), обеспечивая стабильную обработку 2 млн токенов смешанных диалоговых и структурированных табличных данных при одной из самых низких цен за токен в отрасли.


4. Needle in a Haystack (NIAH): анализ поиска одной и нескольких иголок

Ловушка синтетических бенчмарков

Стандартные тесты Needle In A Haystack (NIAH) с одной иголкой помещают одиночный факт (например, «Секретный пароль от серверной — PineApple-7749») на разную процентную глубину (от 0% до 100%) внутри произвольного текстового корпуса (например, эссе Пола Грэма или документации открытого ПО).

Каждая современная frontier-модель демонстрирует идеальные зеленые показатели (>99.0%) в тесте NIAH с одной иголкой на 1 млн токенов. Однако реальные рабочие нагрузки никогда не ограничиваются поиском изолированного ключевого слова. Задачи на практике требуют:

  1. Множественного извлечения (Multi-Needle Retrieval): идентификации от 5 до 20 взаимосвязанных переменных, распределенных по разрозненным документам.
  2. Ассоциативного цепочечного рассуждения (Associative Chain Reasoning): извлечения «иголки А» (схема базы данных), связывания ее с «иголкой B» (запрос ORM) и синтеза «иголки C» (патч безопасности).
+-----------------------------------------------------------------------------------------------+
|                   КРИВЫЕ ДЕГРАДАЦИИ ПРИ ПОИСКЕ НЕСКОЛЬКИХ ИГОЛОК (5 ИГОЛОК)                   |
+-----------------------------------------------------------------------------------------------+
| Глубина (токенов)     | 64k       | 128k      | 256k      | 512k      | 1M        | 2M        |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+
| Gemini 2.5 Flash      | 99.7%     | 99.2%     | 98.4%     | 96.8%     | 94.2%     | 88.5%     |
| Code-SuperNova 1M     | 99.8%     | 99.5%     | 98.9%     | 97.4%     | 95.1%     | N/A       |
| Claude 3.7 Sonnet     | 99.9%     | 99.6%     | 98.7%     | 96.5%     | 93.8%     | N/A       |
| Kimi K2.5             | 99.4%     | 98.8%     | 97.2%     | 94.1%     | 89.6%     | 81.2%     |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+

Феномен «Lost in the Middle» в 2026 году

Несмотря на архитектурные улучшения, классическая деградация внимания «Lost in the Middle» сохраняется, когда глубина контекста превышает 500 000 токенов:

  • Эффект первичности (глубина 0%–15%): точность извлечения остается выше 98.5%. Модели устойчиво удерживают внимание на системных инструкциях и начальных определениях схем.
  • Эффект недавности (глубина 85%–100%): точность извлечения держится выше 99.0%. Ближайшая история диалога и финальные инструкции запроса не подвержены деградации.
  • Провал внимания (глубина 35%–65%): в задачах с несколькими иголками на объеме в 1 млн токенов точность извлечения падает в среднем на 7.4%–12.8% в диапазоне между 40-м и 60-м перцентилями.
Точность
извлечения
  100% | \                                         /
   95% |   \                                     /
   90% |     \                                 /
   85% |       \                             /
   80% |         \_______Провал (40-60%)____/
       +---------------------------------------------
       0%         25%         50%         75%        100%
                      Позиция в контексте

5. Потери при извлечении из нескольких документов и «гниение контекста» (Context Rot)

При обработке нескольких сложных документов модели с большим контекстным окном страдают от «гниения контекста» (Context Rot) — прогрессирующего снижения точности рассуждений, вызванного взаимной интерференцией механизма внимания между документами.

Основные причины Context Rot:

  1. Рассеивание внимания (Attention Dispersion): В стандартном softmax-внимании по мере приближения длины последовательности $N$ к $10^6$ распределение весов внимания $\text{softmax}(QK^T / \sqrt{d})$ становится всё более размытым. Низкоамплитудный шум внимания накапливается на тысячах нерелевантных токенов.
  2. Конфабуляция из-за пересекающихся сущностей: Когда 15 различных файлов ссылаются на похожие имена классов (например, UserSessionController, AuthSessionManager, UserSessionHandler), веса перекрёстного внимания (cross-attention) подвергаются деструктивной интерференции, из-за чего модель начинает смешивать поля не связанных между собой сущностей.
  3. Дрейф инструкций (Instruction Drift): Длинные промпты с большими объёмами исходного кода приводят к тому, что модели постепенно перестают соблюдать отрицательные ограничения (negative constraints) или требования к форматированию JSON, заданные в системном промпте.

Стратегии снижения рисков:

  • Иерархическая привязка (Hierarchical Anchoring): Размещайте критически важные схемы и ограничения на формат вывода как в начале ($0\%$), так и в конце ($100\%$) промпта.
  • Явное разграничение документов: Используйте структурные XML- или Markdown-обёртки с явным указанием количества токенов и путей к файлам:
<document index="4" path="src/auth/session.ts" tokens="1420">
// Содержимое файла...
</document>
  • Прунинг контекста перед инъекцией: Отфильтровывайте lock-файлы, артефакты сборки и сторонние библиотеки вендоров, чтобы удерживать полезный контекст в диапазоне максимальной точности модели (<512k токенов).

6. Тестирование в реальных условиях разработки: конкретная реализация на базе CLI и API

Чтобы протестировать полноту выборки (recall) в контексте 1M токенов в продакшене, разработчики могут запускать воспроизводимые синтетические NIAH-тесты с использованием Python и асинхронных клиентских драйверов.

Запуск бенчмарка Multi-Needle на 1M токенов

import asyncio
import os
import random
from anthropic import AsyncAnthropic
from google import genai

async def run_1m_gemini_niah(haystack_path: str, needles: list[dict]):
    """
    Запускает тест извлечения нескольких «иголок» (multi-needle retrieval) на модели Gemini 2.5 Flash с контекстом 1M токенов.
    """
    client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
    
    with open(haystack_path, "r") as f:
        corpus = f.read()
        
    # Внедрение «иголок» на детерминированных интервалах глубины (например, 20%, 45%, 70%)
    tokens = corpus.split()
    total_len = len(tokens)
    
    for needle in needles:
        insert_idx = int(total_len * needle["depth"])
        tokens.insert(insert_idx, needle["content"])
        
    prompt_payload = " ".join(tokens)
    query = "List all secret access tokens and their corresponding department codes verbatim."
    
    response = await client.aio.models.generate_content(
        model="gemini-2.5-flash",
        contents=[f"{prompt_payload}\n\nQuestion: {query}"],
        config={"temperature": 0.0}
    )
    
    print("Gemini 2.5 Flash Retrieval Result:\n", response.text)

# Вызов из CLI:
# python -m benchmarks.niah_runner --model gemini-2.5-flash --depths 0.2,0.5,0.8 --tokens 1000000

Анализ через CLI с помощью Code-SuperNova 1M

# Загрузка репозитория объёмом 850k токенов целиком и аудит на наличие утечек памяти нулевого дня (0-day)
code-supernova audit \
  --repo-dir ./enterprise-monorepo \
  --context-window 1048576 \
  --needle-mode multi-ast \
  --temperature 0.1 \
  --output ./audit_report.json

7. Экономика и стоимость одного запроса (Cost-Per-Query) при 1M токенов

В архитектурах с длинным контекстом экономическая целесообразность напрямую зависит от кэширования промптов (Prompt Caching). Запрос объёмом 1M токенов без кэширования делает высокочастотные рабочие процессы непомерно дорогими.

Структура затрат на 1 000 000 входных токенов

+---------------------------------------------------------------------------------------------------+
|                             ЭКОНОМИКА ОБРАБОТКИ ЗАПРОСОВ НА 1M ТОКЕНОВ                            |
+---------------------------------------------------------------------------------------------------+
| Модель                | Запрос без кэша       | С кэшем (90% Hit)      | 100 запросов/день (кэш)  |
+-----------------------+-----------------------+------------------------+--------------------------+
| Gemini 2.5 Flash      | $0.30                 | $0.075                 | $7.50 / день             |
| Kimi K2.5             | $0.25                 | $0.100                 | $10.00 / день            |
| Code-SuperNova 1M     | $0.80                 | $0.160                 | $16.00 / день            |
| Claude 3.7 Sonnet     | $3.00                 | $0.300                 | $30.00 / день            |
+-----------------------+-----------------------+------------------------+--------------------------+

Анализ точки безубыточности кэширования промптов (Prompt Caching):

  • Без кэширования промптов выполнение 50 запросов по всему репозиторию в день на Claude 3.7 Sonnet обходится в $150,00 в день ($4 500 в месяц).
  • При использовании 90%-й скидки Anthropic на кэширование промптов та же самая нагрузка стоит $15,00 в день ($450 в месяц), что обеспечивает чистую экономию $4 050 в месяц.
  • Для чувствительных к затратам пайплайнов извлечения данных с высокой пропускной способностью Gemini 2.5 Flash обеспечивает наименьшую совокупную стоимость владения ($0,075 за 1M кэшированных токенов), сохраняя скорость на уровне 148 TPS.

8. Архитектурные рекомендации E-E-A-T и итоги

Итоговая матрица выбора:

  1. Выбирайте Gemini 2.5 Flash (2M), если вашим приоритетом являются высокая пропускная способность, низкая задержка для интерактивной работы в реальном времени, масштабный мультимодальный контекст (видео, аудио, книги в PDF) и предельно низкая стоимость API.
  2. Выбирайте Code-SuperNova 1M для автоматизированной разработки на уровне всего репозитория, многофайлового рефакторинга и сложного графового анализа компилятора/AST, где критически важна абсолютная точность синтаксиса кода.
  3. Выбирайте Claude 3.7 Sonnet (1M Extended) для глубокого интеллектуального синтеза, ответственных аудитов безопасности, анализа юридических контрактов и тонких рассуждений в условиях неоднозначных требований.
  4. Выбирайте Kimi K2.5 (2M) для экономичной двуязычной (англо-китайской) обработки длинного контекста, анализа табличных данных и суммаризации больших объёмов текста.

Лучшие практики для продакшена:

  • Никогда не полагайтесь исключительно на тесты с одной «иголкой» (single-needle benchmarks): всегда оценивайте модели-кандидаты с помощью предметно-ориентированных multi-needle тестов, отражающих точную схему ваших данных.
  • Обеспечивайте строгие границы кэширования промптов: структурируйте запросы так, чтобы статический префикс контекста размером более 800k токенов оставался неизменным между запросами, максимизируя повторное использование KV-кэша.
  • Внедряйте гибридный RAG для последовательностей >1M токенов: для баз знаний объёмом более 2M токенов гибридная архитектура, сочетающая векторный/лексический поиск (с сужением до 200k наиболее релевантных токенов) с рассуждениями LLM на длинном контексте, стабильно превосходит «наивную» прямую загрузку 2M токенов как по точности, так и по задержке.
← Все статьи
0 / 4
Сравнить →