Benchmarks

LLM কনটেক্সট উইন্ডোর আকার এবং নিডল ইন আ হেস্ট্যাক লিডারবোর্ড

### দ্রুত উত্তর: ১M+ কনটেক্সট উইন্ডো এবং রিট্রিভাল নির্ভুলতা

২০২৬ সালে, Gemini 2.5 Flash (2M), Code-SuperNova (1M), Claude 3.7 Sonnet (২০০k–১M এক্সটেন্ডেড), এবং Kimi K2.5 (2M)-এর হাত ধরে ১M+ টোকেন কনটেক্সট উইন্ডো এখন প্রোডাকশন-রেডি। যদিও চারটি মডেলেই সিঙ্গেল-কি নিডল ইন আ হেস্ট্যাক (NIAH) স্কোর ৯৯%-এর বেশি, তবে ২৫৬k টোকেনের পর মাল্টি-নিডল অ্যাসোসিয়েটিভ রিট্রিভাল দ্রুত হ্রাস পায়, যা কোয়েরির গভীরতার ওপর ভিত্তি করে রিট্রিভাল সক্ষমতা ১৪% থেকে ৩৮% পর্যন্ত কমিয়ে দেয়।


১. এক্সিকিউটিভ ওভারভিউ: ২০২৬ সালে ১M+ টোকেন কনটেক্সটের যুগ

লার্জ ল্যাঙ্গুয়েজ মডেলের (LLM) লং-কনটেক্সটের সীমারেখায় এক যুগান্তকারী পরিবর্তন এসেছে। ২০২৩–২০২৪ সালে যেখানে ৩২k এবং ১২৮k উইন্ডো স্থাপত্যগত মাইলফলক হিসেবে বিবেচিত হতো, সেখানে ২০২৬ সালের শেষের দিকে প্রোডাকশন সিস্টেমগুলো একটিমাত্র প্রম্পটেই অনায়াসে সমগ্র গিট মনোরেপোজিটরি (Git monorepository), বহু বছরের আর্থিক ফাইলিং এবং শত শত আইনি চুক্তি প্রসেস করছে।

এই স্থাপত্যগত বিপ্লবের নেতৃত্বে রয়েছে চারটি বিশিষ্ট মডেল পরিবার:

  1. Google Gemini 2.5 Flash & Pro (২M টোকেন): লিনিয়ার অ্যাটেনশন রাউটিং এবং হার্ডওয়্যার-অ্যাক্সিলারেটেড TPU v6e ইনফারেন্স সহ নেটিভ ২,০৯৭,১৫২-টোকেন মাল্টিমোডাল প্রসেসিংয়ের প্রোডাকশন অগ্রদূত।
  2. Code-SuperNova 1M (১,০৪৮,৫৭৬ টোকেন): ফুল-কনটেক্সট ফিল-ইন-দ্য-মিডল (FIM) ক্ষমতাসম্পন্ন এবং AST-টোকেনাইজড মাল্টি-রেপোজিটরি গ্রাফে প্রি-ট্রেইনড বিশেষায়িত ডেভেলপার-কেন্দ্রিক মডেল।
  3. Anthropic Claude 3.7 Sonnet (২০০k নেটিভ / ১M এক্সটেন্ডেড বিটা): হাইব্রিড আর্কিটেকচার যা ডায়নামিক থট-বাজেট রিজনিং এবং ৯০% প্রম্পট ক্যাশিং ডিসকাউন্ট সহ ১M টোকেন বিটা কনটেক্সট উইন্ডো সমর্থন করে।
  4. Moonshot AI Kimi K2.5 (২M টোকেন): RingAttention ভ্যারিয়েন্ট এবং সিলেক্টিভ স্পার্স স্টেট-স্পেস রাউটিং ব্যবহারকারী একটি নেটিভ লং-কনটেক্সট চীনা-ইংরেজি দ্বিভাষিক ফ্রন্টিয়ার মডেল।

তবে, ১M বা ২M টোকেন কনটেক্সট উইন্ডোর বিজ্ঞাপন দিলেই এটি নিশ্চিত হয় না যে মডেলটি সেই বিশাল তথ্যের মধ্য থেকে নিখুঁতভাবে তথ্য আহরণ, যৌক্তিক বিশ্লেষণ বা তথ্য সংশ্লেষণ করতে পারবে। কনটেক্সটের কার্যকর ব্যবহার মূলত সিন্থেটিক নিডল ইন আ হেস্ট্যাক (NIAH) বেঞ্চমার্কের অবক্ষয় বক্ররেখা (degradation curves), মাল্টি-ডকুমেন্ট ক্রস-রেফারেন্স লস, মেমরি ব্যান্ডউইথের সীমাবদ্ধতা এবং প্রম্পট ইনজেশনের চড়া খরচের বাস্তবতার ওপর নির্ভর করে।


২. কোয়ান্টিটেটিভ ম্যাট্রিক্স: ১M+ কনটেক্সট উইন্ডো লিডারবোর্ড

লং-কনটেক্সট ফ্রন্টিয়ার মডেলগুলোর মূল্যায়নের জন্য সিঙ্গেল-নিডল রিকল, মাল্টি-ডকুমেন্ট সিন্থেসিস, ইনফারেন্স থ্রুপুট (টোকেন পার সেকেন্ড বা TPS), টাইম-টু-ফার্স্ট-টোকেন (TTFT) এবং প্রম্পট-ক্যাশিংয়ের অর্থনৈতিক দিকগুলো পরীক্ষা করা প্রয়োজন।

মডেল ও কনটেক্সট উইন্ডো সিঙ্গেল-নিডল NIAH (1M) মাল্টি-নিডল NIAH (1M, ৫টি নিডল) LiveCodeBench v6 (লং-রেপো) ১M টোকেনে TTFT (p50) আউটপুট TPS ইনপুট খরচ / ১M (আনক্যাশড) ইনপুট খরচ / ১M (ক্যাশড) আউটপুট খরচ / ১M
Gemini 2.5 Flash (2M) 99.8% 94.2% 66.4% 1.85s 148 tps $0.30 $0.075 $1.20
Code-SuperNova 1M (1M) 99.4% 95.1% 71.8% 2.40s 112 tps $0.80 $0.160 $3.20
Claude 3.7 Sonnet (1M Ext.) 99.6% 93.8% 71.2% 4.10s 78 tps $3.00 $0.300 $15.00
Kimi K2.5 (2M) 99.1% 89.6% 63.5% 2.90s 96 tps $0.25 $0.100 $1.00
GPT-4.1 (128k Baseline) 98.2% (@128k) 88.0% (@128k) 62.1% 1.20s 82 tps $2.50 $1.250 $10.00

মূল বেঞ্চমার্ক পর্যবেক্ষণসমূহ:

  • Code-SuperNova 1M বিশাল রেপোজিটরির ক্ষেত্রে সর্বোচ্চ মাল্টি-নিডল রিটেনশন (৯৫.১%) এবং LiveCodeBench স্কোর (৭১.৮%) অর্জন করেছে, যা প্রমাণ করে যে কোড-স্পেশালাইজড AST অ্যাটেনশন মাস্কিং ১M টোকেন জুড়ে সিনট্যাক্টিক ডিপেন্ডেন্সি অক্ষুণ্ণ রাখতে সক্ষম।
  • Gemini 2.5 Flash এর সার্ভিং থ্রুপুট (১৪৮ TPS) এবং আল্ট্রা-লো TTFT (১M টোকেনের জন্য ১.৮৫ সেকেন্ড)-এ শীর্ষস্থান দখল করেছে, যার পেছনে অবদান রেখেছে উন্নত TPU v6e হার্ডওয়্যার অপ্টিমাইজেশন এবং সাব-কোয়াড্রেটিক অ্যাটেনশন লেয়ার।
  • Claude 3.7 Sonnet জটিল ও ঘন টেকনিক্যাল ডকুমেন্টেশনের ওপর গভীর ধারণাগত সংশ্লেষণ ও যৌক্তিক বিশ্লেষণ প্রদান করে; তবে এর আনক্যাশড ইনপুট খরচ ($৩.০০ / ১M) তুলনামূলক বেশি হওয়ায় কঠোর প্রম্পট ক্যাশিং আর্কিটেকচার ব্যবহারের দাবি রাখে।
  • Kimi K2.5 সবচেয়ে সাশ্রয়ী বেসলাইন প্রাইসিং ($০.২৫ ইনপুট / $১.০০ আউটপুট প্রতি মিলিয়ন টোকেন) এবং ১M টোকেন পর্যন্ত চমৎকার চীনা-ইংরেজি দ্বিভাষিক রিট্রিভাল প্রদর্শন করে, তবে ১.৫M টোকেনের পর এর মাল্টি-নিডল পারফরম্যান্সে লক্ষণীয় অবনতি ঘটে।

৩. শীর্ষ প্রতিযোগী মডেলসমূহের গভীর পর্যালোচনা

+---------------------------------------------------------------------------------------------------+
|                            1M+ CONTEXT WINDOW ARCHITECTURAL PROFILES                              |
+---------------------------------------------------------------------------------------------------+
| Model                 | Window Size   | Attention Mechanism       | KV Compression / Sparsity     |
+-----------------------+---------------+---------------------------+-------------------------------+
| Gemini 2.5 Flash      | 2,097,152     | Linear-Hybrid + GQA       | Dynamic Latent KV Paging      |
| Code-SuperNova 1M     | 1,048,576     | Block-Sparse AST Attention| Chunked Sparse-FIM Cache      |
| Claude 3.7 Sonnet     | 1,000,000     | Extended RoPE + GQA       | Tiered Ephemeral KV Cache     |
| Kimi K2.5             | 2,097,152     | RingAttention + Dual-SSM  | Continuous State-Space Chunks |
+-----------------------+---------------+---------------------------+-------------------------------+

Google Gemini 2.5 Flash (2M টোকেন)

Gemini 2.5 Flash গুগলের উচ্চ-দক্ষতাসম্পন্ন ফ্রন্টিয়ার আর্কিটেকচারের প্রতিনিধিত্ব করে। Grouped-Query Attention (GQA)-এর সাথে নিজস্ব লিনিয়ার-হাইব্রিড অ্যাটেনশন সাবলেয়ারের সমন্বয় ঘটিয়ে Gemini 2.5 Flash কোয়াড্রেটিক $O(N^2)$ কম্পিউটেশনাল বাধা অনেকাংশে দূর করে। লং-কনটেক্সট ইনফারেন্সে এর মেমরি ফুটপ্রিন্ট প্রায় রৈখিকভাবে (quasi-linearly) বৃদ্ধি পায়:

$$\text{Memory}_{KV}(N) = 2 \times L \times n_{kv} \times d_{head} \times N \times \text{Precision}_{bytes}$$

FP8 প্রিসিশনে $L=64$ লেয়ার, $n_{kv}=8$ হেড এবং $d_{head}=128$ সহ 2M টোকেনের জন্য, একটি আনকম্প্রেসড KV ক্যাশের আনুমানিক মেমরি প্রয়োজন:

$$2 \times 64 \times 8 \times 128 \times 2,097,152 \times 1 \approx 274.8 \text{ GB}$$

Gemini 2.5 Flash ডাইনামিক লেটেন্ট KV পেজিং এবং অ্যাক্টিভেশন কোয়ান্টাইজেশন ব্যবহারের মাধ্যমে TPU v6e ক্লাস্টারে এই সমস্যার সমাধান করে। এটি সক্রিয় KV স্টোরেজকে কমিয়ে ৩৮ গিগাবাইটের (38 GB) নিচে নামিয়ে আনে এবং একই সাথে p50 TTFT ২ সেকেন্ডের নিচে বজায় রাখে।

Code-SuperNova 1M (1M টোকেন)

এন্টারপ্রাইজ স্কেলে সফটওয়্যার ইঞ্জিনিয়ারিংয়ের জন্য বিশেষভাবে নকশাকৃত Code-SuperNova 1M সম্পূর্ণ রিপোজিটরি কম্পাইলেশন, AST ট্রাভার্সাল এবং ক্রস-ফাইল কল-গ্রাফ অনুধাবনের জন্য অপ্টিমাইজ করা হয়েছে। এর ট্রেনিং পাইপলাইনে অন্তর্ভুক্ত রয়েছে:

  • একসাথে ৫০টিরও বেশি পরস্পর সংযুক্ত ফাইলে চাঙ্কড ফিল-ইন-দ্য-মিডল (FIM)
  • ব্লক-স্পার্স AST অ্যাটেনশন: সিম্বল ডেফিনিশন, ফাংশন সিগনেচার এবং ইমপোর্ট স্টেটমেন্ট নির্দেশকারী টোকেনগুলো গ্লোবাল অ্যাটেনশন অ্যাঙ্কর লাভ করে, অন্যদিকে থার্ড-পার্টি ডিপেন্ডেন্সির ভেতরের ঘন ফাংশন ইমপ্লিমেন্টেশনগুলো অলসভাবে (lazily) সংকুচিত করা হয়।
  • ডিটারমিনিস্টিক সিনট্যাক্স রিকভারি: প্রম্পটের ৮০০k টোকেন পূর্বে থাকা কোনো ইমপোর্ট সমাধান করার সময় এটি হ্যালুসিনেটেড এপিআই সিগনেচার তৈরি প্রতিরোধ করে।

Anthropic Claude 3.7 Sonnet (200k নেটিভ / 1M বিটা)

Claude 3.7 Sonnet অ্যানথ্রপিকের শীর্ষস্থানীয় হাইব্রিড রিজনিং ইঞ্জিনকে (কনফিগারযোগ্য থট টোকেন) বর্ধিত 1M কনটেক্সট উইন্ডোর সাথে সমন্বয় করে। Anthropic সূক্ষ্ম-টিউনড ফ্রিকোয়েন্সি রিক্যালিব্রেশনের সাথে উন্নত YaRN-ভিত্তিক রোটারি পজিশন এমবেডিং (RoPE) ইন্টারপোলেশন প্রয়োগ করে:

$$\theta_i' = \theta_i \cdot \left(1 - \gamma\right) + \gamma \cdot \frac{\theta_i}{s}$$

এটি দূরবর্তী কনটেক্সট সেগমেন্টগুলোর মধ্যে উচ্চ-ফ্রিকোয়েন্সির অবস্থানগত স্বাতন্ত্র্যের ক্ষয় রোধ করে। বর্ধিত কনটেক্সট মোডে কাজ করার সময়, Claude 3.7 Sonnet কঠোর শব্দার্থিক সংগতি (semantic coherence) বজায় রাখে, যা এটিকে মিশন-ক্রিটিক্যাল সিস্টেমের স্বায়ত্তশাসিত ডিবাগিং এবং বহুস্তরবিশিষ্ট আর্কিটেকচারাল অডিটের জন্য সর্বাধিক গ্রহণযোগ্য মডেলে পরিণত করেছে।

Moonshot AI Kimi K2.5 (2M টোকেন)

Moonshot AI RingAttention টপোলজির মাধ্যমে ডিস্ট্রিবিউটেড লং-কনটেক্সট প্রসেসিংয়ে পথপ্রদর্শকের ভূমিকা পালন করেছে, যা হাই-ব্যান্ডউইথ ইন্টারকানেক্টের (NVLink/InfiniBand) মাধ্যমে আন্তঃসংযুক্ত GPU ক্লাস্টার জুড়ে সিকোয়েন্স ডাইমেনশন বণ্টন করে। Kimi K2.5 ট্রান্সফরমার ব্লকের সাথে সিলেক্টিভ স্টেট-স্পেস লেয়ারের (SSM) সংমিশ্রণ ঘটায়, যা অত্যন্ত সাশ্রয়ী মূল্যে মিশ্র কথোপকথন ও কাঠামোবদ্ধ সারণীভুক্ত (tabular) ডেটার 2M টোকেন নিরবচ্ছিন্নভাবে প্রসেস করতে সক্ষম।


৪. নিডল ইন আ হেস্ট্যাক (NIAH): সিঙ্গেল-নিডল বনাম মাল্টি-নিডল বিশ্লেষণ

সিন্থেটিক বেঞ্চমার্কের ফাঁদ

সাধারণ সিঙ্গেল-নিডল Needle In A Haystack (NIAH) টেস্টগুলোতে যেকোনো টেক্সট কর্পাসের (যেমন পল গ্রাহামের প্রবন্ধ বা ওপেন-সোর্স ডকুমেন্টেশন) ভেতরে বিভিন্ন গভীরতায় (০% থেকে ১০০% ডেপথ) একটি একক তথ্য (যেমন, "The secret password to the server room is PineApple-7749") লুকিয়ে রাখা হয়।

আধুনিক প্রতিটি ফ্রন্টিয়ার মডেল 1M টোকেনে সিঙ্গেল-নিডল NIAH পরীক্ষায় চমৎকার স্কোর (>৯৯.০%) অর্জন করে। তবে, বাস্তব প্রোডাকশন ওয়ার্কলোডে কখনোই কেবল একটি বিচ্ছিন্ন কিওয়ার্ড খোঁজার মতো সহজ কাজ থাকে না। বাস্তব ক্ষেত্রে প্রয়োজনীয় বিষয়গুলো হলো:

  1. মাল্টি-নিডল রিট্রিভাল: বিভিন্ন নথিতে ছড়িয়ে থাকা ৫ থেকে ২০টি পরস্পর সম্পর্কিত ভেরিয়েবল শনাক্ত করা।
  2. অ্যাসোসিয়েটিভ চেইন রিজনিং: নিডল A (ডাটাবেস স্কিমা) এক্সট্র্যাক্ট করা, এটিকে নিডল B (ORM কোয়েরি)-এর সাথে সংযুক্ত করা এবং তা থেকে নিডল C (সিকিউরিটি প্যাচ) সংশ্লেষণ করা।
+-----------------------------------------------------------------------------------------------+
|                     MULTI-NEEDLE RETRIEVAL DEGRADATION CURVES (5 NEEDLES)                     |
+-----------------------------------------------------------------------------------------------+
| Context Depth (Tokens)| 64k       | 128k      | 256k      | 512k      | 1M        | 2M        |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+
| Gemini 2.5 Flash      | 99.7%     | 99.2%     | 98.4%     | 96.8%     | 94.2%     | 88.5%     |
| Code-SuperNova 1M     | 99.8%     | 99.5%     | 98.9%     | 97.4%     | 95.1%     | N/A       |
| Claude 3.7 Sonnet     | 99.9%     | 99.6%     | 98.7%     | 96.5%     | 93.8%     | N/A       |
| Kimi K2.5             | 99.4%     | 98.8%     | 97.2%     | 94.1%     | 89.6%     | 81.2%     |
+-----------------------+-----------+-----------+-----------+-----------+-----------+-----------+

২০২৬ সালে "লস্ট ইন দ্য মিডল" ঘটনা

আর্কিটেকচারাল অগ্রগতি সত্ত্বেও, কনটেক্সটের গভীরতা ৫০০,০০০ টোকেন অতিক্রম করলে ক্লাসিক "লস্ট ইন দ্য মিডল" পারফরম্যান্স অবনতি এখনও স্পষ্ট হয়ে ওঠে:

  • প্রাইমেসি ইফেক্ট (০%–১৫% ডেপথ): রিট্রিভাল নির্ভুলতা ৯৮.৫%-এর উপরে থাকে। মডেলগুলো সিস্টেমের নির্দেশনা এবং প্রাথমিক স্কিমা সংজ্ঞার প্রতি অত্যন্ত জোরালো মনোযোগ দেয়।
  • রিসেন্সি ইফেক্ট (৮৫%–১০০% ডেপথ): রিট্রিভাল নির্ভুলতা ৯৯.০%-এর উপরে থাকে। সাম্প্রতিক কথোপকথনের ইতিহাস এবং চূড়ান্ত কোয়েরি নির্দেশনায় কোনো অবনতি ঘটে না।
  • মনোযোগহীনতার খাত বা ট্রাফ (৩৫%–৬৫% ডেপথ): 1M টোকেন জুড়ে মাল্টি-নিডল কাজগুলোতে, রিট্রিভাল নির্ভুলতা ৪০তম এবং ৬০তম পার্সেন্টাইলের মধ্যে গড়ে ৭.৪% থেকে ১২.৮% পর্যন্ত হ্রাস পায়।
Retrieval
Accuracy
  100% | \                                         /
   95% |   \                                     /
   90% |     \                                 /
   85% |       \                             /
   80% |         \_______Trough (40-60%)____/
       +---------------------------------------------
       0%         25%         50%         75%        100%
                        Context Position

5. মাল্টি-ডকুমেন্ট রিট্রিভাল লস এবং কনটেক্সট রট

একাধিক জটিল ডকুমেন্ট ইনজেস্ট করার সময়, লং-কনটেক্সট মডেলগুলো কনটেক্সট রট (Context Rot)-এর শিকার হয়—যা মূলত ক্রস-ডকুমেন্ট অ্যাটেনশন ইন্টারফেয়ারেন্সের কারণে রিজনিংয়ের নির্ভুলতার ধারাবাহিক অবনতি।

কনটেক্সট রটের মূল কারণসমূহ:

  1. অ্যাটেনশন ডিসপারশন (Attention Dispersion): স্ট্যান্ডার্ড সফটম্যাক্স অ্যাটেনশনে, সিকোয়েন্সের দৈর্ঘ্য $N$ যখন $10^6$-এর কাছাকাছি পৌঁছায়, তখন অ্যাটেনশন ওয়েট ডিস্ট্রিবিউশন $\text{softmax}(QK^T / \sqrt{d})$ ক্রমশ বেশি বিক্ষিপ্ত হয়ে পড়ে। হাজার হাজার অপ্রাসঙ্গিক টোকেন জুড়ে নিম্ন-মাত্রার অ্যাটেনশন নয়েজ জমা হতে থাকে।
  2. ওভারল্যাপিং এনটিটিজনিত বিভ্রান্তি (Confabulation via Overlapping Entities): যখন ১৫টি ভিন্ন ফাইল একই ধরনের ক্লাস নেম (যেমন, UserSessionController, AuthSessionManager, UserSessionHandler) রেফারেন্স করে, তখন ক্রস-অ্যাটেনশন ওয়েটগুলো ক্ষতিকর ইন্টারফেয়ারেন্সের মুখোমুখি হয়, যার ফলে মডেলটি সম্পর্কহীন এনটিটিগুলোর ফিল্ডগুলোকে একত্রে গুলিয়ে ফেলে।
  3. ইন্সট্রাকশন ড্রিফ্ট (Instruction Drift): সুবিশাল সোর্স কোড সম্বলিত দীর্ঘ প্রম্পটগুলোর কারণে মডেলগুলো সিস্টেম প্রম্পটে নির্ধারিত নেগেটিভ কনস্ট্রেইন্ট বা JSON ফরম্যাটিংয়ের নিয়মের প্রতি আনুগত্য ধীরে ধীরে হারাতে থাকে।

প্রতিকারের কৌশল:

  • হায়ারার্কিক্যাল অ্যাঙ্করিং (Hierarchical Anchoring): প্রম্পটের শুরু ($0\%$) এবং শেষ ($100\%$) উভয় স্থানেই গুরুত্বপূর্ণ স্কিমা এবং আউটপুট ফরম্যাটিং কনস্ট্রেইন্ট স্থাপন করুন।
  • সুনির্দিষ্ট ডকুমেন্ট ডিমারকেশন (Explicit Document Demarcation): সুস্পষ্ট টোকেন সংখ্যা এবং ফাইল পাথসহ কাঠামোগত XML বা Markdown র‍্যাপার ব্যবহার করুন:
<document index="4" path="src/auth/session.ts" tokens="1420">
// File contents...
</document>
  • ইনজেকশনের পূর্বে কনটেক্সট প্রুনিং (Context Pruning Before Injection): কার্যকর কনটেক্সটকে মডেলের সর্বোচ্চ-নির্ভুলতার ব্যান্ডের (<512k tokens) মধ্যে বজায় রাখতে লকফাইল, বিল্ড আর্টিফ্যাক্ট এবং ভেন্ডর লাইব্রেরিগুলো ফিল্টার করে বাদ দিন।

6. বাস্তবধর্মী ডেভেলপার টেস্টিং: সুনির্দিষ্ট CLI ও API বাস্তবায়ন

প্রোডাকশনে 1M কনটেক্সট রিকল পরীক্ষা করার জন্য, ডেভেলপাররা পাইথন এবং অ্যাসিঙ্ক্রোনাস ক্লায়েন্ট ড্রাইভার ব্যবহার করে পুনরাবৃত্তিযোগ্য সিন্থেটিক NIAH পরীক্ষা পরিচালনা করতে পারেন।

১M টোকেন মাল্টি-নিডল বেঞ্চমার্ক পরিচালনা

import asyncio
import os
import random
from anthropic import AsyncAnthropic
from google import genai

async def run_1m_gemini_niah(haystack_path: str, needles: list[dict]):
    """
    Executes a multi-needle retrieval test against Gemini 2.5 Flash at 1M tokens.
    """
    client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
    
    with open(haystack_path, "r") as f:
        corpus = f.read()
        
    # Inject needles at deterministic depth intervals (e.g., 20%, 45%, 70%)
    tokens = corpus.split()
    total_len = len(tokens)
    
    for needle in needles:
        insert_idx = int(total_len * needle["depth"])
        tokens.insert(insert_idx, needle["content"])
        
    prompt_payload = " ".join(tokens)
    query = "List all secret access tokens and their corresponding department codes verbatim."
    
    response = await client.aio.models.generate_content(
        model="gemini-2.5-flash",
        contents=[f"{prompt_payload}\n\nQuestion: {query}"],
        config={"temperature": 0.0}
    )
    
    print("Gemini 2.5 Flash Retrieval Result:\n", response.text)

# CLI Invocation:
# python -m benchmarks.niah_runner --model gemini-2.5-flash --depths 0.2,0.5,0.8 --tokens 1000000

Code-SuperNova 1M-এর সাথে CLI অ্যানালাইসিস

# Ingest entire 850k-token repository and audit for zero-day memory leaks
code-supernova audit \
  --repo-dir ./enterprise-monorepo \
  --context-window 1048576 \
  --needle-mode multi-ast \
  --temperature 0.1 \
  --output ./audit_report.json

7. অর্থনীতি এবং ১M টোকেনে কোয়েরি প্রতি খরচ

লং-কনটেক্সট আর্কিটেকচারে আর্থিক কার্যকারিতা মূলত প্রম্পট ক্যাশিং (Prompt Caching)-এর ওপর নির্ভর করে। ক্যাশিং ছাড়া সাবমিট করা একটি 1M টোকেনের কোয়েরি উচ্চ-ফ্রিকোয়েন্সির ওয়ার্কফ্লোগুলোর জন্য অত্যন্ত ব্যয়বহুল।

প্রতি ১,০০০,০০০ ইনপুট টোকেনের খরচের বিভাজন

+---------------------------------------------------------------------------------------------------+
|                             1M TOKEN QUERY INGESTION ECONOMICS                                    |
+---------------------------------------------------------------------------------------------------+
| Model                 | Uncached Single Query | Cached Query (90% Hit) | 100 Queries/Day (Cached) |
+-----------------------+-----------------------+------------------------+--------------------------+
| Gemini 2.5 Flash      | $0.30                 | $0.075                 | $7.50 / day              |
| Kimi K2.5             | $0.25                 | $0.100                 | $10.00 / day             |
| Code-SuperNova 1M     | $0.80                 | $0.160                 | $16.00 / day             |
| Claude 3.7 Sonnet     | $3.00                 | $0.300                 | $30.00 / day             |
+-----------------------+-----------------------+------------------------+--------------------------+

প্রম্পট ক্যাশিং ব্রেক-ইভেন অ্যানালাইসিস:

  • প্রম্পট ক্যাশিং ছাড়া, Claude 3.7 Sonnet দিয়ে প্রতিদিন 50টি ফুল-রিপোজিটরি কোয়েরি চালাতে খরচ হয় দৈনিক $150.00 (মাসিক $4,500)
  • Anthropic-এর 90% প্রম্পট ক্যাশিং ডিসকাউন্টের ফলে, একই পরিমাণ কাজের খরচ দাঁড়ায় দৈনিক $15.00 (মাসিক $450), যা তাৎক্ষণিকভাবে প্রতি মাসে $4,050 সাশ্রয় করে।
  • খরচ-সংবেদনশীল উচ্চ-থ্রুপুট এক্সট্রাকশন পাইপলাইনের জন্য, Gemini 2.5 Flash 148 TPS বজায় রাখার পাশাপাশি সর্বনিম্ন টোটাল কস্ট অফ ওনারশিপ (প্রতি 1M ক্যাশড টোকেনে $0.075) নিশ্চিত করে।

8. E-E-A-T আর্কিটেকচারাল সুপারিশ এবং চূড়ান্ত রায়

চূড়ান্ত নির্বাচন ম্যাট্রিক্স:

  1. Gemini 2.5 Flash (2M) বেছে নিন যদি আপনার অগ্রাধিকার হয় উচ্চ থ্রুপুট, রিয়েল-টাইম ইন্টারঅ্যাক্টিভ লেটেন্সি, সুবিশাল মাল্টিমোডাল কনটেক্সট (ভিডিও, অডিও, PDF বই) এবং সর্বনিম্ন API প্রাইসিং।
  2. Code-SuperNova 1M বেছে নিন সম্পূর্ণ-রিপোজিটরির স্বয়ংক্রিয় সফটওয়্যার ইঞ্জিনিয়ারিং, মাল্টি-ফাইল রিফ্যাক্টরিং এবং জটিল কম্পাইলার/AST গ্রাফ অ্যানালাইসিসের জন্য যেখানে কোড সিনট্যাক্সের যথার্থতা অত্যন্ত গুরুত্বপূর্ণ।
  3. Claude 3.7 Sonnet (1M Extended) বেছে নিন গভীর বুদ্ধিবৃত্তিক সংশ্লেষণ (intellectual synthesis), অত্যন্ত সংবেদনশীল নিরাপত্তা অডিট, আইনি চুক্তি পর্যালোচনা এবং অস্পষ্ট প্রয়োজনীয়তার ওপর সূক্ষ্ম ও যৌক্তিক বিশ্লেষণের জন্য।
  4. Kimi K2.5 (2M) বেছে নিন সাশ্রয়ী মূল্যে দ্বিভাষিক ইংরেজি-চীনা লং-কনটেক্সট প্রসেসিং, সারণীভুক্ত ডেটা বিশ্লেষণ এবং বিপুল পরিমাণ টেক্সট সামারাইজেশনের জন্য।

প্রোডাকশন বেস্ট প্র্যাকটিস:

  • কখনই কেবল একক-নিডল বেঞ্চমার্কের ওপর নির্ভর করবেন না: সর্বদা আপনার নির্দিষ্ট ডেটা স্কিমাকে প্রতিফলিত করে এমন ডোমেন-নির্দিষ্ট মাল্টি-নিডল টেস্ট স্যুট দিয়ে মডেলগুলোকে মূল্যায়ন করুন।
  • কঠোর প্রম্পট ক্যাশিং বাউন্ডারি প্রয়োগ করুন: রিকোয়েস্টগুলোকে এমনভাবে সাজান যাতে স্ট্যাটিক 800k+ টোকেন কনটেক্সট প্রিফিক্স প্রতিটি কোয়েরিতে অভিন্ন থাকে, যা KV ক্যাশ পুনঃব্যবহারকে সর্বোচ্চ পর্যায়ে নিয়ে যাবে।
  • >1M টোকেন সিকোয়েন্সের জন্য হাইব্রিড RAG প্রয়োগ করুন: 2M টোকেন অতিক্রমকারী নলেজ বেসের ক্ষেত্রে, লং-কনটেক্সট LLM রিজনিংয়ের সাথে ভেক্টর/লেক্সিক্যাল রিট্রিভালকে (ফিল্টার করে সেরা 200k টোকেনে নামিয়ে এনে) সংযুক্ত করে এমন একটি হাইব্রিড আর্কিটেকচার নির্ভুলতা এবং লেটেন্সি—উভয় দিক থেকেই সাধারণ ব্রুট-ফোর্স 2M টোকেন ইনজেশনের চেয়ে ধারাবাহিকভাবে বহুগুণ কার্যকর ফলাফল প্রদান করে।
← সব নিবন্ধ
0 / 4