র‌্যাংকিং

দ্রুততম LLM: আউটপুট গতি ও লেটেন্সি তুলনা

গতি সেই বেঞ্চমার্ক যা ব্যবহারকারী প্রতিদিন অনুভব করেন, এবং ২০২৬ সালে এর বিস্তার বিশাল: শীর্ষে সেকেন্ডে ৩৮৯ টোকেন থেকে বড় রিজনিং মডেলের এক অঙ্ক পর্যন্ত। আমাদের গতি র‌্যাংকিং থেকে বর্তমান অবস্থা।

এখনকার দ্রুততম মডেল

  1. Gemini 3.5 Flash-Lite — ৩৮৯ t/s
  2. Gemini 3.5 Flash — ২৬৭ t/s
  3. Gemini 3.6 Flash — ২৩৩ t/s
  4. Muse Spark 1.1 (Meta) — ২০৮ t/s
  5. Qwen3.7 Max — ২০৩ t/s

Google-এর Flash পরিবার পুরো পোডিয়াম দখল করেছে, এবং Meta-র Muse Spark 1.1 লক্ষ্য করুন: $৪.২৫/M আউটপুটে ২০৮ t/s এটাকে আমাদের ট্র্যাক করা সেরা গতি-প্রতি-ডলার বিকল্পগুলোর একটি করে।

গতি বনাম বুদ্ধিমত্তার ট্রেড-অফ

দ্রুততম মডেল সবচেয়ে বুদ্ধিমান নয়: Flash-Lite কাঁচা সক্ষমতাকে থ্রুপুটের বিনিময়ে দেয়। ২০২৬-এর ব্যবহারিক প্যাটার্ন রাউটিং — খসড়া ও টুল কলের জন্য দ্রুত মডেল, কঠিন ৫%-এর জন্য Claude Mythos Preview-এর মতো ফ্রন্টিয়ার মডেল। আমাদের তুলনা টুল গতি ও Podium Score পাশাপাশি দেখায়।

চ্যাটের জন্য লেটেন্সি (TTFT) গুরুত্বপূর্ণ

অনুভূত সাড়াদান ক্ষমতাকে প্রথম টোকেনের সময় নিয়ন্ত্রণ করে। চ্যাট পণ্যে, ১৫০ ms TTFT-সহ ২০০ t/s মডেল ২ সেকেন্ড কোল্ড স্টার্ট সহ ৩৮৯ t/s মডেলের চেয়ে দ্রুত মনে হয় — সবসময় দুটি সংখ্যাই মূল্যায়ন করুন, যা প্রতিটি মডেলের প্রোফাইলে দেখা যায় (যেমন Claude Fable 5: ৭১ t/s, ১৪১ ms TTFT)।

উপসংহার

বিশুদ্ধ থ্রুপুটের জন্য Gemini Flash-Lite বেছে নিন; গতি + গুণমানের ভারসাম্যের জন্য Muse Spark 1.1 বা Qwen3.7 Max। লাইভ সংখ্যা গতি র‌্যাংকিং-এ।

← সব নিবন্ধ