Benchmarks

Papan Peringkat Humanity's Last Exam: Tolok Ukur AI Terdepan

### Jawaban Cepat: Apa itu Tolok Ukur Humanity's Last Exam (HLE)?

Humanity's Last Exam (HLE) adalah tolok ukur multidisiplin berisi 3.000 pertanyaan yang dirancang oleh Center for AI Safety (CAIS) dan Scale AI untuk menguji batas tertinggi pengetahuan akademis manusia. Mencakup fisika kuantum hingga geometri aljabar, model penalaran mutakhir seperti OpenAI o3, DeepSeek R1, dan Claude 3.7 hanya mencetak akurasi antara 18% hingga 34%, mengakhiri era saturasi tolok ukur.


Krisis Saturasi: Mengapa Tolok Ukur Standar Menjadi Usang

Antara tahun 2023 dan 2025, ekosistem evaluasi kecerdasan buatan mengalami krisis usangnya metrik pengujian. Standar industri yang sebelumnya menjadi pembeda utama model terbaik telah mencapai batas jenuh:

  • MMLU (Massive Multitask Language Understanding): Standar emas kemampuan akademis umum kini rutin dicapai dengan skor 90% hingga 92% oleh model papan atas, membuat selisih performa sulit dibedakan dari kontaminasi data web.
  • GSM8K & MATH: Soal matematika tingkat dasar (GSM8K) dipecahkan dengan akurasi 99%+ bahkan oleh model edge yang ringkas, sedangkan tes matematika SMA (MATH) melampaui 95% dengan model penalaran.
  • HumanEval & MBPP: Pembuatan unit test Python melampaui 90%, hanya menguji kecocokan sintaks dasar ketimbang arsitektur rekayasa perangkat lunak yang rumit.
  • GPQA Diamond: Dirancang kebal terhadap pencarian Google untuk pertanyaan sains tingkat doktoral, skornya melonjak dari 55% ke lebih dari 78% berkat komputasi waktu inferensi (Test-Time Compute).

Karena model fondasi mengonsumsi data web publik dalam skala masif selama pra-pelatihan, pola hafalan menutupi kelemahan penalaran logis yang sebenarnya. Evaluasi baru membutuhkan tanda air kriptografis, tinjauan sejawat yang ketat, dan pembuktian deduktif tingkat doktoral multitahap.


Mengenal Humanity's Last Exam (HLE)

Dikembangkan bersama oleh Center for AI Safety (CAIS) dan Scale AI, dengan kontribusi lebih dari 1.000 akademisi dari universitas global terkemuka, Humanity's Last Exam (HLE) dirancang sebagai batas evaluasi puncak sebelum tercapainya Artificial General Intelligence (AGI).

+---------------------------------------------------------------------------------------------------+
|                        ARSITEKTUR TOLOK UKUR HUMANITY'S LAST EXAM (HLE)                           |
+---------------------------------------------------------------------------------------------------+
| Parameter                  | Detail Spesifikasi                                                   |
+----------------------------+----------------------------------------------------------------------+
| Total Pertanyaan           | 3.000 masalah multidisiplin multimodal dan berbasis teks             |
| Tingkat Akademis           | Calon doktor (PhD), peneliti pascadoktoral, dan ilmuwan senior       |
| Disiplin Ilmu              | Matematika, Fisika, Kimia, Biologi, Ilmu Komputer, Hukum, Ekonomi    |
| Perlindungan Kebocoran     | String kenari kriptografis, pembuktian orisinal yang belum dirilis   |
| Format Verifikasi          | Pencocokan string persis, toleransi numerik, pembuktian logis        |
| Standar Pakar Manusia      | ~100% (Spesialis bidang dengan akses ke materi referensi ilmiah)     |
| LLM Standar Tanpa Penalaran| < 3,5% (Zero-shot GPT-4o / Claude 3.5 Sonnet tanpa komputasi pikir) |
+----------------------------+----------------------------------------------------------------------+

Kriteria Utama Masuknya Soal ke HLE

  1. Tidak Dapat Dicari di Google: Jawaban tidak dapat ditemukan melalui pencarian langsung maupun sintesis dokumen web terbuka.
  2. Prasyarat Pascasarjana Spesifik: Seorang lulusan sarjana umum tanpa gelar doktor di bidang spesifik tersebut tidak dapat memecahkan soal meski diberi waktu berjam-jam.
  3. Verifikasi Otomatis yang Pasti: Solusi berakhir pada nilai matematis pasti atau token alfanumerik tanpa multitafsir, menghilangkan bias evaluasi subjektif (LLM-as-a-judge).
  4. Penalaran Multimodal Mendalam: Sekitar 15% soal memuat diagram struktur biokimia, skema sirkuit terintegrasi, dan geometri non-Euclidean.

Tiga Serangkai Tolok Ukur Terdepan 2026: HLE, FrontierMath, dan ARC-AGI

Untuk mengukur kecerdasan model secara holistik, komunitas AI mengandalkan tiga evaluasi yang saling melengkapi:

                  =======================================================
                             TAKSONOMI PENALARAN AI TERDEPAN
                  =======================================================
                         /                 |                 \
                        /                  |                  \
              Humanity's Last Exam    FrontierMath           ARC-AGI-2
                   (HLE)             (Epoch AI)          (François Chollet)
                        |                  |                  |
               Batas akademis mutlak    Pembuktian matematis   Induksi aturan
               Tingkat doktoral multi-  orisinal belum rilis   abstrak visual
               disiplin; 3.000 soal     Verifikasi ketat       Tanpa memori lama

1. FrontierMath (Epoch AI)

Dirancang bersama para peraih Medali Fields, mencakup ratusan masalah matematika penelitian yang belum dipublikasikan. Model konvensional berada di bawah 2%, sementara model penalaran modern mencapai 20% hingga 30%.

2. ARC-AGI (Abstraction and Reasoning Corpus)

Dibuat oleh François Chollet, menguji kemampuan menarik aturan transformasi visual baru dari sangat sedikit contoh kisi, memisahkan kecerdasan murni dari memori linguistik.

3. Humanity's Last Exam (HLE)

Menggabungkan keluasan disiplin ilmu MMLU, ketelitian matematis FrontierMath, dan literasi ilmiah multimodal.


Papan Peringkat Komprehensif AI Terdepan 2026

Data empiris terkonsolidasi dari model penalaran utama dan arsitektur bobot terbuka:

Arsitektur Model Penyedia / Lisensi Akurasi Total HLE (%) HLE Matematika/CS (%) FrontierMath Tier-1 (%) ARC-AGI-2 Terverifikasi (%) Biaya Rata-rata / 1M Token
Claude Fable 5.1 (High CoT) Proprietary API 65.0% 72.4% 87.8% 96.4% $10.00 / $50.00
OpenAI GPT-6 Astra Proprietary API 57.2% 74.1% 97.6% 99.9% $10.00 / $50.00
OpenAI o3 (High Effort) API Proprietary 33.8% 38.4% 31.2% 78.4% $45.00
Claude 3.7 Sonnet (Thinking) Anthropic API 31.4% 35.2% 28.6% 74.9% $18.00
DeepSeek R1 (671B Lengkap) MIT Open Weights 27.6% 32.8% 24.1% 71.2% $2.19 (Host Mandiri)
OpenAI o1 (Penalaran Penuh) API Proprietary 24.2% 29.1% 19.8% 66.5% $30.00
Kimi k1.5 (Long-CoT) Moonshot API 22.8% 27.4% 18.2% 63.8% $4.50
Gemini 2.0 Flash Thinking Google Cloud 21.5% 25.0% 16.9% 61.4% $3.50
Qwen-2.5-Max (RL-Reasoning) Alibaba Cloud 19.8% 23.6% 14.5% 58.2% $3.20
DeepSeek-R1-Distill-Qwen-32B Apache 2.0 Open 14.2% 17.9% 9.4% 49.6% $0.60 (Lokal FP8)
Claude 3.5 Sonnet (Standar) Anthropic API 5.8% 6.2% 2.4% 38.1% $3.75
GPT-4o (Garis Dasar Zero-shot) API Proprietary 3.2% 3.8% 1.8% 34.2% $2.50

Analisis Teknis: Bagaimana Model Penalaran Menaklukkan HLE

1. OpenAI o3: Penskalaan Pencarian Pohon Waktu Inferensi

OpenAI o3 memimpin klasemen (33,8%) berkat pembelajaran penguatan skala besar yang dipadukan dengan pencarian pohon menggunakan Process Reward Models (PRM), memangkas jalur penalaran yang salah sebelum menghasilkan jawaban akhir.

2. Claude 3.7 Sonnet: Pemikiran Adaptif dan Koreksi Mandiri

Claude 3.7 Sonnet memungkinkan alokasi token berpikir dinamis (0 hingga 128k). Dalam biologi molekuler dan ilmu hukum, model ini menunjukkan kemampuan koreksi mandiri yang luar biasa: jika mendeteksi kontradiksi di tengah langkah, ia secara mandiri mundur dan menyusun ulang logikanya.

3. DeepSeek R1: Terobosan Bobot Terbuka

DeepSeek R1 membuktikan bahwa pembelajaran penguatan murni berbasis aturan (ketepatan matematis dan format) mampu memunculkan rantai penalaran mendalam tanpa memerlukan data langkah-demi-langkah berbiaya mahal dari anotator manusia.


Mengapa RAG Konvensional Tumbang di Hadapan HLE

Prompt standar dan sistem RAG konvensional tidak berdaya menghadapi HLE:

  • Keunikan Sintetis: Soal-soal dibuat berdasarkan modifikasi baru teori ilmiah yang tidak pernah diunggah ke internet publik.
  • Jebakan Kemiripan Vektor: Basis data vektor menarik teks yang mirip secara harfiah namun salah secara konsep, menyesatkan model ke penalaran yang keliru.

Reproduksi Evaluasi HLE Menggunakan vLLM:

# Klon repositori resmi dan siapkan lingkungan
git clone https://github.com/cais/humanitys-last-exam.git
cd humanitys-last-exam
pip install -r requirements.txt vllm sglang

# Jalankan evaluasi DeepSeek R1 via vLLM
python run_hle_eval.py \
  --model "deepseek-ai/DeepSeek-R1" \
  --backend "vllm" \
  --tensor-parallel-size 8 \
  --temperature 0.6 \
  --top-p 0.95 \
  --max-thinking-tokens 32768 \
  --subject-filter "mathematics,physics,computer_science" \
  --output-dir "./results/deepseek_r1_hle"

Rekomendasi Rekayasa Perangkat Lunak

  1. Hentikan Penggunaan MMLU dan GSM8K: Untuk mengevaluasi model pada analisis keuangan, hukum, atau audit kode, pengujian lama tidak lagi memberikan nilai pembeda. Gunakan HLE dan FrontierMath.
  2. Prioritaskan Komputasi Waktu Inferensi: Model 32B yang memiliki fitur penelusuran pikiran dan verifikasi berulang kali mengungguli model raksasa tanpa penalaran.
  3. Terapkan Arsitektur Dua Tingkat: Alirkan 95% kueri rutin ke model cepat berbiaya murah, dan eskalasikan masalah multidisiplin tingkat doktoral ke o3, Claude 3.7 Thinking, atau DeepSeek R1.
← Semua artikel
0 / 4