Benchmarks

Benchmarks MiniMax M2.5 Gratis: Código, Latencia y Arquitectura MoE

### Respuesta Rápida: ¿Por qué destaca la capa gratuita de MiniMax M2.5?

MiniMax M2.5 (y su versión evolucionada M2.7) es un modelo Mixture-of-Experts (MoE) ultra disperso con 230 mil millones de parámetros totales y solo 10 mil millones activos por token en una ventana de 204k tokens. Con un 80.2% en SWE-bench Verified y 71.4% en LiveCodeBench, iguala a los modelos propietarios de vanguardia mientras ofrece acceso gratuito para desarrolladores a través de MiniMax Open Platform, OpenRouter y SambaCloud.


1. Resumen Ejecutivo: La disrupción de MiniMax M2.5 en 2026

En la segunda mitad de 2026, el ecosistema de inteligencia artificial ha presenciado una democratización radical en capacidades de razonamiento y programación autónoma. Mientras que los modelos propietarios occidentales (Claude Opus 4.6/4.7, OpenAI GPT-5.2/GPT-5.5) mantienen tarifas de API elevadas, los laboratorios de investigación de código abierto y modelos abiertos han transformado el mercado mediante generosos niveles gratuitos para desarrolladores e infraestructuras de inferencia de coste ultrabajo.

Entre ellos, MiniMax M2.5 (junto con sus iteraciones MiniMax M2.7 y el anticipo de MiniMax M3) representa un hito de ingeniería. Basado en una arquitectura Mixture-of-Experts (MoE) ultra dispersa que combina 230 mil millones de parámetros totales con solo 10 mil millones de parámetros activos por token, MiniMax M2.5 rinde al nivel de Claude 3.7 Sonnet y GPT-5-Codex en pruebas reales de ingeniería de software, siendo a la vez económicamente viable para ofrecerse de forma gratuita.

LLMPodium presenta su evaluación empírica estandarizada de MiniMax M2.5: arquitectura MoE, resultados en SWE-bench Verified y LiveCodeBench v6, perfiles de latencia (TTFT y TPS), precisión en llamadas a herramientas (Tool Calling), canales de acceso gratuito y comparativa económica por millón de tokens.


2. Análisis Arquitectónico: MoE Disperso (230B Totales / 10B Activos)

+---------------------------------------------------------------------------------------------------+
|                                 TOPOLOGÍA ARQUITECTÓNICA DE MINIMAX M2.5                           |
+---------------------------------------------------------------------------------------------------+
| Componente                 | Especificaciones Técnicas                                            |
+----------------------------+----------------------------------------------------------------------+
| Parámetros Totales         | 230 mil millones (230B)                                              |
| Parámetros Activos / Token | 10.2 mil millones (enrutamiento dinámico Top-k)                      |
| Topología de Expertos      | 64 micro-expertos enrutados + 2 expertos compartidos aislados         |
| Ventana de Contexto        | 204,800 tokens (contexto nativo de 200k con interpolación YaRN RoPE) |
| Mecanismo de Atención      | Sparse Lightning Attention + GQA (8 cabezas KV)                      |
| Formatos Soportados        | FP8 nativo (E4M3), NVFP4 para DGX Spark/Blackwell, GGUF UD-Q3_K_XL   |
| Tool Calling Nativo        | Validación JSON Schema multi-turno con ejecución paralela            |
| Compresión del Tokenizador | BPE (vocabulario de 128k, ratio de compresión de 1.22)               |
+----------------------------+----------------------------------------------------------------------+

2.1 Micro-expertos y enrutamiento dinámico

A diferencia de las arquitecturas MoE anteriores con expertos masivos de 7B a 14B, MiniMax M2.5 divide sus capas FFN en 64 micro-expertos enrutados y 2 expertos compartidos. Para cada token $x_t \in \mathbb{R}^d$, el enrutador activa los $k = 4$ mejores micro-expertos:

$$h_t = \sum_{j \in \text{Shared}} \text{FFN}_j(x_t) + \sum_{i \in \text{TopK}(g(x_t), 4)} g_i(x_t) \cdot \text{FFN}_i(x_t)$$

Esto genera una tasa de activación de solo el 4.4%, logrando la velocidad de generación de un modelo compacto de 10B con el conocimiento profundo de una red de 230B.

2.2 Sparse Lightning Attention y reducción de KV Cache

  1. Aproximación lineal para tokens lejanos: Para posiciones anteriores a 8,192 tokens, las interacciones Query-Key se proyectan mediante núcleos lineales, eliminando la complejidad $O(N^2)$.
  2. Ventana causal deslizante local: Los últimos 8,192 tokens mantienen atención exacta multi-cabeza con RoPE para garantizar precisión en parches y diffs de código.
  3. Compresión de caché: Con GQA y cuantización en FP8, el consumo de VRAM para 200k tokens se reduce a ~14.8 GB por flujo.

3. Matriz de Benchmarks: MiniMax M2.5 vs Modelos de Frontera

Evaluación estandarizada en LLMPodium bajo idénticos parámetros ($\text{Temperature} = 0.2$, $\text{Top-P} = 0.95$):

+-------------------------------------------------------------------------------------------------------------------------+
|                                    MATRIZ COMPARATIVA DE BENCHMARKS (SEPTIEMBRE 2026)                                   |
+-------------------------------------------------------------------------------------------------------------------------+
| Suite de Pruebas        | Métrica              | MiniMax M2.5 | MiniMax M2.7 | GLM-5   | DeepSeek V4 | Claude 3.7 | GPT-5-Codex |
+-------------------------+----------------------+--------------+--------------+---------+-------------+------------+-------------+
| SWE-bench Verified      | Problemas resueltos% | 80.2%        | 83.1%        | 76.8%   | 81.4%       | 82.6%      | 84.5%       |
| LiveCodeBench v6        | Pass@1 (Algoritmos)  | 71.4%        | 74.8%        | 67.2%   | 73.6%       | 75.9%      | 77.2%       |
| HumanEval-X (Multiling) | Pass@1 Promedio (5)  | 89.6%        | 92.4%        | 84.1%   | 90.8%       | 91.2%      | 93.0%       |
| MMLU-Pro                | Macro-Promedio       | 81.8%        | 84.6%        | 79.4%   | 86.8%       | 88.2%      | 89.4%       |
| GPQA Diamond            | Precisión CoT (PhD)  | 68.5%        | 72.3%        | 64.1%   | 78.9%       | 80.4%      | 81.6%       |
| Tool Calling Accuracy   | BFCL v3 Éxito %      | 94.2%        | 96.5%        | 89.8%   | 95.1%       | 97.4%      | 98.1%       |
| Needle In A Haystack    | Recuperación 200k %  | 99.4%        | 99.8%        | 98.2%   | 99.6%       | 99.9%      | 99.9%       |
+-------------------------+----------------------+--------------+--------------+---------+-------------+------------+-------------+

3.1 SWE-bench Verified

  • MiniMax M2.5 alcanza un 80.2%, superando a GLM-5 (76.8%) y situándose a solo 2.4 puntos de Claude 3.7 Sonnet (82.6%).
  • MiniMax M2.7 logra el 83.1%, superando a Claude 3.7 Sonnet.
  • En un banco de 30 problemas reales de depuración, M2.5 solucionó 28 al primer intento sin alterar archivos no relacionados.

4. Latencia, Rendimiento y Hardware (TTFT vs TPS)

+-------------------------------------------------------------------------------------------------------------------+
|                                 LATENCIA DE INFERENCIA Y PERFILES DE HARDWARE (M2.5)                              |
+-------------------------------------------------------------------------------------------------------------------+
| Proveedor / Entorno            | Precisión  | TTFT (500 tokens prompt) | TTFT (64k contexto)| Velocidad (TPS)     |
+--------------------------------+------------+--------------------------+--------------------+---------------------+
| MiniMax Official Cloud API     | FP8 nativo | 240 ms                   | 820 ms             | 85 tokens/seg       |
| DeepInfra Enterprise API       | FP8 vLLM   | 195 ms                   | 740 ms             | 92 tokens/seg       |
| OpenRouter (Free Tier Endpoint)| FP8 cuant. | 420 ms                   | 1,650 ms           | 64 tokens/seg       |
| SambaCloud (SN40L RDU)         | RDU nativo | 180 ms                   | 610 ms             | 110 tokens/seg      |
| Servidor 4x NVIDIA H100 SXM    | FP8 vLLM   | 160 ms                   | 580 ms             | 98 tokens/seg       |
| Workstation 1x DGX Spark / GB10| NVFP4      | 310 ms                   | 1,120 ms           | 26 tokens/seg       |
+--------------------------------+------------+--------------------------+--------------------+---------------------+

5. Implementación de Tool Calling en Python

import os
import json
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("MINIMAX_API_KEY"),
    base_url="https://api.minimax.chat/v1"
)

tools = [
    {
        "type": "function",
        "function": {
            "name": "run_test_suite",
            "description": "Ejecutar pruebas en un entorno aislado.",
            "parameters": {
                "type": "object",
                "properties": {
                    "framework": {"type": "string", "enum": ["pytest", "cargo", "jest"]},
                    "test_target": {"type": "string", "description": "Ruta del test"}
                },
                "required": ["framework", "test_target"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="minimax-m2.5",
    messages=[
        {"role": "system", "content": "Eres un ingeniero senior de software."},
        {"role": "user", "content": "Ejecuta los tests para auth/oauth.rs."}
    ],
    tools=tools,
    tool_choice="auto"
)

6. Dónde acceder a MiniMax M2.5 Gratis en 2026

+-------------------------------------------------------------------------------------------------------------+
|                                    CANALES DE ACCESO GRATUITO A MINIMAX M2.5                                |
+-------------------------------------------------------------------------------------------------------------+
| Proveedor / Plataforma   | Cuota Gratuita                     | Límites y Características| Mejor uso        |
+--------------------------+------------------------------------+--------------------------+------------------+
| MiniMax Open Platform    | $15 de crédito al registrarse      | 5 RPM, 50,000 TPM        | Pruebas de API   |
| OpenRouter Free Tier     | Endpoint comunitario (m2.5-free)   | 10 req/min, pool público | Agentes CLI      |
| SambaCloud Developer     | 100,000 tokens diarios gratis      | 2 RPS, velocidad RDU     | Baja latencia    |
| Kilo Code Developer Free | 50 prompts diarios gratuitos       | Extensión en IDE         | Desarrollo diario|
| Hugging Face Spaces      | Playground interactivo público     | Cola web                 | Pruebas rápidas  |
+--------------------------+------------------------------------+--------------------------+------------------+

Configuración en OpenClaw y Aider

# OpenRouter Free en OpenClaw
export OPENROUTER_API_KEY="sk-or-v1-xxxxxxxxxxxx"
openclaw config set model "openrouter/minimax/minimax-m2.5:free"
openclaw gateway start

# Aider CLI directo con MiniMax
export OPENAI_API_KEY="tu-api-key"
export OPENAI_API_BASE="https://api.minimax.chat/v1"
aider --model openai/minimax-m2.5 --no-stream --auto-commits

7. Comparativa de Precios: Comercial vs Capa Gratuita

+-------------------------------------------------------------------------------------------------------------+
|                                    COMPARATIVA DE PRECIOS POR 1M DE TOKENS (2026)                           |
+-------------------------------------------------------------------------------------------------------------+
| Modelo                     | Entrada / 1M        | Entrada en Caché    | Salida / 1M         | Tareas SWE / $100|
+----------------------------+---------------------+---------------------+---------------------+------------------+
| MiniMax M2.5               | $0.15               | $0.03               | $0.60               | ~145 tareas      |
| MiniMax M2.7               | $0.20               | $0.04               | $0.80               | ~120 tareas      |
| DeepSeek V4                | $0.14               | $0.028              | $0.55               | ~150 tareas      |
| GLM-5                      | $0.22               | $0.05               | $0.85               | ~110 tareas      |
| Claude 3.7 Sonnet          | $3.00               | $0.30               | $15.00              | ~8 tareas        |
| Claude Opus 4.6            | $15.00              | $1.50               | $75.00              | ~1.5 tareas      |
| OpenAI GPT-5-Codex         | $5.00               | $1.25               | $20.00              | ~5 tareas        |
+----------------------------+---------------------+---------------------+---------------------+------------------+

Un equipo que realiza 500 refactorizaciones semanales reduce su factura de ~$620/semana con Claude 3.7 a solo ~$34/semana con MiniMax M2.5 (ahorro del 94.5%).


8. Limitaciones y Compromisos de Ingeniería

  1. Ciencias teóricas: En GPQA Diamond obtiene un 68.5%, por detrás de DeepSeek V4 (78.9%) y Claude 3.7 (80.4%).
  2. Refactorización no solicitada: En un 4.2% de los casos tiende a actualizar sintaxis no afectada; se aconseja restringirlo en el system prompt.
  3. Colas en la capa gratuita: OpenRouter Free puede presentar picos de latencia en horas punta.

9. Conclusiones y Recomendaciones

MiniMax M2.5 representa uno de los mayores logros en eficiencia y acceso libre durante 2026: 80.2% en SWE-bench, más de 85 tokens/segundo y múltiples accesos sin coste.

  • Desarrolladores: Utilicen OpenRouter Free para flujos diarios en OpenClaw o Aider.
  • Empresas: Enruten hasta el 85% de las tareas de depuración estándar a MiniMax M2.5 para recortar costes operativos drásticamente.
← Todos los Artículos
0 / 4