Jannah Theme License is not validated, Go to the theme options page to validate the license, You need a single license for each domain name.
Investigación

SCAPO: método que mejora el razonamiento matemático de la IA

Un equipo afiliado a Westlake University, Zhejiang University, Shanghai Innovation Institute y Shanghai AI Laboratory publicó el 30 de septiembre de 2026 en arXiv un método de entrenamiento llamado SCAPO. Según los autores, mejora el razonamiento matemático de modelos de lenguaje pequeños y supera al método estándar de referencia, GRPO, en todas las métricas que reportan. Son resultados propios: no hay replicación independiente en las fuentes revisadas.

Qué problema intenta resolver

Después del preentrenamiento, muchos modelos se afinan con aprendizaje por refuerzo con recompensas verificables (RLVR). El modelo resuelve problemas cuya respuesta se puede comprobar de forma automática, como los de matemáticas, y recibe una recompensa si acierta.

GRPO, el método de referencia en esta área, reparte esa recompensa por igual entre todos los tokens de la respuesta. Un token es un fragmento de texto: una palabra, parte de una palabra o un símbolo. Los autores sostienen que ese reparto puede reforzar también tokens que dependen de rasgos irrelevantes del enunciado y no del razonamiento. Lo llaman dependencia espuria.

La idea: cambiar lo que no importa

El término «semifactual» designa una variante que cambia detalles incidentales de un problema, pero conserva el problema y su respuesta. Los autores generan cuatro por cada enunciado: una paráfrasis, una versión con erratas menores, una con un escenario irrelevante alrededor y una con contexto irrelevante añadido. Según el paper, las variantes se generaron con GPT-5.5.

Luego miden cuánto cambia la probabilidad de cada token de una misma respuesta cuando cambia el enunciado. A ese cambio lo llaman «deriva»: mucha deriva indica un token inestable.

En un análisis previo con Qwen3-4B-Base, el 12,82 % de las posiciones no mostró cambio. Los marcadores de reflexión y los conectores del discurso fueron los más sensibles, con 2,74 y 2,32 veces la deriva media. Los símbolos matemáticos y los números fueron los menos sensibles, con 0,47 y 0,37 veces.

Qué hace SCAPO

SCAPO (Semifactual Credit-Augmented Policy Optimization) calcula la estabilidad de cada token y reduce la recompensa de los más inestables. No da crédito extra por ser estable, porque, según los autores, la estabilidad no implica que la respuesta sea correcta.

Esta corrección solo se aplica al inicio del entrenamiento: los primeros 120 pasos de 600 en el modelo de 4.000 millones de parámetros y los primeros 200 de 1.000 en el de 1.700 millones. El resto sigue con GRPO estándar. El entrenamiento usó DAPO-Math-17K, un conjunto de unos 17.000 problemas de matemáticas de nivel competencia.

Qué resultados reportan

Los autores comparan SCAPO con GRPO y con otros cuatro métodos (GSPO, SAPO, CF-GRPO y FIPO), con los mismos datos, recompensa y presupuesto de pasos. Las cifras, en precisión porcentual de GRPO frente a SCAPO, para los modelos de 4B y 1,7B:

  • AIME 2024–2026: de 22,08 a 27,71 (+5,63 puntos) en 4B; de 7,71 a 11,88 (+4,17) en 1,7B.
  • HMMT 2025–2026: de 11,71 a 16,17 (+4,46) en 4B; de 1,98 a 4,96 (+2,98) en 1,7B.
  • GPQA-Diamond (ciencia a nivel de posgrado, fuera de matemáticas): de 36,26 a 42,45 en 4B; de 27,42 a 31,25 en 1,7B.
  • Promedio en matemáticas: de 34,93 a 39,65 en 4B; de 17,86 a 23,08 en 1,7B.

El paper afirma además que SCAPO alcanza la precisión final de GRPO en AIME con menos de la mitad de los pasos de entrenamiento (Figura 1).

Hay matices. Con el modelo de 4B, SCAPO lidera seis de las ocho métricas matemáticas; FIPO lo supera en Minerva (44,49 frente a 43,38) y en OlympiadBench (57,57 frente a 56,82). Con el de 1,7B lidera las ocho. En las tres pruebas fuera de distribución (variantes de AIME con distractores y perturbaciones, más GPQA-Diamond) SCAPO obtiene el mejor resultado en ambos tamaños.

Un hallazgo aparte: filtrar al generar

Sin tocar los pesos del modelo, los autores bloquearon durante la generación los tokens candidatos de mayor deriva. En 1.000 preguntas matemáticas, la precisión de Qwen3-4B-Base subió de 15,8 % a 30,0 % (+14,2 puntos). El paper presenta este resultado como diagnóstico que motiva el método, no como técnica para uso general.

Límites

Es un preprint en su versión 1; no encontramos evidencia de revisión por pares ni de replicaciones independientes al 1 de octubre de 2026. Los propios autores reconocen que entrenaron solo con problemas de matemáticas, solo con modelos densos de 1,7B y 4B parámetros y con un único conjunto de entrenamiento; GPQA-Diamond es la única prueba fuera de matemáticas. No saben aún si el método funciona con modelos más grandes, con otras arquitecturas, como las de mezcla de expertos, o en otros dominios.

Por qué te importa

  • No es un producto. No hay API, precio ni disponibilidad por país. El paper figura con licencia CC BY 4.0 en arXiv y los autores enlazan un repositorio de código en GitHub, que al 1 de octubre de 2026 aparece vacío; solo se puede leer el paper.
  • Para equipos que afinan modelos con aprendizaje por refuerzo, la idea de medir qué tokens dependen de detalles superficiales del enunciado merece seguimiento. La evidencia llega solo a matemáticas con modelos pequeños; conviene tratarla como hipótesis por validar en cada caso de uso.
  • Lectura de PrimixIA: el trabajo recuerda que un modelo puede acertar apoyándose en rasgos superficiales del enunciado, y que existen formas de medirlo. Es una señal útil al evaluar cualquier modelo que se vaya a usar en tareas de razonamiento.
  • Idioma y alternativas. El paper está en inglés y no hay versión en español. Los autores lo comparan con GSPO, SAPO, CF-GRPO y FIPO, que son las alternativas directas dentro de esta familia de métodos.

Qué sigue

  • No hay fecha confirmada de una versión revisada ni de publicación en una conferencia o revista.
  • Los autores indican como trabajo futuro probar el método en modelos más grandes, en arquitecturas más diversas y en dominios más allá de las matemáticas.
  • Lo que falta: replicaciones independientes. Sin ellas, las cifras siguen siendo las que reportan los propios autores.

Notas relacionadas

Volver arriba