Ir al contenido

Cómputo y transparencia de costos

Corremos un benchmark de LLMs de pesos abiertos para extracción estructurada de datos clínicos a partir de notas médicas de-identificadas — un estudio académico con un manuscrito en preparación. Esta página es un reporte transparente del cómputo que consume el estudio, los factores de costo, y los controles bajo los que corre. Está escrita para partners de cómputo y patrocinadores de investigación.

Ninguna información que identifique a pacientes aparece en este benchmark ni en esta página; el corpus está de-identificado, y los detalles institucionales se omiten a propósito.

Un benchmark factorial mide qué tan completa y correctamente distintos modelos extraen un conjunto fijo de campos clínicos estructurados de un corpus de 110 notas de-identificadas, bajo tres métodos de extracción (“harnesses”). Corre enteramente sobre modelos de pesos abiertos servidos por Nebius Token Factory.

Harness Descripción Llamadas al modelo por nota
plain Una sola llamada de extracción estructurada. 1
agent Un agente clínico multi-paso (planeación → herramientas de retrieval → respuesta) cuya respuesta luego se estructura. varias
grader Un agente especializado de extracción/completeness. varias

Diseño completo: 4 modelos × 3 harnesses × 110 notas = 1,320 celdas de extracción. Esto es investigación estándar de evaluación de modelos — sin tráfico de producción, sin generación masiva para redistribución. El resultado es un análisis comparativo de modelos abiertos para una tarea de NLP en salud, que la publicación resultante va a citar.

Cuatro modelos del catálogo de Nebius Token Factory:

Modelo Rol
openai/gpt-oss-120b Línea base
moonshotai/Kimi-K3 Modelo de razonamiento bajo prueba
zai-org/GLM-5.2 Modelo de razonamiento bajo prueba
MiniMaxAI/MiniMax-M3 Modelo eficiente bajo prueba

Gasto medido en las corridas completas y parciales (cifras autoritativas del dashboard de uso del proveedor, 09 jul – 08 ago 2026):

Modelo Input (1M tokens) Output (1M tokens) Costo
gpt-oss-120b 5.06 2.49 $2.26
Kimi-K3 1.63 1.34 $25.06
GLM-5.2 12.54 4.93 $39.24
MiniMax-M3 0.93 0.31 $0.65
Total $67.21
  1. Los modelos de razonamiento pesado dominan. GLM-5.2 ($39.24) y Kimi-K3 ($25.06) juntos son ~95% del gasto, casi enteramente en tokens de output (streams grandes de chain-of-thought / razonamiento por diseño). El modelo base más barato y el modelo eficiente fueron marginales en comparación. Este es en sí un hallazgo útil del benchmark: el volumen de output de un modelo de razonamiento, no el tamaño del input, es el costo real de una evaluación como esta.
  2. Los harnesses multi-paso hacen varias llamadas por nota. Los métodos agent y grader corren una cadena de planeación → herramientas → respuesta → estructuración, así que una sola “celda” son varias llamadas facturables.
  3. Puesta en marcha de infraestructura. El tuning inicial de concurrencia contra los rate limits produjo intentos reintentados antes de que estableciéramos el techo seguro — ya corregido (ver controles abajo).

Pendiente: una corrida limpia de los tres modelos no-base a través de los tres harnesses (~990 celdas). Como el costo medido por celda de los modelos de razonamiento es alto, completar esto se estima en ~$150–250, dominado por GLM-5.2 y Kimi-K3. Medimos el costo real por celda con un lote pequeño primero y corremos el resto bajo presupuestos estrictos por oleada.

  • Checkpoints humanos por oleada — el benchmark corre un harness a la vez, y los resultados se revisan antes de gastar en la siguiente oleada. Nunca se gasta crédito sin un resultado que mostrar por él.
  • Pre-flight medido — un lote pequeño establece el costo real por celda antes de cualquier corrida completa.
  • Concurrencia ajustada a los rate limits — el techo de concurrencia seguro está medido, así que la API nunca se sobre-exige hasta reintentos.
  • Dr. Erick Zamora Tehozol — Reumatología y validación clínica
  • Ing. Ángel Meléndez Córdoba — Ingeniería

Este benchmark es uso académico y citable de un catálogo de modelos abiertos para una publicación de NLP en salud. Si hospedas o financias inferencia de pesos abiertos y quieres que tus modelos estén representados en la comparación — o quieres patrocinar el cómputo que lo completa — el estudio es un uso transparente, bien instrumentado, y con destino de publicación de ese cómputo. Contáctanos a través de los medios en poktacare.com.