Cómputo y transparencia de costos
Corremos un benchmark de LLMs de pesos abiertos para extracción estructurada de datos clínicos a partir de notas médicas de-identificadas — un estudio académico con un manuscrito en preparación. Esta página es un reporte transparente del cómputo que consume el estudio, los factores de costo, y los controles bajo los que corre. Está escrita para partners de cómputo y patrocinadores de investigación.
Ninguna información que identifique a pacientes aparece en este benchmark ni en esta página; el corpus está de-identificado, y los detalles institucionales se omiten a propósito.
El benchmark, en un párrafo
Sección titulada «El benchmark, en un párrafo»Un benchmark factorial mide qué tan completa y correctamente distintos modelos extraen un conjunto fijo de campos clínicos estructurados de un corpus de 110 notas de-identificadas, bajo tres métodos de extracción (“harnesses”). Corre enteramente sobre modelos de pesos abiertos servidos por Nebius Token Factory.
| Harness | Descripción | Llamadas al modelo por nota |
|---|---|---|
| plain | Una sola llamada de extracción estructurada. | 1 |
| agent | Un agente clínico multi-paso (planeación → herramientas de retrieval → respuesta) cuya respuesta luego se estructura. | varias |
| grader | Un agente especializado de extracción/completeness. | varias |
Diseño completo: 4 modelos × 3 harnesses × 110 notas = 1,320 celdas de extracción. Esto es investigación estándar de evaluación de modelos — sin tráfico de producción, sin generación masiva para redistribución. El resultado es un análisis comparativo de modelos abiertos para una tarea de NLP en salud, que la publicación resultante va a citar.
Modelos bajo prueba
Sección titulada «Modelos bajo prueba»Cuatro modelos del catálogo de Nebius Token Factory:
| Modelo | Rol |
|---|---|
openai/gpt-oss-120b |
Línea base |
moonshotai/Kimi-K3 |
Modelo de razonamiento bajo prueba |
zai-org/GLM-5.2 |
Modelo de razonamiento bajo prueba |
MiniMaxAI/MiniMax-M3 |
Modelo eficiente bajo prueba |
Cómputo consumido a la fecha
Sección titulada «Cómputo consumido a la fecha»Gasto medido en las corridas completas y parciales (cifras autoritativas del dashboard de uso del proveedor, 09 jul – 08 ago 2026):
| Modelo | Input (1M tokens) | Output (1M tokens) | Costo |
|---|---|---|---|
| gpt-oss-120b | 5.06 | 2.49 | $2.26 |
| Kimi-K3 | 1.63 | 1.34 | $25.06 |
| GLM-5.2 | 12.54 | 4.93 | $39.24 |
| MiniMax-M3 | 0.93 | 0.31 | $0.65 |
| Total | $67.21 |
Qué impulsa el costo
Sección titulada «Qué impulsa el costo»- Los modelos de razonamiento pesado dominan. GLM-5.2 ($39.24) y Kimi-K3 ($25.06) juntos son ~95% del gasto, casi enteramente en tokens de output (streams grandes de chain-of-thought / razonamiento por diseño). El modelo base más barato y el modelo eficiente fueron marginales en comparación. Este es en sí un hallazgo útil del benchmark: el volumen de output de un modelo de razonamiento, no el tamaño del input, es el costo real de una evaluación como esta.
- Los harnesses multi-paso hacen varias llamadas por nota. Los métodos agent y grader corren una cadena de planeación → herramientas → respuesta → estructuración, así que una sola “celda” son varias llamadas facturables.
- Puesta en marcha de infraestructura. El tuning inicial de concurrencia contra los rate limits produjo intentos reintentados antes de que estableciéramos el techo seguro — ya corregido (ver controles abajo).
Para completar el benchmark
Sección titulada «Para completar el benchmark»Pendiente: una corrida limpia de los tres modelos no-base a través de los tres harnesses (~990 celdas). Como el costo medido por celda de los modelos de razonamiento es alto, completar esto se estima en ~$150–250, dominado por GLM-5.2 y Kimi-K3. Medimos el costo real por celda con un lote pequeño primero y corremos el resto bajo presupuestos estrictos por oleada.
Cómo controlamos el gasto
Sección titulada «Cómo controlamos el gasto»- Checkpoints humanos por oleada — el benchmark corre un harness a la vez, y los resultados se revisan antes de gastar en la siguiente oleada. Nunca se gasta crédito sin un resultado que mostrar por él.
- Pre-flight medido — un lote pequeño establece el costo real por celda antes de cualquier corrida completa.
- Concurrencia ajustada a los rate limits — el techo de concurrencia seguro está medido, así que la API nunca se sobre-exige hasta reintentos.
- Dr. Erick Zamora Tehozol — Reumatología y validación clínica
- Ing. Ángel Meléndez Córdoba — Ingeniería
Para patrocinadores y partners de cómputo
Sección titulada «Para patrocinadores y partners de cómputo»Este benchmark es uso académico y citable de un catálogo de modelos abiertos para una publicación de NLP en salud. Si hospedas o financias inferencia de pesos abiertos y quieres que tus modelos estén representados en la comparación — o quieres patrocinar el cómputo que lo completa — el estudio es un uso transparente, bien instrumentado, y con destino de publicación de ese cómputo. Contáctanos a través de los medios en poktacare.com.