Saltar al contenido principal
Abstract AI evaluation course combining document, coding and agent task stations

Artificial Analysis v4.2 orienta los benchmarks de IA a pruebas privadas de agentes y documentos

El índice compuesto añade trabajo de conocimiento agéntico y razonamiento sobre documentos largos, y duplica el peso de pruebas reservadas.

Publicado

06 sep 2026

Tiempo de Lectura

3 min de lectura

Compartir este artículo:

Contenido

Qué cambia en la versión 4.2

Artificial Analysis anunció Intelligence Index v4.2 el 4 de septiembre de 2026, actualizando el benchmark compuesto con el que compara modelos de lenguaje en trabajo agéntico, programación, razonamiento científico y conocimiento general. La versión añade dos evaluaciones, elimina una prueba saturada y cambia la infraestructura de calificación.

La primera incorporación es AA-Briefcase, una evaluación privada de trabajo de conocimiento en varios pasos. Pide a los modelos resolver tareas vinculadas y grandes colecciones de archivos fuente, y combina rúbricas con comparaciones por pares sobre éxito, análisis y presentación. La segunda es GDP.pdf, creada por Surge AI, que prueba el razonamiento sobre 100 PDF profesionales de diez dominios y 4.592 páginas.

Artificial Analysis eliminó GPQA Diamond porque considera saturado ese benchmark de razonamiento científico. También actualizó claves de respuesta y prompts de evaluación en AA-LCR, volvió a anclar las puntuaciones Elo de dos pruebas de agentes y modificó los entornos de SciCode para evitar que programas lentos pero correctos cuenten como fallos.

Una parte mayor se mantiene privada

El cambio estructural principal es que el 40 % del peso del índice procede ahora de conjuntos de prueba privados y reservados, el doble que en la versión 4.1. La organización afirma que así se reduce la posibilidad de optimizar directamente contra preguntas conocidas.

Las pruebas privadas abordan un problema habitual, pero introducen otro equilibrio: terceros no pueden inspeccionar todos los elementos ni reproducir cada resultado. Hay que valorar resistencia a la contaminación y transparencia. Una metodología pública, procedimientos estables y versiones claras son especialmente importantes cuando no se divulgan las preguntas.

El índice combina ahora diez evaluaciones. Los pesos son 30 % para agentes, 20 % para programación, 20 % para razonamiento científico y 30 % para capacidades generales. Es una decisión metodológica que hace el resultado más sensible al trabajo agéntico que un benchmark centrado solo en respuestas breves.

Por qué las versiones complican la comparación

Una puntuación de v4.2 no debe tratarse como intercambiable con una versión anterior. Añadir tareas, cambiar pesos y volver a anclar evaluadores puede alterar posiciones aunque los modelos no cambien. Para compras o investigación, la comparación útil es entre modelos evaluados con la misma versión y ajustes.

Artificial Analysis indica que Anthropic y OpenAI lideran el índice compuesto al lanzarse, y que cuatro laboratorios forman la frontera de coste por tarea. Son mediciones de Artificial Analysis con su metodología, no rankings universales. Un modelo puede rendir bien en el agregado y no encajar en un idioma, latencia, dominio o entorno de herramientas concretos.

Cómo deberían usarlo los equipos

Conviene emplear v4.2 como una señal dentro de una evaluación más amplia. Hay que revisar resultados por prueba, tokens, coste y tiempo, no solo el agregado. Después, es útil ejecutar un conjunto interno pequeño que refleje documentos, herramientas, coste de errores e idiomas reales.

La actualización hace el índice más difícil y centrado en agentes. Su valor dependerá de si esas tareas revisadas predicen el éxito en el trabajo que los equipos necesitan completar.

Fuentes

Etiquetas:

#AI benchmarks #Artificial Analysis #AI agents #long context #model evaluation #held-out tests

24

vistas

0

compartidos

0

me gusta

Artículos Relacionados