Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

GPQA Diamond Conocimiento EXTERNO · ACADEMICA

Rein et al. (NYU/Anthropic) · Versión: diamond-198 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide conocimiento cientifico de nivel posgrado: 198 preguntas multiple-choice de biologia, fisica y quimica validadas por expertos.

Dataset: Subconjunto Diamond: 198 preguntas de maxima calidad validadas por dos expertos.

Qué NO mide

No mide investigacion abierta ni trabajo de laboratorio.

Metodología

Accuracy multiple-choice. Distinguir Diamond (198) de Extended/Main: no son la misma metrica.

  • diamond-198 · dataset diamond · 198 preguntas validadas por expertos.

Cómo interpretar el número

Proporcion de respuestas correctas. Mayor suele ser mejor.

Limitaciones

Azar = 25%. Expertos humanos no especialistas rondan 65%: superar eso indica conocimiento real, no inteligencia general.

Resultados disponibles (5)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de GPQA Diamond por modelo, con fuente y configuración
Modelo Resultado (accuracy) Fecha Versión / Configuración Fuente
GPT-5 PROVEEDOR 88,4 % Eval.: desconocida
Verif.: 18/09/2026
Versión: diamond-198
Herramientas: desconocido · Web: desconocido
OpenAI (anuncio GPT-5)
Ver fuente
Resultado informado por el proveedor.
Gemini 2.5 Pro PROVEEDOR 84,0 % Eval.: desconocida
Verif.: 18/09/2026
Versión: diamond-198
Herramientas: desconocido · Web: desconocido
Google (anuncio Gemini 2.5 Pro)
Ver fuente
Resultado informado por el proveedor.
Claude Opus 4 HISTÓRICO · retirado PROVEEDOR 83,3 % Eval.: desconocida
Verif.: 18/09/2026
Versión: diamond-198
Herramientas: desconocido · Web: desconocido
Anthropic (anuncio Claude 4)
Ver fuente
Resultado informado por el proveedor. Modelo retirado: historico.
DeepSeek R1 PROVEEDOR 71,5 % Eval.: desconocida
Verif.: 18/09/2026
Versión: diamond-198
Herramientas: desconocido · Web: desconocido
DeepSeek-R1 paper
Ver fuente
Tabla de resultados del paper. Modelo open weights.
GPT-4o PROVEEDOR 53,6 % Eval.: desconocida
Verif.: 18/09/2026
Versión: diamond-198
Herramientas: desconocido · Web: desconocido
OpenAI (Hello GPT-4o)
Ver fuente
Resultado informado por el proveedor.