GPQA Diamond Conocimiento EXTERNO · ACADEMICA
Rein et al. (NYU/Anthropic) · Versión: diamond-198 · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide conocimiento cientifico de nivel posgrado: 198 preguntas multiple-choice de biologia, fisica y quimica validadas por expertos.
Dataset: Subconjunto Diamond: 198 preguntas de maxima calidad validadas por dos expertos.
Qué NO mide
No mide investigacion abierta ni trabajo de laboratorio.
Metodología
Accuracy multiple-choice. Distinguir Diamond (198) de Extended/Main: no son la misma metrica.
- diamond-198 · dataset diamond · 198 preguntas validadas por expertos.
Cómo interpretar el número
Proporcion de respuestas correctas. Mayor suele ser mejor.
Limitaciones
Azar = 25%. Expertos humanos no especialistas rondan 65%: superar eso indica conocimiento real, no inteligencia general.
Resultados disponibles (5)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (accuracy) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| GPT-5 PROVEEDOR | 88,4 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: diamond-198 Herramientas: desconocido · Web: desconocido |
OpenAI (anuncio GPT-5)
Ver fuente Resultado informado por el proveedor. |
| Gemini 2.5 Pro PROVEEDOR | 84,0 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: diamond-198 Herramientas: desconocido · Web: desconocido |
Google (anuncio Gemini 2.5 Pro)
Ver fuente Resultado informado por el proveedor. |
| Claude Opus 4 HISTÓRICO · retirado PROVEEDOR | 83,3 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: diamond-198 Herramientas: desconocido · Web: desconocido |
Anthropic (anuncio Claude 4)
Ver fuente Resultado informado por el proveedor. Modelo retirado: historico. |
| DeepSeek R1 PROVEEDOR | 71,5 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: diamond-198 Herramientas: desconocido · Web: desconocido |
DeepSeek-R1 paper
Ver fuente Tabla de resultados del paper. Modelo open weights. |
| GPT-4o PROVEEDOR | 53,6 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: diamond-198 Herramientas: desconocido · Web: desconocido |
OpenAI (Hello GPT-4o)
Ver fuente Resultado informado por el proveedor. |