DeepSeek R1
Por DeepSeek · Estado: Disponible
Modelo abierto de razonamiento de DeepSeek, con pesos descargables y API compatible OpenAI/Anthropic. Contexto y precio no verificados al 17/09/2026: no se publican.
Última verificación: 17/09/2026 · Fuente oficial
Resumen técnico
| Estado | Disponible |
|---|---|
| Contexto | No confirmado |
| Salida máxima | No confirmada |
| API | Confirmada |
| Uso local | Confirmado |
| Pesos | Abiertos (MIT) |
Capacidades verificadas
Confirmadas: Texto Razonamiento
Sin confirmar: Visión, Audio (entrada), Audio (salida), Imágenes, Video, Programación, Llamadas a herramientas, Búsqueda web y otros datos.
La ausencia de confirmación no significa que el modelo carezca de la capacidad.
Precios
Sin precio de API publicado o verificado. Puede tratarse de un modelo de pesos abiertos, de acceso por contacto comercial o con precio aún no verificado.
Disponibilidad
- Uso local: Disponible
Noticias relacionadas
Todavía no hay noticias vinculadas a este modelo.
Otros modelos de DeepSeek
- DeepSeek (Disponible)
Aprender a usarlo
Técnicas, plantillas y herramientas para comunicarte mejor con este tipo de modelos.
Evaluaciones (5 registradas)
Cantidad de resultados por categoría —un conteo, no un puntaje— con fuente, versión y fecha de verificación. Ver metodología. Comparar estas evaluaciones
- Conocimiento: 2 · ver observatorio
- Matematica: 2 · ver observatorio
- Programacion: 1 · ver observatorio
| Benchmark | Resultado | Fuente |
|---|---|---|
| GPQA Diamond (Conocimiento) PROVEEDOR | 71,5 % Métrica: accuracy · versión diamond-198 |
DeepSeek-R1 paper · 18/09/2026
Comparabilidad: Azar = 25%. Expertos humanos no especialistas rondan 65%: superar eso indica conocimiento real, no inteligencia general. |
| MMLU (Conocimiento) PROVEEDOR | 90,8 % Métrica: accuracy · versión original-57 |
DeepSeek-R1 paper · 18/09/2026
Comparabilidad: Errores de ground-truth documentados (MMLU-Redux). Saturado en frontera: bajo poder discriminativo actual. |
| AIME (Matematica) PROVEEDOR | 79,8 % Métrica: accuracy · versión 2024 |
DeepSeek-R1 paper · 18/09/2026
Comparabilidad: Muestra pequena (30): una diferencia de 1 problema son 3.3 puntos. Posible contaminacion en ediciones antiguas (ver MathArena, NeurIPS 2025). |
| MATH (Matematica) PROVEEDOR | 97,3 % Métrica: accuracy · versión test-500 |
DeepSeek-R1 paper · 18/09/2026
Comparabilidad: Distinguir full vs MATH-500 al comparar. |
| SWE-bench Verified (Programacion) PROVEEDOR | 49,2 % Métrica: % tareas resueltas · versión Verified-500 |
DeepSeek-R1 paper · 18/09/2026
Comparabilidad: El harness influye: resultados con distinto agente no son directamente comparables. No representa todo el trabajo de programacion. |