Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Observatorio de Programacion

Resultados verificados relacionados con esta tarea o capacidad evaluada.

Los resultados corresponden a evaluaciones especificas. Diferentes benchmarks, versiones o metodologias pueden no ser directamente comparables.

Filtros de benchmark, modelo y periodo
Limpiar

Benchmarks relacionados

HumanEval
Metrica: pass@1 · Unidad: %
SWE-bench Verified
Metrica: % tareas resueltas · Unidad: %

Evolucion disponible

GPT-4o · SWE-bench Verified

Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-4o en SWE-bench Verified
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
No confirmado33,2 %No confirmadoNo confirmadoLeaderboard oficial SWE-bench (vista Bash Only) Ver fuente

GPT-4o · HumanEval

Version: v1.0.0 · Metrica: pass@1 · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-4o en HumanEval
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
13/05/202490,2 %No confirmado13/05/2024OpenAI (Hello GPT-4o) Ver fuente

Claude Opus 4 · SWE-bench Verified

Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de Claude Opus 4 en SWE-bench Verified
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/05/202572,5 %No confirmado22/05/2025Anthropic (anuncio Claude 4) Ver fuente

DeepSeek R1 · SWE-bench Verified

Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de DeepSeek R1 en SWE-bench Verified
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/01/202549,2 %No confirmado22/01/2025DeepSeek-R1 paper Ver fuente

GPT-5 · SWE-bench Verified

Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-5 en SWE-bench Verified
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
07/08/202574,9 %No confirmado07/08/2025OpenAI (anuncio GPT-5) Ver fuente

Limitaciones

La ausencia de puntos comparables no significa ausencia de capacidad. Benchmarks, versiones, metricas, unidades, harnesses y condiciones diferentes deben mantenerse separados. Alias, snapshots, modelo logico y familia tampoco se sustituyen entre si.