Berkeley Function-Calling Leaderboard (BFCL) Tool Calling EXTERNO · PROYECTO
Berkeley Gorilla / UC Berkeley · Versión: v3 · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide llamada a funciones: seleccion de herramienta, argumentos validos, secuencia y ejecucion en Python/Java/JavaScript y multi-turno.
Dataset: Categorias AST, ejecutables y multi-turno en varios lenguajes.
Qué NO mide
No mide calidad de la respuesta final mas alla de la llamada correcta, ni agentes de horizonte largo.
Metodología
Accuracy de llamadas (AST exacto o ejecucion equivalente segun categoria). Cada version cambia categorias: comparar solo misma version.
- v3 · dataset v3-categories · Sin resultados cargados todavia.
Cómo interpretar el número
Proporcion de llamadas correctas. Mayor suele ser mejor dentro de la misma version.
Limitaciones
No reducir tool calling a un si/no del modelo: depende de formato, schema y harness.
Resultados disponibles (0)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
Benchmark documentado, resultados pendientes de carga verificada. La ausencia de resultados es preferible a resultados sin trazabilidad.