Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Berkeley Function-Calling Leaderboard (BFCL) Tool Calling EXTERNO · PROYECTO

Berkeley Gorilla / UC Berkeley · Versión: v3 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide llamada a funciones: seleccion de herramienta, argumentos validos, secuencia y ejecucion en Python/Java/JavaScript y multi-turno.

Dataset: Categorias AST, ejecutables y multi-turno en varios lenguajes.

Qué NO mide

No mide calidad de la respuesta final mas alla de la llamada correcta, ni agentes de horizonte largo.

Metodología

Accuracy de llamadas (AST exacto o ejecucion equivalente segun categoria). Cada version cambia categorias: comparar solo misma version.

  • v3 · dataset v3-categories · Sin resultados cargados todavia.

Cómo interpretar el número

Proporcion de llamadas correctas. Mayor suele ser mejor dentro de la misma version.

Limitaciones

No reducir tool calling a un si/no del modelo: depende de formato, schema y harness.

Resultados disponibles (0)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Benchmark documentado, resultados pendientes de carga verificada. La ausencia de resultados es preferible a resultados sin trazabilidad.