Local OpenAI API @ 1235EvalScope BFCL-v3Agent / Function Callingtemperature = 0
Filter Models
Top N Models
by OVERALL score
Select Models
Overview
Capability Comparison
Accuracy Radar Chart
Subset Accuracy Comparison
Performance Metrics
Speed: Prefill vs Decode
VRAM Usage & Completion Time
Full Data (click headers to sort)
Model
OVERALL
PM
JS
LPM
irrelevance
MTB
MTLC
VRAM (GB)
Context (k)
Completion Time
Note: MTB = Multi-Turn Base; PM = Parallel Multiple; LPM = Live Parallel Multiple; JS = JavaScript. MTB score is shown as "-" if not tested; OVERALL accuracy is based on the first 4 subsets.
Completion time refers to overall evaluation duration, not per-instance latency.