{"benchmark_id":"complexfuncbench","benchmark_name":"ComplexFuncBench","benchmark_description":"ComplexFuncBench is a benchmark designed to evaluate large language models' capabilities in handling complex function calling scenarios. It encompasses multi-step and constrained function calling tasks that require long-parameter filling, parameter value reasoning, and managing contexts up to 128k tokens. The benchmark includes 1,000 samples across five real-world scenarios.","max_score":1.0,"categories":["long_context","reasoning","structured_output","tool_calling"],"modality":"text","total_models":7,"entries":[{"rank":1,"model_id":"gpt-4o-2024-08-06","model_name":"GPT-4o","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.665,"normalized_score":0.665,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":2.5,"output_cost_per_million":10.0,"speed_rps":132.0,"context_window":128000,"release_date":"2024-08-06","announcement_date":"2024-08-06","multimodal":true,"param_count":null,"is_new":false},{"rank":2,"model_id":"gpt-4.1-2025-04-14","model_name":"GPT-4.1","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.655,"normalized_score":0.655,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":2.0,"output_cost_per_million":8.0,"speed_rps":100.0,"context_window":1047576,"release_date":"2025-04-14","announcement_date":"2025-04-14","multimodal":true,"param_count":null,"is_new":false},{"rank":3,"model_id":"nova-2-sonic","model_name":"Nova 2 Sonic","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.652,"normalized_score":0.652,"verified":false,"self_reported":true,"provider_id":"bedrock","input_cost_per_million":0.33,"output_cost_per_million":2.75,"speed_rps":null,"context_window":1000000,"release_date":"2025-12-02","announcement_date":"2025-12-02","multimodal":true,"param_count":null,"is_new":false},{"rank":4,"model_id":"gpt-4.5","model_name":"GPT-4.5","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.63,"normalized_score":0.63,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-02-27","announcement_date":"2025-02-27","multimodal":true,"param_count":null,"is_new":false},{"rank":5,"model_id":"gpt-4.1-mini-2025-04-14","model_name":"GPT-4.1 mini","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.493,"normalized_score":0.493,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":0.4,"output_cost_per_million":1.6,"speed_rps":150.0,"context_window":1047576,"release_date":"2025-04-14","announcement_date":"2025-04-14","multimodal":true,"param_count":null,"is_new":false},{"rank":6,"model_id":"o3-mini","model_name":"o3-mini","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.176,"normalized_score":0.176,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-01-30","announcement_date":"2025-01-30","multimodal":false,"param_count":null,"is_new":false},{"rank":7,"model_id":"gpt-4.1-nano-2025-04-14","model_name":"GPT-4.1 nano","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.057,"normalized_score":0.057,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":0.1,"output_cost_per_million":0.4,"speed_rps":200.0,"context_window":1047576,"release_date":"2025-04-14","announcement_date":"2025-04-14","multimodal":true,"param_count":null,"is_new":false}]}