{"benchmark_id":"multichallenge","benchmark_name":"Multi-Challenge","benchmark_description":"MultiChallenge is a realistic multi-turn conversation evaluation benchmark that challenges frontier LLMs across four key categories: instruction retention (maintaining instructions throughout conversations), inference memory (recalling and connecting details from previous turns), reliable versioned editing (adapting to evolving instructions during collaborative editing), and self-coherence (avoiding contradictions in responses). The benchmark evaluates models on sustained, contextually complex dialogues across diverse topics including travel planning, technical documentation, and professional communication.","max_score":1.0,"categories":["chat","reasoning","communication"],"modality":"text","total_models":29,"entries":[{"rank":1,"model_id":"nova-2-pro","model_name":"Nova 2 Pro","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.777,"normalized_score":0.777,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-12-02","announcement_date":"2025-12-02","multimodal":true,"param_count":null,"is_new":false},{"rank":2,"model_id":"nova-2-lite","model_name":"Nova 2 Lite","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.766,"normalized_score":0.766,"verified":false,"self_reported":true,"provider_id":"bedrock","input_cost_per_million":0.3,"output_cost_per_million":2.5,"speed_rps":null,"context_window":1000000,"release_date":"2025-12-02","announcement_date":"2025-12-02","multimodal":true,"param_count":null,"is_new":false},{"rank":3,"model_id":"nova-2-omni","model_name":"Nova 2 Omni","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.755,"normalized_score":0.755,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-12-02","announcement_date":"2025-12-02","multimodal":true,"param_count":null,"is_new":false},{"rank":4,"model_id":"gpt-5-2025-08-07","model_name":"GPT-5","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.696,"normalized_score":0.696,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-08-07","announcement_date":"2025-08-07","multimodal":true,"param_count":null,"is_new":false},{"rank":5,"model_id":"qwen3.5-397b-a17b","model_name":"Qwen3.5-397B-A17B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.676,"normalized_score":0.676,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-02-16","announcement_date":"2026-02-16","multimodal":true,"param_count":397000000000,"is_new":false},{"rank":6,"model_id":"nemotron-3-ultra-550b-a55b","model_name":"Nemotron 3 Ultra (550B A55B)","organization_name":"NVIDIA","organization_id":"nvidia","benchmark_score":0.638,"normalized_score":0.638,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-06-04","announcement_date":"2026-06-04","multimodal":false,"param_count":550000000000,"is_new":false},{"rank":7,"model_id":"step3-vl-10b","model_name":"Step3-VL-10B","organization_name":"StepFun","organization_id":"stepfun","benchmark_score":0.626,"normalized_score":0.626,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-01-15","announcement_date":"2026-01-15","multimodal":true,"param_count":10000000000,"is_new":false},{"rank":8,"model_id":"qwen3.5-122b-a10b","model_name":"Qwen3.5-122B-A10B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.615,"normalized_score":0.615,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-02-24","announcement_date":"2026-02-24","multimodal":true,"param_count":122000000000,"is_new":false},{"rank":9,"model_id":"qwen3.5-27b","model_name":"Qwen3.5-27B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.608,"normalized_score":0.608,"verified":false,"self_reported":true,"provider_id":"novita","input_cost_per_million":0.3,"output_cost_per_million":2.4,"speed_rps":null,"context_window":262144,"release_date":"2026-02-24","announcement_date":"2026-02-24","multimodal":true,"param_count":27000000000,"is_new":false},{"rank":10,"model_id":"o3-2025-04-16","model_name":"o3","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.604,"normalized_score":0.604,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-04-16","announcement_date":"2025-04-16","multimodal":true,"param_count":null,"is_new":false},{"rank":11,"model_id":"qwen3.5-35b-a3b","model_name":"Qwen3.5-35B-A3B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.6,"normalized_score":0.6,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-02-24","announcement_date":"2026-02-24","multimodal":true,"param_count":35000000000,"is_new":false},{"rank":12,"model_id":"nemotron-3-super-120b-a12b","model_name":"Nemotron 3 Super (120B A12B)","organization_name":"NVIDIA","organization_id":"nvidia","benchmark_score":0.5523,"normalized_score":0.5523,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-03-11","announcement_date":"2026-03-11","multimodal":false,"param_count":120000000000,"is_new":false},{"rank":13,"model_id":"qwen3.5-9b","model_name":"Qwen3.5-9B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.545,"normalized_score":0.545,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-03-02","announcement_date":"2026-03-02","multimodal":true,"param_count":9000000000,"is_new":false},{"rank":14,"model_id":"kimi-k2-instruct-0905","model_name":"Kimi K2-Instruct-0905","organization_name":"Moonshot AI","organization_id":"moonshotai","benchmark_score":0.541,"normalized_score":0.541,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-09-05","announcement_date":"2025-09-05","multimodal":false,"param_count":1000000000000,"is_new":false},{"rank":15,"model_id":"kimi-k2-instruct","model_name":"Kimi K2 Instruct","organization_name":"Moonshot AI","organization_id":"moonshotai","benchmark_score":0.541,"normalized_score":0.541,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-07-11","announcement_date":"2025-07-11","multimodal":false,"param_count":1000000000000,"is_new":false},{"rank":16,"model_id":"mai-thinking-1","model_name":"MAI-Thinking-1","organization_name":"Microsoft","organization_id":"microsoft","benchmark_score":0.53,"normalized_score":0.53,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-06-02","announcement_date":"2026-06-02","multimodal":false,"param_count":1000000000000,"is_new":false},{"rank":17,"model_id":"qwen3.5-4b","model_name":"Qwen3.5-4B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.49,"normalized_score":0.49,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-03-02","announcement_date":"2026-03-02","multimodal":true,"param_count":4000000000,"is_new":false},{"rank":18,"model_id":"minimax-m1-40k","model_name":"MiniMax M1 40K","organization_name":"MiniMax","organization_id":"minimax","benchmark_score":0.447,"normalized_score":0.447,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-06-16","announcement_date":"2025-06-16","multimodal":false,"param_count":456000000000,"is_new":false},{"rank":19,"model_id":"minimax-m1-80k","model_name":"MiniMax M1 80K","organization_name":"MiniMax","organization_id":"minimax","benchmark_score":0.447,"normalized_score":0.447,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-06-16","announcement_date":"2025-06-16","multimodal":false,"param_count":456000000000,"is_new":false},{"rank":20,"model_id":"gpt-4.5","model_name":"GPT-4.5","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.438,"normalized_score":0.438,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-02-27","announcement_date":"2025-02-27","multimodal":true,"param_count":null,"is_new":false},{"rank":21,"model_id":"o4-mini","model_name":"o4-mini","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.43,"normalized_score":0.43,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-04-16","announcement_date":"2025-04-16","multimodal":true,"param_count":null,"is_new":false},{"rank":22,"model_id":"gpt-4o-2024-08-06","model_name":"GPT-4o","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.403,"normalized_score":0.403,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":2.5,"output_cost_per_million":10.0,"speed_rps":132.0,"context_window":128000,"release_date":"2024-08-06","announcement_date":"2024-08-06","multimodal":true,"param_count":null,"is_new":false},{"rank":23,"model_id":"o3-mini","model_name":"o3-mini","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.399,"normalized_score":0.399,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-01-30","announcement_date":"2025-01-30","multimodal":false,"param_count":null,"is_new":false},{"rank":24,"model_id":"nemotron-3-nano-30b-a3b","model_name":"Nemotron 3 Nano (30B A3B)","organization_name":"NVIDIA","organization_id":"nvidia","benchmark_score":0.385,"normalized_score":0.385,"verified":false,"self_reported":true,"provider_id":"deepinfra","input_cost_per_million":0.06,"output_cost_per_million":0.24,"speed_rps":null,"context_window":262144,"release_date":"2025-12-15","announcement_date":"2025-12-15","multimodal":false,"param_count":32000000000,"is_new":false},{"rank":25,"model_id":"gpt-4.1-2025-04-14","model_name":"GPT-4.1","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.383,"normalized_score":0.383,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":2.0,"output_cost_per_million":8.0,"speed_rps":100.0,"context_window":1047576,"release_date":"2025-04-14","announcement_date":"2025-04-14","multimodal":true,"param_count":null,"is_new":false},{"rank":26,"model_id":"gpt-4.1-mini-2025-04-14","model_name":"GPT-4.1 mini","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.358,"normalized_score":0.358,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":0.4,"output_cost_per_million":1.6,"speed_rps":150.0,"context_window":1047576,"release_date":"2025-04-14","announcement_date":"2025-04-14","multimodal":true,"param_count":null,"is_new":false},{"rank":27,"model_id":"qwen3.5-2b","model_name":"Qwen3.5-2B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.337,"normalized_score":0.337,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-03-02","announcement_date":"2026-03-02","multimodal":true,"param_count":2000000000,"is_new":false},{"rank":28,"model_id":"qwen3.5-0.8b","model_name":"Qwen3.5-0.8B","organization_name":"Alibaba Cloud / Qwen Team","organization_id":"qwen","benchmark_score":0.189,"normalized_score":0.189,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-03-02","announcement_date":"2026-03-02","multimodal":true,"param_count":800000000,"is_new":false},{"rank":29,"model_id":"gpt-4.1-nano-2025-04-14","model_name":"GPT-4.1 nano","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.15,"normalized_score":0.15,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":0.1,"output_cost_per_million":0.4,"speed_rps":200.0,"context_window":1047576,"release_date":"2025-04-14","announcement_date":"2025-04-14","multimodal":true,"param_count":null,"is_new":false}]}