{"benchmark_id":"frames","benchmark_name":"FRAMES","benchmark_description":"Factuality, Retrieval, And reasoning MEasurement Set - a unified evaluation dataset of 824 challenging multi-hop questions for testing retrieval-augmented generation systems across factuality, retrieval accuracy, and reasoning capabilities, requiring integration of 2-15 Wikipedia articles per question","max_score":1.0,"categories":["reasoning","search"],"modality":"text","total_models":2,"entries":[{"rank":1,"model_id":"kimi-k2-thinking-0905","model_name":"Kimi K2-Thinking-0905","organization_name":"Moonshot AI","organization_id":"moonshotai","benchmark_score":0.87,"normalized_score":0.87,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-09-05","announcement_date":"2025-09-05","multimodal":false,"param_count":1000000000000,"is_new":false},{"rank":2,"model_id":"deepseek-v3","model_name":"DeepSeek-V3","organization_name":"DeepSeek","organization_id":"deepseek","benchmark_score":0.733,"normalized_score":0.733,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2024-12-25","announcement_date":"2024-12-25","multimodal":false,"param_count":671000000000,"is_new":false}]}