{"benchmark_id":"officeqa-pro","benchmark_name":"OfficeQA Pro","benchmark_description":"OfficeQA Pro evaluates AI models on professional knowledge-work questions and tasks drawn from real office workflows, including document analysis, spreadsheet reasoning, and information synthesis across business domains.","max_score":1.0,"categories":["reasoning","general","agents"],"modality":"text","total_models":8,"entries":[{"rank":1,"model_id":"seed-2.1-pro","model_name":"Seed 2.1 Pro","organization_name":"ByteDance","organization_id":"bytedance","benchmark_score":0.722,"normalized_score":0.722,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-06-24","announcement_date":"2026-06-24","multimodal":true,"param_count":null,"is_new":false},{"rank":2,"model_id":"seed-2.1-turbo","model_name":"Seed 2.1 Turbo","organization_name":"ByteDance","organization_id":"bytedance","benchmark_score":0.711,"normalized_score":0.711,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2026-06-24","announcement_date":"2026-06-24","multimodal":true,"param_count":null,"is_new":false},{"rank":3,"model_id":"claude-opus-4-8","model_name":"Claude Opus 4.8","organization_name":"Anthropic","organization_id":"anthropic","benchmark_score":0.662,"normalized_score":0.662,"verified":false,"self_reported":true,"provider_id":"anthropic","input_cost_per_million":5.0,"output_cost_per_million":25.0,"speed_rps":42.0,"context_window":1000000,"release_date":"2026-05-28","announcement_date":"2026-05-28","multimodal":true,"param_count":null,"is_new":false},{"rank":4,"model_id":"kimi-k3","model_name":"Kimi K3","organization_name":"Moonshot AI","organization_id":"moonshotai","benchmark_score":0.633,"normalized_score":0.633,"verified":false,"self_reported":true,"provider_id":"novita","input_cost_per_million":3.0,"output_cost_per_million":15.0,"speed_rps":null,"context_window":1048576,"release_date":"2026-07-16","announcement_date":"2026-07-16","multimodal":true,"param_count":2800000000000,"is_new":false},{"rank":5,"model_id":"glm-5.3-flash","model_name":"GLM-5.3-Flash","organization_name":"Zhipu AI","organization_id":"zai-org","benchmark_score":0.624,"normalized_score":0.624,"verified":false,"self_reported":true,"provider_id":"novita","input_cost_per_million":0.15,"output_cost_per_million":0.5,"speed_rps":null,"context_window":1048576,"release_date":"2026-08-26","announcement_date":"2026-08-26","multimodal":true,"param_count":320000000000,"is_new":true},{"rank":6,"model_id":"claude-sonnet-5","model_name":"Claude Sonnet 5","organization_name":"Anthropic","organization_id":"anthropic","benchmark_score":0.594,"normalized_score":0.594,"verified":false,"self_reported":true,"provider_id":"anthropic","input_cost_per_million":2.0,"output_cost_per_million":10.0,"speed_rps":42.0,"context_window":1000000,"release_date":"2026-06-30","announcement_date":"2026-06-30","multimodal":true,"param_count":null,"is_new":false},{"rank":7,"model_id":"gpt-5.5","model_name":"GPT-5.5","organization_name":"OpenAI","organization_id":"openai","benchmark_score":0.541,"normalized_score":0.541,"verified":false,"self_reported":true,"provider_id":"openai","input_cost_per_million":5.0,"output_cost_per_million":30.0,"speed_rps":null,"context_window":1050000,"release_date":"2026-04-23","announcement_date":"2026-04-23","multimodal":true,"param_count":null,"is_new":false},{"rank":8,"model_id":"minimax-m3","model_name":"MiniMax M3","organization_name":"MiniMax","organization_id":"minimax","benchmark_score":0.451,"normalized_score":0.451,"verified":false,"self_reported":true,"provider_id":"novita","input_cost_per_million":0.3,"output_cost_per_million":1.2,"speed_rps":null,"context_window":1000000,"release_date":"2026-06-01","announcement_date":"2026-06-01","multimodal":true,"param_count":428000000000,"is_new":false}]}