{"benchmark_id":"creative-writing-v3","name":"Creative Writing v3","parent_benchmark":null,"categories":["creativity","writing"],"modality":"text","multilingual":false,"max_score":1.0,"language":"en","description":"EQ-Bench Creative Writing v3 is an LLM-judged creative writing benchmark that evaluates models across 32 writing prompts with 3 iterations per prompt. Uses a hybrid scoring system combining rubric assessment and Elo ratings through pairwise comparisons. Challenges models in areas like humor, romance, spatial awareness, and unique perspectives to assess emotional intelligence and creative writing capabilities.","paper_link":"https://arxiv.org/abs/2312.06281","implementation_link":null,"verified":false,"created_at":"2026-05-07T16:53:22.609023+00:00","updated_at":"2026-07-05T18:27:46.190784+00:00","statistics":{"total_models":13,"average_score":264.59661538461535,"min_score":0.761,"max_score":1721.9,"score_stddev":643.8240943083157,"verified_count":0,"self_reported_count":13},"child_benchmarks":[],"linked_dataset":null,"models":[{"rank":1,"model_id":"grok-4.1-thinking-2025-11-17","model_name":"Grok-4.1 Thinking","organization_id":"xai","organization_name":"xAI","organization_country":"US","score":1721.9,"normalized_score":0.86095,"verified":false,"self_reported":true,"self_reported_source":"https://x.ai/news/grok-4.1","analysis_method":"Creative Writing v3 - Normalized Elo score. Evaluates creative writing capabilities across 32 writing prompts with 3 iterations per prompt.","verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-11-17","param_count":null,"is_open_source":false,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":2,"model_id":"grok-4.1-2025-11-17","model_name":"Grok-4.1","organization_id":"xai","organization_name":"xAI","organization_country":"US","score":1708.6,"normalized_score":0.8543,"verified":false,"self_reported":true,"self_reported_source":"https://x.ai/news/grok-4.1","analysis_method":"Creative Writing v3 - Normalized Elo score. Evaluates creative writing capabilities across 32 writing prompts with 3 iterations per prompt.","verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-11-17","param_count":null,"is_open_source":false,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":3,"model_id":"qwen3-235b-a22b-instruct-2507","model_name":"Qwen3-235B-A22B-Instruct-2507","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.875,"normalized_score":0.875,"verified":false,"self_reported":true,"self_reported_source":"https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507","analysis_method":"Score","verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-07-22","param_count":235000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":4,"model_id":"qwen3-vl-235b-a22b-instruct","model_name":"Qwen3 VL 235B A22B Instruct","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.865,"normalized_score":0.865,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-22","param_count":236000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":5,"model_id":"qwen3-235b-a22b-thinking-2507","model_name":"Qwen3-235B-A22B-Thinking-2507","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.861,"normalized_score":0.861,"verified":false,"self_reported":true,"self_reported_source":"https://qwenlm.github.io/blog/qwen3-thinking/","analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-07-25","param_count":235000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":6,"model_id":"qwen3-vl-235b-a22b-thinking","model_name":"Qwen3 VL 235B A22B Thinking","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.857,"normalized_score":0.857,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-22","param_count":236000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":7,"model_id":"qwen3-vl-32b-instruct","model_name":"Qwen3 VL 32B Instruct","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.856,"normalized_score":0.856,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-22","param_count":33000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":8,"model_id":"qwen3-next-80b-a3b-instruct","model_name":"Qwen3-Next-80B-A3B-Instruct","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.853,"normalized_score":0.853,"verified":false,"self_reported":true,"self_reported_source":"https://qwenlm.github.io/blog/qwen3-next/","analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-10","param_count":80000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":9,"model_id":"qwen3-vl-30b-a3b-instruct","model_name":"Qwen3 VL 30B A3B Instruct","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.846,"normalized_score":0.846,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-22","param_count":31000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":10,"model_id":"qwen3-vl-32b-thinking","model_name":"Qwen3 VL 32B Thinking","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.833,"normalized_score":0.833,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-22","param_count":33000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":11,"model_id":"qwen3-vl-30b-a3b-thinking","model_name":"Qwen3 VL 30B A3B Thinking","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.825,"normalized_score":0.825,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"context_window":null,"announcement_date":"2025-09-22","param_count":31000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":null,"best_throughput":null,"throughput_provider":null,"context_provider":null},{"rank":12,"model_id":"qwen3-vl-8b-thinking","model_name":"Qwen3 VL 8B Thinking","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.824,"normalized_score":0.824,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":"deepinfra","input_cost_per_million":0.18,"output_cost_per_million":2.09,"context_window":262144,"announcement_date":"2025-09-22","param_count":9000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":"DeepInfra","best_throughput":null,"throughput_provider":"DeepInfra","context_provider":"DeepInfra"},{"rank":13,"model_id":"qwen3-vl-4b-thinking","model_name":"Qwen3 VL 4B Thinking","organization_id":"qwen","organization_name":"Alibaba Cloud / Qwen Team","organization_country":"CN","score":0.761,"normalized_score":0.761,"verified":false,"self_reported":true,"self_reported_source":null,"analysis_method":null,"verification_date":null,"provider_id":"deepinfra","input_cost_per_million":0.1,"output_cost_per_million":1.0,"context_window":262144,"announcement_date":"2025-09-22","param_count":4000000000,"is_open_source":true,"is_new":false,"best_latency":null,"latency_provider":"DeepInfra","best_throughput":null,"throughput_provider":"DeepInfra","context_provider":"DeepInfra"}]}