{"benchmark_id":"translation-en→set1-comet22","benchmark_name":"Translation en→Set1 COMET22","benchmark_description":"COMET-22 is an ensemble machine translation evaluation metric combining a COMET estimator model trained with Direct Assessments and a multitask model that predicts sentence-level scores and word-level OK/BAD tags. It demonstrates improved correlations compared to state-of-the-art metrics and increased robustness to critical errors.","max_score":1.0,"categories":["language"],"modality":"text","total_models":3,"entries":[{"rank":1,"model_id":"nova-pro","model_name":"Nova Pro","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.891,"normalized_score":0.891,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2024-11-20","announcement_date":"2024-11-20","multimodal":true,"param_count":null,"is_new":false},{"rank":2,"model_id":"nova-lite","model_name":"Nova Lite","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.888,"normalized_score":0.888,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2024-11-20","announcement_date":"2024-11-20","multimodal":true,"param_count":null,"is_new":false},{"rank":3,"model_id":"nova-micro","model_name":"Nova Micro","organization_name":"Amazon","organization_id":"amazon","benchmark_score":0.885,"normalized_score":0.885,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2024-11-20","announcement_date":"2024-11-20","multimodal":false,"param_count":null,"is_new":false}]}