{"schema_version":1,"total":1,"offset":0,"limit":100,"observations":[{"id":"public:0052589720e9743635359590","benchmark_id":"japanese-rp-bench-tegnike::2","subject":{"source_id":"Qwen3.8 Max","name":"Qwen3.8 Max","model_id":"qwen3.8-max::default","variant":null,"harness":null},"value":87.66,"unit":"points","basis":"measured","source":{"url":"https://raw.githubusercontent.com/tegnike/Japanese-RP-Bench/main/README.md","retrieved_at":"2026-09-10T21:53:18Z","published_at":null,"file":"ops/rebuild-2026-09/evidence/phase-04/sources/extra-bbefcb28c4b0.md.gz","sha256":"765fb30f9f7a955242c8558f0995417d5b3ab1cf783381adb9eba1ae0dad98a2","locator":"markdown_table; source row 77; Qwen3.8 Max; field value"},"protocol":"Challenge RP Summary: macro-average of five criteria; leaderboard first sorts Major-free rate descending, then Major rate ascending; source row: [\"12\",\"Qwen3.8 Max\",\"63.3%\",\"73.3\",\"87.66 [79.21, 94.57]\",\"0.01%\"]","comparison_key":null,"join_note":"Exact display name, unique default catalog configuration; no effort alias inference."}],"divergences":[],"cell":null,"coverage":{"model":null,"benchmark":{"total_models":835,"available":6,"unknown":829,"not_tested":0,"not_published":0,"source_unreachable":0,"contested":0,"measured":6,"self_reported":0,"observations":15,"unmatched_observations":9}},"collection":{"benchmark_id":"japanese-rp-bench-tegnike::2","status":"collected","source_url":"https://raw.githubusercontent.com/tegnike/Japanese-RP-Bench/main/README.md","reason":"15 source results parsed; configurations remain separate; unmatched model identities are retained."},"coverage_note":"Denominators are catalog model configurations × versioned registry entries. Basis counts count covered cells, not runs; measured and self_reported may overlap. Unmatched source identities remain in observations and never inflate catalog coverage."}