{"schema_version":1,"total":1,"offset":0,"limit":100,"observations":[{"id":"public:9f37d75c0b2c80f0c1c0d4c4","benchmark_id":"japanese-rp-bench-tegnike::2","subject":{"source_id":"Kimi K3","name":"Kimi K3","model_id":"kimi-k3::default","variant":null,"harness":null},"value":89.59,"unit":"points","basis":"measured","source":{"url":"https://raw.githubusercontent.com/tegnike/Japanese-RP-Bench/main/README.md","retrieved_at":"2026-09-10T21:53:18Z","published_at":null,"file":"ops/rebuild-2026-09/evidence/phase-04/sources/extra-bbefcb28c4b0.md.gz","sha256":"765fb30f9f7a955242c8558f0995417d5b3ab1cf783381adb9eba1ae0dad98a2","locator":"markdown_table; source row 73; Kimi K3; field value"},"protocol":"Challenge RP Summary: macro-average of five criteria; leaderboard first sorts Major-free rate descending, then Major rate ascending; source row: [\"8\",\"Kimi K3\",\"78.3%\",\"40.0\",\"89.59 [78.19, 96.31]\",\"0.33%\"]","comparison_key":null,"join_note":"Exact display name, unique default catalog configuration; no effort alias inference."}],"divergences":[],"cell":null,"coverage":{"model":null,"benchmark":{"total_models":835,"available":6,"unknown":829,"not_tested":0,"not_published":0,"source_unreachable":0,"contested":0,"measured":6,"self_reported":0,"observations":15,"unmatched_observations":9}},"collection":{"benchmark_id":"japanese-rp-bench-tegnike::2","status":"collected","source_url":"https://raw.githubusercontent.com/tegnike/Japanese-RP-Bench/main/README.md","reason":"15 source results parsed; configurations remain separate; unmatched model identities are retained."},"coverage_note":"Denominators are catalog model configurations × versioned registry entries. Basis counts count covered cells, not runs; measured and self_reported may overlap. Unmatched source identities remain in observations and never inflate catalog coverage."}