{"schemaVersion":1,"publishedDate":"2026-10-02","benchmarkWindow":"September 2026","machine":"EVO-X2; 128 GB unified memory","modelBenchmark":{"description":"Twenty locally graded scenarios; final ten are the hard half","scoreMaximum":20,"records":[{"name":"Gemma 4 31B QAT","quant":"UD-Q4_K_XL","runs":"20 · 20 · 20","hard":"10","speed":"10.7","role":"Reviewer / planner"},{"name":"GLM-5.3-Flash","quant":"AJ-IQ3_XXS","runs":"20","hard":"10","speed":"13.4","role":"Heavyweight contender"},{"name":"gpt-oss-120b","quant":"MXFP4","runs":"19.96 · 19.72 · 19.96","hard":"9.72–9.96","speed":"48–49","role":"Builder / daily driver"},{"name":"Nemotron 3 Super 120B","quant":"local quant","runs":"19 · 19 · 17","hard":"7–9","speed":"16.8","role":"Contender"},{"name":"Muse Glimmer 30B","quant":"Q8","runs":"19","hard":"9","speed":"7.6","role":"Contender"},{"name":"Qwen3-Coder-Next","quant":"Q4","runs":"18.56 · 19.04 · 18.29","hard":"8.56–9.04","speed":"46–48","role":"Contender"},{"name":"DeepSeek V4-Flash","quant":"IQ3","runs":"18","hard":"8","speed":"11.8","role":"Contender"},{"name":"Qwen3-Coder-Next","quant":"Q6","runs":"17.36","hard":"8.16","speed":"41","role":"Historical"},{"name":"KAT-Coder v2.5","quant":"Q8","runs":"17.55","hard":"7.55","speed":"51.4","role":"Historical"},{"name":"Qwen3.8-Flash-Next","quant":"two fair-test quants","runs":"17 · 17","hard":"7","speed":"23.6–28.2","role":"Historical"},{"name":"Tiel-Coder 35B","quant":"Q8","runs":"16.93","hard":"7.80","speed":"43.6","role":"Historical"},{"name":"Devstral 2 24B","quant":"Q8","runs":"14.76","hard":"7.76","speed":"8.5","role":"Historical"},{"name":"Qwen3.8-27B","quant":"Q8","runs":"14.75","hard":"6","speed":"7.5","role":"Sampling audit pending"},{"name":"Gemma 4 26B-A4B QAT","quant":"local quant","runs":"14","hard":"6","speed":"57.5","role":"Historical"},{"name":"Gemma 4 12B QAT","quant":"local quant","runs":"13","hard":"4","speed":"25.5","role":"Historical"},{"name":"Mistral Small 4 119B","quant":"local quant","runs":"11.42","hard":"5.17","speed":"36.1","role":"Historical"}]},"codingHarnessBenchmark":{"description":"Six repository tasks with hidden tests per model and harness","scoreMaximum":6,"records":[{"model":"gpt-oss-120b","pi":"6","openCode":"6","dsh":"6","hermes":"6"},{"model":"Gemma 4 31B QAT","pi":"6","openCode":"6","dsh":"6","hermes":"6"},{"model":"Gemma 4 12B QAT","pi":"5.33","openCode":"6","dsh":"6","hermes":"4.15"}]},"limitations":["Some model configurations have one full run","Quants, inference backends, and sampling differ between configurations","Qwen3.8-27B request settings remain under audit","No real-world assistant or OpenMuse results have been measured"]}