{"id":"system-rageval-claim-1","systemId":"system-rageval","metricLabel":{"EN":"HaluEval-QA validation","FR":"HaluEval-QA validation"},"value":"Consensus accuracy 0.785 [0.725, 0.840], F1 0.786 [0.717, 0.843], ROC-AUC 0.870 [0.818, 0.915]","protocol":{"EN":"N=200, bootstrap 95% CIs","FR":"N=200, bootstrap 95% CIs"},"source":"https://github.com/Yacine-ai-tech/rageval","limitation":{"EN":"Headline finding, stated plainly: consensus did NOT beat the strongest single judge (Groq gpt-oss-120b at 0.830). A real, disclosed limitation, not a suppressed one.","FR":"Headline finding, stated plainly: consensus did NOT beat the strongest single judge (Groq gpt-oss-120b at 0.830). A real, disclosed limitation, not a suppressed one."},"verified":true,"permalink":"/api/benchmarks/system-rageval-claim-1"}