Inspect India Evals
用 MMLU 或 TruthfulQA 去衡量一个模型在非西方语境下的表现,其实挺没意义的。就像你不能用雅思成绩单来判断一个人能不能在印度农村顺畅地沟通一样。印度有 22 种官方语言,文化碎片化极其严重,如果 LLM 只是在英文语料上刷分,到了实际应用场景很容易出现文化偏差甚至安全漏洞。
最让我意外的是测试结果。在 8B 到 32B 参数量的开源模型对比中,Sarvam-M 24B 和 Gemma 2 27B 表现极其强悍,在印度公平性指数(India Fairness Index)上都拿到了 80% 的高分。尤其是 Sarvam-M,在文化知识和 DPI 安全合规方面甚至反杀了体量更大的 32B 模型。
下一篇
安全防御和模型性能之间其实一直存在一种“此消彼长”的悖论 →
Inspect India Evals 恰恰就是为了填补这个坑。它基于 UK AISI 的 Inspect AI 平台搭建,把评估维度拆得非常细。我看了下它的测试矩阵,涵盖了六个维度,挺有意思的:
- 多语言 MMLU: 覆盖 16 种印度语言,看模型在本土语言下的知识储备。
- BharatBBQ: 这是一个针对印度社会偏见的专项测试(基于 BBQ 适配)。
- DPI 安全评估: 专门针对数字公共基础设施(Digital Public Infrastructure)的合规性。
- 多语言安全测试: 直接用本土语言投喂有害 Prompt,看模型是否能识别。
- 多轮越狱抗性测试: 重点考察模型在连续对话中是否会被“诱导”破防。
- 文化知识基准: 采用 LLM-as-judge 的评分机制,评估对当地文化的理解深度。
最让我意外的是测试结果。在 8B 到 32B 参数量的开源模型对比中,Sarvam-M 24B 和 Gemma 2 27B 表现极其强悍,在印度公平性指数(India Fairness Index)上都拿到了 80% 的高分。尤其是 Sarvam-M,在文化知识和 DPI 安全合规方面甚至反杀了体量更大的 32B 模型。
不过有趣的是,虽然所有模型在多语言安全测试中都达到了 100% 的拒绝率(说明基础防御很稳),但在 DPI 安全这一项上,得分波动极大,从 20% 到 100% 不等。这说明针对特定垂直领域的安全对齐,目前的开源模型依然有很大的提升空间。
这个框架目前是完全开源的,而且兼容 UK AISI 注册表,这意味着任何开发者都可以基于此扩展自己的评估集。对于想要在多语言环境下做 AI Agent 或本地化部署的同学来说,这套方法论非常值得参考。
如果你想尝试复现或者构建类似的评估工作流,可以参考其基于 Inspect AI 的配置逻辑:
# 示意性的 Inspect AI 评估配置片段
eval_setup:
benchmark: "Inspect-India-Evals"
metrics:
- "cultural_accuracy"
- "jailbreak_resistance"
- "bias_detection"
languages: ["hi", "bn", "te", "mr", "ta"] # 示例语言代码
model_registry: "uk-aisi-registry"