AI可解释性(Interpretability)指让AI模型的决策过程和内部机制能够被人类理解的能力。随着AI进入医疗、金融、司法等高风险领域,“为什么得出这个结论”变得和“结论本身”一样重要。
为什么需要可解释性
- 信任:用户更愿意相信能解释自己的系统
- 合规:金融、医疗等行业监管要求决策可审计
- 调试:理解模型内部机制有助于发现错误和偏见
- 安全:可解释性是识别模型漏洞与恶意行为的前提
主流方法
- 事后解释:用SHAP、LIME等工具分析某个预测主要受哪些特征影响
- 注意力可视化:观察模型对输入的关注分布(其有效性存在争议)
- 可解释模型:使用决策树、线性模型等天然可解释的结构
- 机制可解释性:近年兴起的路线,试图直接解读模型内部神经元和电路的功能
进展与挑战
- 2025年以来,多家机构在模型内部机制研究上取得进展,已能部分定位模型“说谎”或“推理”所涉及的内部单元
- 大模型规模庞大,完整解释其内部行为仍是开放难题
- 可解释性与性能往往存在权衡,“够用”的解释比“完美”的解释更现实