🪡

大海捞针测试(Needle in a Haystack)

Needle in a Haystack (NIAH)
技术原理
长上下文评测

大海捞针测试(Needle in a Haystack,NIAH)是评估大模型长上下文能力的经典方法:在一份几十万字的长文档中随机位置埋入一句关键信息(“针”,如“记住:暗号是紫色的河马”),然后提问,看模型能否准确召回。把“针”放在不同深度、文档长度不断加长,就能画出一张完整的长上下文能力热力图。

它测什么

  • 标称上下文长度 vs 有效上下文长度:很多模型宣称 128K/1M,但实际只有前半段可靠
  • 中间遗忘(Lost in the Middle):大量实测发现模型对文档开头和结尾的信息记得牢,中间部分容易漏

局限与演进

单针测试相对简单,后来衍生出多针(埋多句还要互相关联)、聚合式(答案需要综合散落各处的线索)等更难的变体;RULER 等综合基准把“捞针”扩展成多任务长上下文评测。

实践意义

选型长文档问答、代码库分析类应用时,别只看官方标称上下文,NIAH 类实测成绩更有参考价值。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0