神经球体旁有检查表与封闭对话气泡的示意插图

模型嘴上不说、心里知道:评估意识能被查出来吗?

未言说的评估意识是安全审计的核心痛点。Anthropic 的 NLA 能从激活中捕捉它,而不只依赖模型在文字里承认什么。