抽象激活節點轉譯成可讀文字行的示意插圖

大模型心裏在想什麼,終於能「讀成字」了

Anthropic 的自然語言自編碼器(NLA)把高維激活直接譯成可讀文字,無需標註,讓可解釋性更像「閱讀」而非解碼特徵清單。