一种新技术利用权重奇异向量构建正交矩阵,将Transformer语言模型内部坐标系统旋转至标准基,在不改变输出和困惑度的前提下揭示隐藏的几何结构。该方法使每个隐藏轴可独立测量和调控,发现了双极振荡器、分层节奏模式和稳态防御机制。这为研究模型推理机制提供了标准化的观测视角,并可能揭示相关性矩阵的低有效秩特征。
背景
大语言模型可解释性研究常面临内部机制不透明的挑战;本工作引入一种数学严谨的变换,将模型轴对齐至可观测的几何结构。
- 来源
- Lobsters
- 发布时间
- 2026年8月30日 04:16
- 评分
- 8.0 / 10