E-Ink 新闻日报

返回列表

Transformer语言模型的标准基对齐:每个隐藏轴均可独立测量与控制

一种新技术利用权重奇异向量构建正交矩阵,将Transformer语言模型内部坐标系统旋转至标准基,在不改变输出和困惑度的前提下揭示隐藏的几何结构。该方法使每个隐藏轴可独立测量和调控,发现了双极振荡器、分层节奏模式和稳态防御机制。这为研究模型推理机制提供了标准化的观测视角,并可能揭示相关性矩阵的低有效秩特征。

背景

大语言模型可解释性研究常面临内部机制不透明的挑战;本工作引入一种数学严谨的变换,将模型轴对齐至可观测的几何结构。

来源
Lobsters
发布时间
2026年8月30日 04:16
评分
8.0 / 10