计算机科学 > 机器学习
提交日期:2026年8月9日
标题:“作为一个语言模型……”:聊天模板切换LLM自我指涉语态,激活导向技术可复现该现象
作者:Jędrzej Maczan
查看该论文PDF:“As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It,作者 Jędrzej Maczan
摘要:大语言模型(LLM)在被问及与自身相关的问题时,往往会添加诸如“我只是一个AI”之类的免责声明。这类回应中的自我报告被用于有关AI安全或模型自我认知的讨论,但其驱动因素尚不明确。模型是在告诉我们它们自身的情况,还是在描述它们被部署的方式?在本研究中,我们展示了聊天模板就像一个开关——当它存在时,会把这种免责声明语态调高,而把“我感觉”这类体验性语态调低,该现象在8个参数量最高达9B的主流开源instruct模型中均成立。反之,当聊天模板不存在时,免责声明语态被调低,体验性语态被调高。在3个模型的激活中,我们发现了一个可以引导该行为的方向。在模型激活空间中移除该方向会降低免责声明语态,添加该方向则会提高它,而相同维度的随机方向几乎没有影响。我们发现,对于没有聊天模板的instruct模型,在向其添加免责声明方向后,它们也会像模板存在时那样进行免责声明。既然聊天模板控制着LLM的免责声明语态,那么研究模型自我报告或内省的研究人员可能需要控制这一混淆变量。我们的结果表明,存在一个他们可以用来引导这种语态的方向。更广泛地说,我们的工作表明,模型关于自身的表述并非关于其本身的事实。模型所说的内容不仅来自权重,还部分由聊天模板决定,因此模型的自我描述不应被字面理解。
评论:
学科:
机器学习(cs.LG);人工智能(cs.AI);计算与语言(cs.CL)
引用为: arXiv:2609.25021 [cs.LG]
(或 arXiv:2609.25021v1 对应此版本)
https://doi.org/10.48550/arXiv.2609.25021
arXiv通过DataCite发布DOI
提交历史
来自:Jędrzej Maczan [查看电子邮件] [v1] 2026年8月9日 星期日 18:38:58 UTC (139 KB)
全文链接:
获取论文:
当前浏览上下文:
cs.LG
[
|
下一页>
更改浏览分类:
参考文献与引用
加载中……
BibTeX格式引用
加载中……
数据提供方:
书签
书目工具
书目与引用工具
Bibliographic Explorer 开关
Bibliographic Explorer (什么是Explorer?)
Connected Papers 开关
Connected Papers (什么是Connected Papers?)
Litmaps 开关
Litmaps (什么是Litmaps?)
scite.ai Smart Citations 开关
scite.ai Smart Citations (什么是Smart Citations?)
代码、数据与媒体
与本文相关的代码、数据和媒体
alphaXiv 开关
alphaXiv (什么是alphaXiv?)
代码链接 开关
CatalyzeX Code Finder for Papers (什么是CatalyzeX?)
DagsHub 开关
DagsHub (什么是DagsHub?)
GotitPub 开关
Gotit.pub (什么是GotitPub?)
Huggingface 开关
Hugging Face (什么是Huggingface?)
ScienceCast 开关
ScienceCast (什么是ScienceCast?)
演示
演示
Replicate 开关
Replicate (什么是Replicate?)
Hugging Face Spaces 开关
Hugging Face Spaces (什么是Spaces?)
TXYZ.AI 开关
TXYZ.AI (什么是TXYZ.AI?)
相关论文
推荐与搜索工具
Influence Flower 链接
Influence Flower (什么是Influence Flowers?)
CORE Recommender 开关
CORE Recommender (什么是CORE?)
IArxiv 推荐器开关
IArxiv 推荐器 (什么是IArxiv?)
- 作者
- 会议
- 机构
- 主题
关于arXivLabs
arXivLabs:与社区合作者共同开展的实验性项目
arXivLabs 是一个框架,允许合作者在我们网站上开发并分享新的arXiv功能。
个人和组织均认同我们开放、社区、卓越及用户数据隐私的价值观。arXiv 致力于这些价值观,且只与遵循这些价值观的合作伙伴合作。
有能为arXiv社区增值的项目想法?进一步了解arXivLabs。
