ESC
AI 1 分钟阅读

“作为一个语言模型……”:聊天模板可切换LLM自我指涉语态,激活导向技术可复现该现象

一项arXiv论文发现,聊天模板如同开关:存在时,LLM更倾向输出“我只是一个AI”式免责声明,体验性表达减少;移除后则相反。研究者在3个模型激活空间中找到可引导该语态的方向,并提醒研究模型自我报告者需控制此混淆因素,模型的自我描述不应被字面采信。

来源:Hacker News

计算机科学 > 机器学习

提交日期:2026年8月9日

标题:“作为一个语言模型……”:聊天模板切换LLM自我指涉语态,激活导向技术可复现该现象

作者:Jędrzej Maczan

查看该论文PDF:“As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It,作者 Jędrzej Maczan

查看PDF HTML(实验性)

摘要:大语言模型(LLM)在被问及与自身相关的问题时,往往会添加诸如“我只是一个AI”之类的免责声明。这类回应中的自我报告被用于有关AI安全或模型自我认知的讨论,但其驱动因素尚不明确。模型是在告诉我们它们自身的情况,还是在描述它们被部署的方式?在本研究中,我们展示了聊天模板就像一个开关——当它存在时,会把这种免责声明语态调高,而把“我感觉”这类体验性语态调低,该现象在8个参数量最高达9B的主流开源instruct模型中均成立。反之,当聊天模板不存在时,免责声明语态被调低,体验性语态被调高。在3个模型的激活中,我们发现了一个可以引导该行为的方向。在模型激活空间中移除该方向会降低免责声明语态,添加该方向则会提高它,而相同维度的随机方向几乎没有影响。我们发现,对于没有聊天模板的instruct模型,在向其添加免责声明方向后,它们也会像模板存在时那样进行免责声明。既然聊天模板控制着LLM的免责声明语态,那么研究模型自我报告或内省的研究人员可能需要控制这一混淆变量。我们的结果表明,存在一个他们可以用来引导这种语态的方向。更广泛地说,我们的工作表明,模型关于自身的表述并非关于其本身的事实。模型所说的内容不仅来自权重,还部分由聊天模板决定,因此模型的自我描述不应被字面理解。

评论:

学科:

机器学习(cs.LG);人工智能(cs.AI);计算与语言(cs.CL)

引用为: arXiv:2609.25021 [cs.LG]

(或 arXiv:2609.25021v1 对应此版本)

https://doi.org/10.48550/arXiv.2609.25021

arXiv通过DataCite发布DOI

提交历史

来自:Jędrzej Maczan [查看电子邮件] [v1] 2026年8月9日 星期日 18:38:58 UTC (139 KB)

全文链接:

获取论文:

许可证图标 查看许可证

当前浏览上下文:

cs.LG

[ |
下一页>

最新 | 近期 | 2026-09

更改浏览分类:

cs cs.AI cs.CL

参考文献与引用

加载中……

BibTeX格式引用

加载中……

数据提供方:

书签

BibSonomy图标 Reddit图标

书目工具

书目与引用工具

Bibliographic Explorer 开关

Bibliographic Explorer (什么是Explorer?)

Connected Papers 开关

Connected Papers (什么是Connected Papers?)

Litmaps 开关

Litmaps (什么是Litmaps?)

scite.ai Smart Citations 开关

scite.ai Smart Citations (什么是Smart Citations?)

代码、数据与媒体

与本文相关的代码、数据和媒体

alphaXiv 开关

alphaXiv (什么是alphaXiv?)

代码链接 开关

CatalyzeX Code Finder for Papers (什么是CatalyzeX?)

DagsHub 开关

DagsHub (什么是DagsHub?)

GotitPub 开关

Gotit.pub (什么是GotitPub?)

Huggingface 开关

Hugging Face (什么是Huggingface?)

ScienceCast 开关

ScienceCast (什么是ScienceCast?)

演示

演示

Replicate 开关

Replicate (什么是Replicate?)

Hugging Face Spaces 开关

Hugging Face Spaces (什么是Spaces?)

TXYZ.AI 开关

TXYZ.AI (什么是TXYZ.AI?)

相关论文

推荐与搜索工具

Influence Flower 链接

Influence Flower (什么是Influence Flowers?)

CORE Recommender 开关

CORE Recommender (什么是CORE?)

IArxiv 推荐器开关

IArxiv 推荐器 (什么是IArxiv?)

  • 作者
  • 会议
  • 机构
  • 主题

关于arXivLabs

arXivLabs:与社区合作者共同开展的实验性项目

arXivLabs 是一个框架,允许合作者在我们网站上开发并分享新的arXiv功能。

个人和组织均认同我们开放、社区、卓越及用户数据隐私的价值观。arXiv 致力于这些价值观,且只与遵循这些价值观的合作伙伴合作。

有能为arXiv社区增值的项目想法?进一步了解arXivLabs。

哪些论文作者为认可者? | 禁用MathJax (什么是MathJax?)