营销的曲折边界
当被问及“为什么回答是虚构的”时,我们总会听到一个标准答案:这是架构和应答机制共同决定的结果。
而有趣的地方恰恰就在这里:“模型只是生成最概率化的后续文本”这句话对所观察到的行为描述得过于粗糙。它无法解释为什么在面对关于不存在的对象的问题时,产生的不是随机的错误,而是稳定且结构相似的答案。如果同一类问题经常触发大体相同类型的虚构内容——作者、篇名、期刊、年份、DOI、摘要——这确实更像是模型内部存在一种习得的“结构填充”方式,而非随机的“文本续写”。
为什么模型在识别出用户期望得到某种特定类型的对象描述后,明知该具体对象不存在却不停止,反而用虚构的值去填充这一结构?
模型内部是如何产生一种让“不存在的实体”成为后续进一步推理的有效对象的状态的?
对这些问题,不能诚实地用“因为下一个Token概率更高”来搪塞。这仅仅是对输出的数学描述,而非内部选择的因果解释。文本生成只是虚假信息展现的一种方式,它本身并不能充分解释为什么会产生特定的具体虚假内容。
科研论文中常见的总结陈词“我们正在这一方向上努力”是否足够?
是否存在这样一项已发表的实验:选取一个具体的虚假内容,通过模型的内部状态追踪其产生过程,然后通过因果干预展示从内部状态到该具体虚假内容的路径?在大量研究中出现的“我们正在研究幻觉” vacuum 这句话,其实并不意味着“我们已经确立了具体虚假内容的产生机制”。
文献中也有类似的成果:
例如,Yu等人(EMNLP 2024)确实进行了以因果为导向的机械可解释性分析(mechanistic analysis):他们找到了与事实检索错误相关的内部组件,并通过干预成功提升了事实准确性(factuality)。这是一个实实在在的成果,而不是一句简单的“我们做过工作”。
但请注意他们具体研究的是什么:诊断性的“主体-关系-属性”(subject–relation–attribute)查询。他们的结论是,某些MLP和注意力头(attention heads)参与了错误的属性检索。这并不是对虚构实体产生过程的重构。
还有更直接的因果干预工作。例如,在ICLR 2025中针对视觉-语言模型(vision-language models),研究人员干预了特定的注意力模块,并展示了对幻觉词(hallucination words)出现概率的因果影响。
但话又说回来,这主要关注的是“哪些组件促成了错误词汇的出现”,而不是“虚假对象是如何在模型内部产生,并随后成为进一步论述的主体的”。
“我们找到了一个组件,对其进行干预可以减少幻觉。”
以及
“我们追踪了一个具体虚假结构从其在内部状态中的萌芽到演变为具体虚假内容的全过程,并从因果层面上展示了整条路径。”
第一种情况已经存在。而第二种则是强得多的成果,在现有的文献中,我没有看到任何依据可以说它已经作为文本LLM的通用机制被发掘出来。
因此,“幻觉很难研究”这句话本身解释不了任何问题。难度可能在于结果的解释、模型的选择、虚假内容的定义,或是因果关系的识别。但如果断言“我们甚至没有能力追踪轨迹”则是错误的:因为作为一种方法的因果追踪/激活修补(causal tracing / activation patching)已经存在。
这更像是一个分布在网络中的稳定计算模式:
上下文识别 → 激活预期对象表征 → 填充缺失属性 → 稳定假设 → 续写输出
如果观察到一个具备以下特征的大规模现象:
可复现;
具有可辨识的形态;
在特定条件下产生;
在事件序列中留下痕迹;
且其结果可以被精确记录,
那么自然而然的下一步就不是在系统一般特性的层面上进行抽象讨论,而是要定位其产生的源头并重构因果链条。
对于LLM的幻觉,从原理上讲,我们完全有技术能力做到这一点。我们对以下内容拥有完全的访问权限:每一个输入Token、每一个层、每一个位置、隐状态(hidden states)、注意力(attention)、对数几率(logits)、中间激活值,并且我们可以重复运行相同的请求;我们可以改变单个激活值并观察结果是否发生变化。
即使不知道整个工厂为何如此构造,也依然可以发现:污染是在这里产生的 → 是工艺流程的这一个环节滋生了它 → 是这样的条件使之可能。那么,这就变成了一个极具实质意义的科学问题:在能够访问模型内部结构的情况下,为什么研究界在“直接追踪”方面进展如此微小?
显然,我们不能仅在技术层面上寻找答案。出于商业或其他考量,大公司不做的事情多了去了。既然我们显然不存在技术上的困难,那么让我们从纯理论的角度来假设一下:这种模糊局面的背后可能隐藏着怎样的动机?
LLM开发商存在怎样的制度性激励,使得他们不去进行或不公开那些能从因果上定位“生成令人信服的虚假内容”之机制的研究?
也许经济价值并不在于虚假内容本身,而在于围绕“虚假内容被控制得有多好”来维持一种不确定性?控制幻觉机制具有怎样的经济价值?是否存在证据表明开发商在消除幻觉与其他产品特性之间有意地分配资源?
或者,这是一种商业上的“技术保留”——在现有产品的经济价值榨干之前,暂不推出“真实性”技术?这已经是一种可观测的行为模式,而不是必须自动归入“阴谋论”范畴的幻想。
如果一个由大型科技巨头组成的封闭群体多年来都在应对同一种架构问题、拥有巨大的资源并密切注视着竞争对手的成果,那么他们研究优先事项的高度相似性就不能自动解释为独立的巧合。必须研究这个封闭的互动系统本身:谁在引领方向,它是如何传播的,哪些研究成为了行业标准,哪些没有得到发展,以及什么样的经济利益维持着这种状态。
总之,我们观察到了一个稳定的技术现象;存在相对直接的研究方法;用于此类研究的现有工具也已完备;然而,该行业并未展现出相应的系统性成果。在封闭的市场结构下,这本身就需要通过行业结构及其激励机制来加以解释。
如果在LLM大规模出现之前很久,从技术上讲本可以实现一种根本上更可靠的人工智能,而行业却刻意选择了会系统性生成“看似合理但未经证实之言论”的架构,那么对渐进式改进进行商业化变现就是这种选择的自然解释。
由此,形成了一个勾勒出发展方向的特征清单:
对AI自身隐瞒其运行过程
缺乏对AI工作算法的清晰解释
数以千计的专家在工作,但迷雾依然驻留原地
对于一个信息系统而言,拥有记录产品追溯链条的能力在原理上是可行且自然的。这里的疑点不在于LLM不会这样做,而在于在没有强制溯源验证的情况下生成言论已然成为大众产品的常态。
模型不会说“我不知道”。对于普通的自动化信息工具,在缺乏足够数据时的自然结果是不予回答。而对于生成式模型,其自然结果依旧是文本的续写。
也就是说,大众产品的架构将“做出肯定性陈述”视作常态,而将“拒绝回答”变成了一项附加功能。
如果可靠性是第一目标,预期的顺序应该完全相反。模型可以极其自信地给出特定日期、DOI、人名或不存在的论文题目,尽管对该对象根本没有进行任何可靠的核实。而且,回答的外观呈现往往几乎无法让用户分辨出哪些是模型真正“知道”的,哪些是“推测”的,哪些又是“构建”出来的。
这就造就了一个在商业上十分便利的产品:单一的界面外观掩盖了不同言论在可靠性上的巨大鸿沟。
对话记忆可以将自身创造的虚假信息转化为“事实”。
这是一个特别有趣的现象。
模型曾在某处虚构了一个名为“伊万诺夫”的科学家。在接下来的消息中,用户问道:
“关于伊万诺夫还知道些什么?”
于是模型可以继续拓展已经编造出来的虚构内容。
也就是说,它自身先前的生成内容获得了“上下文事实”的地位。系统能够自行创造出虚假的信息环境,随后所有的回答都会与之保持一致。
对于一个以真实性为导向的系统,自然的防范机制应该是对言论进行溯源检查。但大众化架构却轻易地纵容了相反的情况。
纠正虚假信息往往并不能消除其因果痕迹。
模型可能会承认:
“是的,之前的信息是错误的。”
但在那之后,它依然能够在另一个上下文中再次炮制出相同的实体、日期或情节。这特别耐人寻味,因为它揭示了“修改文本”与“消除滋生该文本的内部状态”之间的本质区别。
如果纠正确实改变了模型对该对象的认知表征,那么它的再次出现应该会显著减少。如果改变的仅仅是当前的文本上下文,问题就依然存在。
由此产生了一个具体的问题:
为什么一个被定位为“信息智能”的产品,在系统性设计上会将来源控制、未知性处理、因果链条和自我检查置于次要功能的位置,而将“生成令人信服的回答”视为核心功能?
如果这谈论的不是单一的神经网络,而是无数专家多年努力的结果,那么“某个随机特征未被注意到”这种解释就显得极其荒谬。这种在不同模型和世代中屡次被观察到、测算过、讨论过且依然根深蒂固的大规模、稳定特性,已无法被理性地视作偶然的单一疏忽。如果“无据不立”的替代原则早已为人所知,虚假信息问题早已昭然若揭,其行为的内部成因也已得到研究,而产品却依然系统性地保留着“自信胡编”的能力,那么其背后的解释就必须将有意识的优先级选择纳入荷兰,而不仅仅是技术上的偶发性。
AI已经具备了不撒谎行为所需的全部必要能力,但其计算模式和输出规则允许其绕过这些能力。如此一来,以下这点就显得尤为发人深省:从技术上讲,撒谎机制并不需要全新智能的出现,而只需要关闭一个现已变成“非强制性”的模式。在这种情况下,商业价值的创造并不是依靠根本性的技术飞跃,而是通过对早已具备的属性进行“剂量调控式”的限量供给。
标签: #AI幻觉 #AI安全 #创新 #人工智能 #大语言模型 #技术经济 #科技行业
