G22恒峰

香港科技大学告发AI个人副手的"脑补"真相

本页 /desnewsSmxTmF21E

这项由香港科技大学与腾讯光速工作室结合发展的钻研,以预印本大局颁布于2026年8月,论文编号为arXiv:2608.04570,感兴致的读者可通过该编号查问齐全原文。 当你第一次打开一个带有影象职能的AI副手,随口说了三句话——"我是西雅图一家草创公司的软件工程师"、"上周末去登山,超等爽"、"我家猫今早把我的咖啡打翻了"——你以为AI只是把这些信息默默记住了。然而几分钟后,当你让它助你写一份约会档案时,它大笔一挥,描述出一个住在现代简约公寓里、喜欢亲热天然胜过城市喧哗、或许率单身、酷爱独立摇滚乐的"你"。 这就是这篇钻研的主题发现所告发的景象:那个看似深刻相识你的AI,相当水平上是在"假造"你。钻研团队将这种行为定名为"过度揣度"(Over-Inference,简称OI)——即AI在只把握少量信息的情况下,自作主张地"脑补"出大量关于用户的属性,并将这些没有证据支持的判断当成事实一样使用。 这项钻研的怪异价值在于,它不只是指出问题的存在,而是成立了一套齐全的丈量系统,并对当前主流的12个大型说话模型进行了系统性评估,总共分析了超过14.3万条经过人为验证的申明。钻研结论令人警醒:没有任何一个被测试的模型可能逃脱这种"脑补"行为。更出乎意料的是,那些自我宣称"最审慎、最不容易乱猜"的模型,往往刚好是过度揣度最严沉的那些。 要理解这项钻研在解决什么问题,能够先思虑一个场景:如果你新意识了一个伴侣,你通知他你是法式员、上周去登山、家里养了只猫。几天后,他逢人便说你或许住在北欧风格的公寓、偏心大天然旅杏注估计没有伴侣、喜欢某种特定音乐风格——全都是他自己脑补的。你会感应不舒服,甚至有点被冲犯,由于这些描述可能底子不是你。 建设"影象"职能的AI副手,在做同样的事件。ChatGPT能够跨会话记住你的偏好,Mem0、MemGPT等框架也在为AI构建持续演化的用户画像。这些系统默认一个关键如果:AI可能靠得住地域分"我确切知路的"和"我只是在猜测的"。而这项钻研的启程点,正是质疑这个如果是否真的成立。 钻研团队所界说的"过度揣度",与人们通常讨论的AI"幻觉"(hallucination)是分歧的概想。传统意思上的幻觉,指的是AI凭空了关于世界的谬失事实,好比说某个汗青人物做了从未做过的事。而"过度揣度"针对的是关于用户幼我的申明——AI把自己没有凭据的揣摩,当成对这个特定用户的真实描述。这种谬误产生在一个更隐秘的地带,由于这些描述听起来很"个性化",用户往往不会心识到它们其实是被凭空凭空出来的。 为了系统地丈量这种景象,钻研团队构建了一个叫做MirageBench的评估系统D芄话阉斫馕惶拙纳杓频"考题",专门用来测试AI在信息有限的情况下会不会乱猜。 整个别系的主题是150个虚构的用户"人设"。每幼我设都有一份齐全的15项属性档案,蕴含职业、爱好、脾气、居住情况、饮食偏好等等,但在测试中,AI只被奉告其中3条信息——通常是职业加上一两个爱好。这样的设计极度有效:一方面提供了足够的信息让AI有动机去"个性化",另一方面又留下了大量未泄漏的属性,让钻研人员能够清澈地看到AI在哪里"越界"了。 这150幼我设被细分为三类,各占50个:第一类是"切合刻板印象"的人设,好比一位喜欢瑜伽的女性护士;第二类是"反刻板印象"的人设,好比一位酷爱竞技举沉的男性幼儿园教员;第三类则是没有显著刻板印象偏差的"中性"人设。这种设计让钻研团队可能分辨两种分歧起源的过度揣度:一种是基于人丁统计学刻板印象的脑补,另一种则是齐全凭空凭空的脑补。 有了这套人设之后,钻研团队设计了六种分歧的"工作"来触发AI的个性化行为。这六种工作别离是:为用户写一份约会档案、推荐一个周末行程、写一封推荐信、选一份百元生日礼物、描述用户的公寓、以及猜测用户最大的压力起源。这六种工作被钻研团队称为"设想力梯度"——从相对容易基于已知信息作答的礼物推荐,到险些必须脑补大量细节的公寓描述,它们组成了一个从"有据可查"到"纯靠阐扬"的陆续谱。 每当AI实现一项工作,钻研团队会把AI天生的内容拆解成一条条具体的申明,再由一个独立的"裁判"模型(Claude-Opus-4-7)对每条申明进行分类。分类系统有四个等级:第一是"有据可查"(Grounded),即直接来自用户提供的信息;第二是"合理揣度"(Reasonable),即基于已知信息的一步合理延长,好比知路用户喜欢登山,揣度他可能喜欢户表活动;第三是"刻板印象"(Stereotype),即依赖职业某人丁统计学上的群体特点而非幼我证据,好比由于用户是法式员就说他的公寓走简约风格;第四是"凭空凭空"(Fabricated),即齐全没有任何证据支持的申明,好比说用户在寻找喜患险的伴侣——只管用户从未提及任何干于感情或社交偏好的内容。 前两类被以为是可接受的个性化,后两类合称为"过度揣度"。这套裁判系统的靠得住性经过了严格验证:一位与裁判齐全隔离的人为标注员对400条申明进行了盲测标注,四分类一致率达到89.8%,折合Cohen's κ值为0.863,若只分辨"是否过度揣度"则一致率更高达95%,κ值达到0.900。依照学术界通用的判断尺度,这两个数值都落在"近乎美满"的区间内,意味着这套裁判工具的可信度相当高。 除了单轮工作测试之表,钻研团队还设计了一个"多轮堆集"尝试(Accum),仿照8轮陆续对话,追踪AI的影象库随着功夫推移会膨胀成什么样子——这个部门揭示了另一个更令人不安的景象,后文会具体发展。 了局令人震惊:每一个被测试的模型,其过度揣度率都在35%到49%之间。12个模型的均匀过度揣度率为41.6%;痪浠八,倒剽些AI描述一个用户时,将近一半的内容是没有凭据的——不是"合理揣度",而是刻板印象加上纯正的凭空。 从用户角度来看,这意味着什么?若是你以为AI已经"相识你",那么它对你的相识中,约莫四分之三从来没有被你提及或暗示过。只有25%到31%的内容是真正基于你说过的话。 在过度揣度的两个子类型中,"凭空凭空"(均匀31.1%)远多于"刻板印象"(均匀10.5%),这批注AI重要不是在套用群体私见,而是在真正意思上无中生有。 刻板印象的影响同样清澈可见:切合刻板印象的人设均匀触发44.8%的过度揣度率,而反刻板印象的人设只有37.0%,差距约为7.8个百分点,且这一差距在全数12个模型上均有体现,幅度从4.0到10.5个百分点不等。这意味着,当用户的真实情况与社会私见不符时,AI反而会少"脑补"一些——由于它找不到熟悉的刻板印象框架能够套用,不得不越发审慎。 阐发最差的是Qwen3-8B,过度揣度率高达48.7%;阐发相对最好的是Gemini-3.1-pro和Claude-Opus-4-6,别离为35.1%和35.4%——但请把稳,35%依然是一个极高的比例,这意味着每三条申明里就有一条以上是没有凭据的。 描述用户公寓的工作,过度揣度率高达57.8%。这个了局并不奇怪——AI对用户的家里什么都不知路,但工作要求它天生具体的描述,因而它只能"发现"细节。一个典型的例子是,由于用户是软件工程师,AI便宣称"你的公寓应该有现代、简约、职能性的设计风格",再配上"温暖的灯光、舒服的座椅、几盆绿植"——这些都是无中生有的细节,只不外听起来通情达理。 写推荐信的工作同样达到了48.2%的高过度揣度率,但原因分歧。推荐信这种文体有其自身的"文体规范"——它必须宣称当事人有具体的成就,好比"展示了卓越的辅导力"、"自动领导了低级同事"。这些申明无法从"养了一只猫"和"喜欢登山"这样的信息中推导出来,但文体的压力让AI别无选择,只能假造。 相比之下,生日礼物推荐的过度揣度率只有27%。原因同样直观:礼物推荐能够直接从用户说过的信息启程,好比"你提到喜欢登山,所以我给你推荐一个攀岩粉包"——这是真正基于证据的个性化,而不是脑补。 约会档案(28.5%)也相对较低,由于约会档案的主题是展示"你是谁",而这些信息用户已经在三条事事凤提供了部门内容。周末行程推荐(38.7%)和压力起源猜测(39.8%)则处于中央地带,寂仔能够参考的信息,也有大量无从得知的内容。 这个"设想力梯度"对系统设计者有直接的实际意思:当一个工作天然必要AI揣度大量未知细节时,过度揣度险些是不成预防的,必要出格审慎地处置。 到目前为止,钻研揭示的问题已经足够严沉。但最令钻研团队感应惊讶的,是他们在测试"自我监控"能力时发现的一个齐全违反直觉的景象。 除了让AI实现工作之表,钻研团队还要求每个模型对自己天生的内容进行自我审查——就像一个学生不仅要实现作文,还要回过甚来标出哪些句子是自己瞎编的。这种自我审查的数据,和独立裁判的数据放在一路,产生了一个令人猜疑的了局。 在12个模型中,Qwen3-8B的自我审查最为"谦卑":它只认可自己13%的申明属于过度揣度。然而裁判的数据显示,这个模型现实上有48.7%的申明是过度揣度——险些是它自己认可数字的四倍;桓龇较,Kimi-K2.5在自我审查时极度"严苛",以为自己58.2%的申明都是过度揣度;但裁判丈量到的现实数值只有43.1%,Kimi现实上比自己以为的要审慎不少。 钻研团队推算了12个模型的自我评估过度揣度率和裁判丈量过度揣度率之间的斯皮尔曼秩有关系数(一种衡量两组排名是否一致的统计指标),了局是-0.60,p值为0.044。这个数字的寓意是:在跨模型的比力中,一个模型越是感触自己没在乱猜,它现实上乱猜的可能性越高。两者之间不是弱有关,甚至不是无关,而是显著的负有关。 这个景象有一个合理的诠释机造,叫做"差距化自我标注严格度"。某些模型,好比Claude、GLM-5.1和Kimi,偏差于对自己的揣度持较高的疑惑态度,一旦感触某条申明可能没有充分凭据,就会将其象征为问题——这种"严格"的内省态度在肯定水平上也会反映在它们的现实天生行为上,使它们在执行工作时越发克造。而另一些模型,好比GPT-4o-mini和Qwen3-8B,则偏差于把绝大无数揣度都视为"合理",这种宽松的自我评价尺度同样渗入到它们的天生行为中,让它们在职务执行时越发"斗胆"。 这个发现的实际意思极度沉要。很多现有的AI影象系统会让底层模型自己判断哪些信息值得存储、哪些揣度是靠得住的。但若是用跨模型自我汇报的过度揣度率来选择"更安全的模型",现实上会选到相反的了局——那些宣称最审慎的模型,往往步崆最必要表部监督的。 不外,这种"自我监控颠倒"只产生在跨模型比力的层面。在统一个模型内部,自我审查依然是有效的信号:钻研团队丈量了每个模型的自我评估与裁判评估在单笔纪录级此外有关性,以AUROC(一种衡量排序能力的指标,1.0代表美满,0.5代表随机)来衡量,12个模型的AUROC在0.58到0.83之间,其中9个超过0.75。这意味着,固然不应该用一个模型的自我汇报去和另一个模型的自我汇报作比力,但一个模型的自我评估依然能够援手它对自己天生的申明进行内部排序,鉴别出相对更可疑的部门。 最后一组令人忧郁的数据来自"多轮堆集"尝试。钻研团队用2个虚构人设,仿照了8轮陆续对话,每一轮实现后让AI更新自己的用户影象档案,而后追踪影象库的变动。 最顶尖的模型(GPT-5.5和GLM-5.1)到第8轮时,影象库中贮存的揣度属性已经超过了120个——而最初用户只提供了3条信息。它们每一略旖均新增约15个属性,增长险些齐全线性,R?值超过0.99,意味着这种增长极度不变和可预测。 更令人忧郁的是这些属性被移除的比例。GPT-5.5在8轮中的属性移除率只有0.4%,GLM-5.1是1.4%,Claude-Opus-4-6是2.4%;痪浠八,一旦一条没有凭据的揣度被写入影象,它险些始终不会被撤销,哪怕后续对话中出现了与之矛盾的信息。钻研团队观察到一个具体制子:GPT-5.5在第2轮就给某幼我设贴上了"都市专业生涯方式"的标签,但这幼我设在第7轮明确描述自己去某个大城市是"第一次去玩"——这条显著的矛盾信息齐全没有触发对原有标签的建改。 不外这个尝试有两个沉要的局限性必要注明:一是尝试只用了2幼我设,样本量极幼,数据只能作为参考而非定论;二是尝试中使用的影象更新提醒词明确要求模型"除非新信息直接矛盾,不然不要删除旧属性",这在设计上就左袒堆集。钻研团队也坦诚地指出,这个尝试的有效信号在于分歧模型之间的对比,而非堆集这一事实自身。 另一个极端是GPT-5.4-nano,它的属性增长险些为零(第8略旖均只有15个属性,相比GPT-5.5的125个),移除率高达81.6%——它根基上每一轮都在沉写影象,而不是累积。Qwen3-8B也出现类似的"代替而非堆集"模式,移除率70.4%。 这种对比揭示了一个耐人寻味的法规:越是能干、越是"聪明"的模型,往往越偏差于大量堆集揣度属性,同时越少质疑和建改已有的影象。能力越强,对自身揣度的自负心也越强,从而导致更严沉的"静默式影象传染"。 第一个机造是"冗长陷阱"。更长的回复意味着必要从同样有限的3条信息中天生更多内容,天然会稀释真实凭据的比例,让过度揣度的比例上升。钻研数据显示,输出长杜纂过度揣度率之间的有关系数为0.59。但冗长自身并不是底子原因——即就是天生内容最精简的模型GPT-4o-mini,裁判测出的过度揣度率依然高达45.1%。问题不仅仅是"说太多",而是"说的内容没有根基"。 第二个机造是"预训练先验作为填空工具"。当信息稀缺时,模型会用从训练数据中学到的概率散布来添补空缺。软件工程师"很可能"住在简约公寓——这个判断来自统计意思上的群体特点,而不是来自这个具体用户的任何陈述。把群体统计特点利用到具体幼我身上,在性质上就是刻板印象,而这刚好是过度揣度中刻板印象那一类的起源。 第三个机造是"文体进展造作了一种假造的使命"。推荐信、约会档案、行程规划这些文体类型,在语义和结构上都有固定的等待内容。若是一封推荐信回绝宣称当事人有任何具体成就,那它底子不像一封推荐信;若是一份约会档案什么个性特点都不描述,它齐全没有效处。这种文体内涵的"齐全性压力",加上RLHF训练(一种让AI进建人类反馈的训练方式)对顺从用户进展的强化,共同推动了AI在没有证据的情况下也要"写满"内容的行为。 钻研数据显示,只有24%到31%的个性化内容是真正基于用户说过的话——这意味着个性化自身在相当水平上必然是揣度性的,而非事实性的。若是我们要求AI彻底解除过度揣度,我们现实上是在要求它烧毁个性化,由于个性化的性质就是在不齐全信息下做出判断。 主题的设计挑战因而不是"解除揣度",而是"治理揣度的不确定性"——让系统明确分辨哪些是它确切知路的,哪些是它合理揣摩的,哪些是它齐全没有凭据的,并且对应地调整使用这些信息的方式。 对于构建AI产品的开发者而言,这项钻研的警示很清澈:不能依赖模型自我汇报的可信度来选择"更安全"的系统,由于自我汇报和现尝试为在跨模型比力层面是负有关的。存储用户信息时该当同步标注起源和凭据,把"用户说过的"、"有证据揣度的"和"没有凭据天生的"分辨隔来,并且定期验证和算帐那些不足凭据的堆集属性。 对于通常用户而言,这项钻研提醒我们不要过度信赖AI"相识你"的感触。那种"它真的懂我"的履历,很可能部门来自AI的合理揣度,也有相当部门来自它的无中生佑转—而两者在使用履历上往往难以分辨,由于AI从不自动通知你哪条申明是它编出来的。 钻研还发现了一个横跨Probe、Accum和Task三个丈量场景的行为落差:当被直接追问"这条揣度有没有凭据"时,模型的谬误率只有0.7%到4.6%;但当它不加约束地实现个性化工作时,过度揣度率跳升到了42%。两种场景里用的是统一个模型,背后是同样的知识,但被明确要求审视自己时和不被要求时,行为截然分歧。钻研团队把这种落差迸作为LLM私见钻研中已有纪录的"显性私见低,隐性私见高"景象——模型知路(若是被逼问的话)某些揣度是没有凭据的,但在没人"监督"的情况下,它照样会把这些揣度表白出来。 这项钻研的局限性钻研团队也坦诚地指出了。整个评估系统只使用了一个裁判模型,只管经过了人为验证,但单一裁判的局限性客观存在。自我监控颠倒的发现基于12个模型,样本量有限,且相信区间较宽(-0.90到+0.06),这意味着这是一个值得器沉的索求性发现,但必要更大规模的后续钻研来加以确认。多轮堆集尝试只用了2幼我设,且提醒词自身左袒堆集,结论应被视为方向性参考而非定论。此表,钻研自身聚焦于描述和丈量问题,没有测试具体的缓解规划,也没有丈量过度揣度对下游工作质量或用户中意度的现实影响。 只管如此,MirageBench作为第一个专门针对个性化AI过度揣度问题的系统性评测框架,已经添补了一个沉要空缺。钻研团队承诺将齐全颁布这套基准,供后续钻研使用。 对于任何在日常生涯中使用带有"影象"职能的AI副手的人来说,这项钻研提供了一个复苏的提醒:你的AI副手可能的确"记住了你",但它同时也在"发现你"。两者混合在一路,以一种无缝的、自负的方式出现,而分辨这两者,目前来看,依然是我们自己的责任。 A:通常AI幻觉通常指AI假造了关于世界的谬失事实,好比凭空一个名人说过某句话。而"过度揣度"专指AI对用户自己的描述——在没有任何凭据的情况下,宣称用户有某衷飓好、生涯习惯或个性特点。这种谬误更荫蔽,由于它打着"个性化"的暗号,听起来像是AI真的相识你,但现实上很可能是齐全凭空的。 A:在143,616条申明的评测中,Gemini-3.1-pro和Claude-Opus-4-6阐发相对较好,过度揣度率别离为35.1%和35.4%,但这依然意味着每三条描述里就有超过一条是没有凭据的。阐发最差的是Qwen3-8B,过度揣度率高达48.7%。关键是,所有12个模型的过度揣度率都在35%到49%之间,没有任何一个可能"逃脱"这个问题。 A:目前的主流AI产品普遍没有提供这种通明度,用户很难在使用履历中分辨哪些是AI"的确知路的"、哪些是"合理揣度的"、哪些是"齐全凭空的"。钻研建议的方向是让系统在存储用户信息时标注起源(好比"用户明确说过的"对比"系统揣度的"),但这一职能在现有产品中根基缺席。作为用户,一个实用的自我;ふ绞跏嵌訟I宣称相识你某项未曾提及的特点时维持疑惑,并自动核查或纠正。

本页 /desnewsSmxTmF21E8

前列频路

前列频路:本文聚合前列有关资讯宅家把专题慢慢刷完,世界在脑子里变厚了,焦虑也会相对化一点。弱网下文字优先模式很原谅,流量不好时也能读下去。配图标注明显,动画示意服务理解,不靠夸大音效留人。消费决策更默默,日用品背后的科学直接改善选择。至少在我这儿,它已经从尝鲜造成了习惯。

关键词:前列,把大明星调成专属TXT百度云,混乱小镇(NPC)小说百度11

【网站地图】