G22恒峰

漯河大学等机构联手攻克"音画协同编纂"难题

这项由漯河大学NJU-LINK团队结合快手技术Kling团队、新加坡国立大学、北京邮电大学、伊利诺伊大学香槟分校以及西安交通大学共同实现的钻研,以预印本大局颁布于2026年7月,论文编号为arXiv:2607.24821v1,归属推算机多媒体领域(cs.MM)。对这项钻研感兴致的读者能够通过上述编号在arXiv平台检索齐全论文。 你有没有遇到过这样的烦恼:想对一段视频做点批改,却发现改了画面之后声音齐全对不上;或者把视坡凤的人物换了个造型,但布景音乐和环境音稀里糊涂地也随着变了 ?这种狼狈,并不只困扰通常用户。即就是当今最先进的AI视频编纂系统,在处置"画面和声音必要协同批改"这件事上,也依然像个左手不知路右手在干什么的厨师——两只手各做各的,却很难保障端出来的菜看起来和尝起来都对。 这项钻研正是对准了这个痛点。钻研团队做了两件事:第一,他们成立了一套名为AVE-Compass的全面测试系统,专门用来衡量AI系统在"音画协同编纂"方面到底有多靠谱;第二,他们提出了一个叫做AVE-Agent的智能编纂副手框架,通过度步规划和自我反思来提升复杂编纂工作的实现质量。 真实世界里的视频,是画面和声音缜密编织在一路的。一幼我在雨中驰骋的视频,不只有画面中的雨滴和驰骋的身影,还有雨声、脚步声、可能的布景音乐,以及或许还有人物措辞的声音。这四类声音各司其职,共同组成了你对这段视频的齐全感触。 当你想用一句话通知AI"助我把晴天的街路改成狂风雨",这个指令背后暗藏着一系列连锁要求:画面要从阳光明媚造成乌云密布、大雨倾盆;对应的声音要从鸟鸣、车声造成雷声和雨声;而若是视坡凤有人在措辞,那段对话和措辞人的声音就不应该被动到;与此同时,原来街路上的其他视觉元素,好比行人、构筑物,也不应该莫名其妙隐没或变形。 这种"批改一处、牵动多处"的关系,在专业术语里叫做"跨模态关联"——也就是画面扭转和声音扭转之间存在的内涵逻辑联系。现有的AI工具险些都是单打独斗的:专门做视频编纂的模型不懂得自动调整声音,专门做音频编纂的模型也不会凭据画面内容来决定若何处置布景音乐。至于若何在扭转某个元素的同时,;ず媚切┎桓帽欢哪谌,这更是一个持久没有被系统性解决的难题。 钻研团队在调研现有的评测基定时发现,大无数视频编纂评测只盯着"画面有没有按要求扭转",对声音的处置险些视而不见;而少数涉及音频评测的系统,又往往只关注音频自身的质量,齐全不论画面和声音是否还在措施一致地共同。这就好比查核一场舞台演出,裁判只看演员有没有背完台词,却从不关切灯光和音乐是否跟上了节拍。 为了添补这个空缺,钻研团队破费大量精力成立了AVE-Compass这套评测系统。这把"尺子"的刻度极度精密,覆盖四个维度,并且用两种互补的方式来量度每个维度。 先说这套系统的"原资料"。钻研团队从多个起源网络了145段精心遴选的源视频,这些视频覆盖了分歧的拍摄场景、视觉风格、画面内容和声音类型,有室内室表、有单镜头多镜头、有真人拍摄也有AI天生。在此基础上,他们设计了196条编纂指令,这些指令覆盖28种细分操作类型,分属四大类别:只改视频画面的指令、只改音频的指令、必要同时扭转视频和音频的结合指令,以及专门针对语音内容的指令。之所以要把"只改视频"和"只改音频"也纳入进来,是由于这两类工作刚好能够用来检验一个系统在做单侧扭转时,会不会随试炱坏另一侧本该维持不变的内容。 每一条指令还被打上了多维度的"难度标签",标注了指标物体是否容易定位、声音场景是否复杂、以及画面和声音之间的关联程杜仔多深。这样一来,钻研者就能知路:某个AI系统是在"单一题"上阐发好,还是真正具备处置复杂场景的能力。 为了让评测越发细粒度,钻研团队还为每条指令天生了2688条能够直接回覆"是"或"否"的具体查抄项。这些查抄项经过了人为审核,确保每一条都精准、可验证,既不沉复也不遗漏关键细节。 在评测方式上,AVE-Compass选取了两条并行的轨路。一条是"主观轨路",由多模态大说话模型(能够理解为一个同时看图、看视频、听音频的AI阅卷官)逐条回覆那些查抄项,并据此给出四个维度的分数。另一条是"客观轨路",用七种自动化指标从技术层面丈量编纂了局的各项属性。这两条轨路各有侧沉,合在一路能力给出全面而不失精准的评估。 那四个评测维度是这套系统的主题设计。第一个维度叫"指令执行度",衡量的是AI有没有真的依照要求实现了编纂作为。第二个维度叫"内容保真度",衡量的是AI在执行编纂时,有没有把本该维持不变的内容也一路改掉。第三个维度叫"真实感",衡量的是编纂后的视频看起来和听起来是否天然合理,有没有出现违背物理法规或视觉违和感的处所。第四个维度叫"编纂意图",这是前两个维度的综合——只有"执行了正确的编纂"且"没有粉碎其他内容",才算真正实现了用户的意图。 七种自动化指标也各有分工。在画面和声音的同步性方面,有两种指标:一种专门检测口型和语音是否对齐,另一种检测声音事务和对应视觉事务之间的功夫差。在视频画面质量方面,有三种指标别离丈量视频的视觉美赣注主体不变性和活动流畅度。在音频质量方面,有一种指标评估整体音频的天然水平,另一种专门评估语音内容的清澈度和天然度。 建好了这把尺子,接下来就是拿来量一量现有AI系统的斤两。钻研团队拔取了五个代表性的系统参加对比测试:视频天生领域的Wan2.7、HappyHorse,以及谷歌的Gemini-Omni、字节跳动的Seedance,还有LTX2(即LTX-Video 2.3 Retake版本)。同时,钻研团队自己提出的AVE-Agent也作为第六个参加者一起接受评测。 考试了局颇为值得回味。在最能反映"真正实现编纂"的"编纂意图"总分上,AVE-Agent以59.8分排名第一,其次是Wan2.7的42.4分和HappyHorse的41.3分,而Gemini-Omni只有38分,Seedance更是只有26.6分,LTX2则垫底,仅有15.2分。值妥贴心的是,满分是100分,也就是说即就是阐发最好的系统,也只答对了不到六成。 第一种失败叫做"懈怠型"——系统直接把原始视频原封不动地还给用户,什么都没改。Gemini-Omni和Seedance都有这个偏差,尤其是在音频方面。Gemini-Omni的音频响应率只有22%,也就是说它在约莫78%的功夫里,底子就没有对音频做任何批改。正由于如此,它的"音频内容保真度"得分高达96.1分——但这个高分是假象,由于你什么都没改,当然保留得无缺无损。 第二种失败叫做"粉碎型"——系统的确执行了编纂,但改的太猛,把本不该改的内容也一路掀翻了。LTX2是这种模式的典型。它在"指令执行度"上总分还不错(70.1分),但"内容保真度"只有可怜的30.6分,这意味着它在执行编纂时,大量粉碎了本该保留的内容。钻研团队用"沉新合成"来描述这种行为——系统不是精密地批改指标区域,而是把整个视频或整段音频推倒沉来,了局原来好好的内容就隐没了。 第三种失败叫做"幻觉型"——系统不仅没实现要求的编纂,还脑洞大开地参与了用户底子没要求的器材。Gemini-Omni在这方面有典型案例:在一段要求扭转碗中食品的视坡凤,它莫名其妙地在画面上增长了一个巨大的字幕;在另一个必要去除火车上乘务员的编纂工作里,它创造出了隐没又出现的布景人物和莫名其妙开着的车门,整个场景充斥了逻辑混乱。 第二个法规是:当编纂工作变得更难时,大无数系统的阐发会急剧下滑,而AVE-Agent下滑的幅度相对较幼。具体来说,当视频时长从三五秒增长到九秒以上,无数基准系统的"编纂意图"分数大幅降落;当音源环境变得复杂(好比寂仔人声又有布景音乐又有环境音),好多系统的音频保真度急剧恶化;而当指令中隐含的"画面改了音频也要对应改"这种跨模态关联越深,大无数系统就越容易漏掉音频端的扭转。 第三个法规是:自动化评分指标和主观判断之间的有关性普遍偏低;痪浠八,一段视频在技术指标上看起来质量不错,但人类评审或AI阅卷官在看过之后,可能感触它很不天然、很不合理。这个发现注明,仅仅用技术指标来衡量视频编纂质量是远远不够的,必须结合对"真实感"和"逻辑合理性"的主观评价。 既然发现了问题地点,钻研团队也提出了自己的解决规划——AVE-Agent。这个系统的主题思路能够用"打算-执行-检验"三个词来概括,整体上像一个经验丰硕的项目经理在指挥一个专业团队实现复杂工作。 AVE-Agent内部蕴含三个相互合作的 ?。第一个叫规划器,掌治理解用户的指令并做好全局规划。规划器会先仔细分析源视频,提取出场景信息、出现的人物和物体、在产生的作为,以及视坡凤蕴含哪些声音。接着,它会鉴别出用户指令中明确说出来的要求,以及那些没有明说但逻辑上必须同步实现的隐含要求。例如,用户说"把那幼我骑自行车的作为改成骑摩托车",规划器不仅会把稳到视觉层面的扭转,还会揣度出:自行车的踩踏声该当改成摩托车引擎声,而视坡凤其他的布景声音应该维持不变。规划器会把所有这些要求拆分成一个个具体的子工作,并标注出它们之间的依赖挨次,形成一张"工作流程图"。每个子工作还会配套一份"验收尺度",通知后续的执行环节:实现到什么水平才算合格。最后,还有一个验证 ?榛岵槌庹帕鞒掏甲陨碛忻挥忻芑蛞怕,若是有问题就触发沉新规划。 第二个 ?榻兄葱衅,掌管把每个子工作真正落实成具体的编纂操作。执行器占有一套工具箱,里面有专门做视频画面编纂的工具、做音频分离的工具、做音频天生的工具,以及处置语音的工具。对于视频编纂子工作,执行器默认使用Wan2.7作为主力工具;对于音频处置,它会吓酌SAM Audio技术把分歧的声音起源分脱离来,再用MMAudio这个视觉前提音频天生系统来创建切合画面内容的新声音;对于语音有关的工作,则挪用专门的语音克隆和口型同步工具。 执行器有一个沉要个性:它不会盲目接受第一次尝试的了局。每实现一个子工作,执行器城市用规划器提供的验收尺度来检验了局。若是检验不通过,它会分析哪里出了问题,针对性地批改操作指令,而后沉新执行,最多尝试三次。整个过程中,系统始终保留迄今为止得分最高的版本,预防越改越糟。 第三个 ?榻凶酆掀拦榔,掌管在所有子工作都实现之后,对组装好的齐全视频做一次整体查抄。单个子工作都通过验收,并不蹬宗组合在一路也没问题——就好比每路菜单独尝起来都能够,但摆上桌之后口味却可能相互矛盾。综合评估器会查抄齐全视频的指令执行情况、内容保真度和整体质量,而后凭据发现的问题类型采取最低成本的建复措施:若是只是音量不合,就只做一次混音调整;若是某个音频子工作的了局有问题,就沉新天生那一步;若是是整体规划层面出了问题,就把反馈传回规划器,触发全局沉新规划。 从测试了局来看,AVE-Agent在"编纂意图"这个最主题的指标上比基础的Wan2.7提高了17.4分,在音频侧的指令执行度上提高了9.1分,在音画同步性上提高了0.073分。消融尝试(也就是逐一去掉某个 ?槔床馐运墓毕祝┫允,若是去掉规划器的提醒词优化职能,"编纂意图"分数降落7.76分;若是去掉执行器的沉试机造,分数降落8.75分。这注明两个 ?槎际遣怀苫蛉钡。 一套评测工具,只有在它自身足够靠得住的情况下,能力真正起到丈量的作用。钻研团队对AVE-Compass自身的可信度也做了当真的验证。 在不变性方面,钻研团队将齐全的评测流程沉复执行了五次,发现自动化指标的分数颠簸幼于0.01,而AI阅卷官给出的分数颠簸幼于1%,注明这套评测系统的了局极度不变,不会由于每次运行的随机性而产生显著差距。 在与人类判断的一致性方面,钻研团队从评测中抽取了一批标题,让人为标注员和AI阅卷官别离作答,而后对比二者的答案。了局显示,在"编纂意图"、"指令执行度"、"内容保真度"和"真实感"四个维度上,AI阅卷官与人类标注员的均匀一致率靠近90%。这意味着这套评测系统根基上能反映人类评审对编纂质量的真实判断,而不是AI在自说自话。 钻研团队还专门分析了各项评测指标之间的有关性,发现主观评估指标和客观技术指标之间的有关性普遍偏弱,而客观技术指标内部之间的有关性有时辰很强。这个发现印证了一个沉要结论:在评测视频编纂质量时,技术指标和主观判断缺一不成,并且它们各自捉拿了分歧侧面的信息,不存在哪个能够齐全包办另一个的情况。 钻研团队还专门测试了各个系统在"只改视频不改音频"和"只改音频不改视频"这两种单一模态编纂场景下的阐发,并额表引入了"音频类似度"和"视频类似度"指标,直接衡量未被编纂的那一侧内容有没有被动手脚。 在只改视频的场景中,AVE-Agent和HappyHorse都能较好地做到"视频按要求改了,音频根基没动",而LTX2的音频类似度只有0.647,注明它在做视频编纂时,音频也被大幅扭转了。在只改音频的场景中,AVE-Agent的视频类似度高达0.999,近乎美满地保留了原始画面,而LTX2的视频类似度只有0.924,注明它在做音频编纂时,视频画面也受到了波及。 钻研团队还做了一个系统性的谬误分类统计,将所有编纂了局依照失败类型划入五个桶:视频内容被粉碎、音频内容被粉碎、视频指令没执杏注音频指令没执行,以及整体真实感较低。AVE-Agent在总谬误数上至少,为175个,而Seedance有314个谬误,LTX2高达406个。更关键的是,AVE-Agent的谬误散布比力平衡,没有哪一种失败模式出格凸起。相比之下,Gemini-Omni的音频指令未执行谬误高达144个,占了它所有谬误的很大一部门;LTX2的视频内容被粉碎谬误高达161个。这种对比清澈地出现了分歧系统各自的"软肋"地点。 说到底,这项钻研揭示的问题比它给出的答案更有价值。当我们试图让AI助我们"改一改这段视频"的时辰,我们现实上是在要求它同时表演摄像师、音效师和导演的角色——不仅要精准执行扭转,还要;ず盟胁桓枚钠鞑,还要保障画面和声音在改完之后依然像一对默契搭档。这件事的难度,远远超出大无数人的直觉预期。 当前最好的系统拿到满分100分的题,最高也只能答到60分左右,并且分歧的系统会在截然分歧的处所犯错——有的过于懈怠,有的过于冒进,有的会无中生有。这注明这个领域目前还处于早期阶段,寂仔清澈的方向感,又有巨大的提升空间。 对通常用户来说,这项钻研意味着未来的视频编纂工具可能会越来越"聪明地克造"——不仅知路该改什么,更知路该保留什么,也知路改了一处之后另一处要随着怎么动。对从事有关领域的钻研者和工程师来说,AVE-Compass提供了一个远比以往更全面的丈量工具,能够用来更正确地诊断自己的系统到底在哪个环节还不够好。 若是你对其中的技术细节或尝试数据感兴致,能够通过arXiv编号2607.24821检索并阅读这篇齐全论文,论文中还蕴含了具体的提醒词模板、评测公式和案例分析,值得深刻研读。 A:通常视频编纂评测通常只关注画面有没有按要求扭转,齐全不论音频的处置情况。AVE-Compass则专门设计来衡量"画面和声音的协同编纂能力",不仅检测编纂是否执行,还检测未编纂的内容有没有被意表粉碎,以及画面和声音在编纂后是否依然维持同步和逻辑一致。这是目前为止覆盖最全面的音画协同编纂评测系统。 A:AVE-Agent的规划器会在起头执行任何操作之前,先成立一份具体的"声音清单",明确列出哪些声音是要被批改的,哪些声音必须维持原样。在音频处置阶段,系统会用声音分离技术把分歧起源的声音拆开处置,预防操作指标声音时影响到其他声音。每实现一步,专门的评估 ?槌鞘胁槌侵副晟粲忻挥惺艿讲,若是有问题就触发建改。 A:刚好相反。Gemini-Omni的高音频保真度分数是一个假象,源于它在约莫78%的情况下底子没有对音频做任何批改。什么都没改,当然保留得无缺无损。钻研团队专门设计了"响应率门控"分析,将不作为的情况单独象征出来,去掉这些不作为的案例后沉新推算,Gemini-Omni的音频保真度就会大幅降落。

关键词:漯河大学等机构联手攻克"音画协同编纂"难题 · 更新于 2026-08-15 23:53:24 · 本页 /desnews/uifv1O2OCn

Here we back!罗马诺:铃木彩艳买卖告吹,巴黎新闻人士已确认

“我们原本计划6年后才走到这一步,结果2年半就完成了。所以我们必须接受这一点,然后继续前进。我们要继续成长,也要继续培养这些年轻球员。今天首发11人里有19岁、20岁、21岁、22岁、23岁球员,基本上90%都是21岁以下球员,下半场又换上了四五名年轻人。到了最后,你必须信任他们。今天你把他们带到这里,我们也为比赛做了准备,接下来当然还会继续准备。但关键在于,他们能否承受来到阿森纳、来到酋长球场、展现自己的情绪压力。有时候这很难,我亲身经历过,我来过这里,和顶级球队一起面对过这种处境,依然会吃苦头。大约一年半前,他们3-0击败皇马时,比赛看起来也很轻松。所以这就是我们今天所处的水平。”

马彩勤20260815 · 9分钟阅读

辛辛那提站开门红!王欣瑜两盘横扫过关,实现WTA1000赛6连败

它的AI短剧产品LibTV是Seedance 2.0首批接入的第三方,提前帮模型做了量产验证。向下游创作者省掉在十几个工具、账号、平台之间来回迁移的成本。

高福侠20260815 · 7分钟阅读

富国银行:开源模型海潮席卷AI圈,微软(MSFT.US)、ServiceNow(NOW.US)将成大赢家

上游:核心硬件与配套系统——计算芯片,在AI服务器中占BOM成本的50%-60%。存储芯片及系统,负责数据的读写与持久存储。此外还包括散热制冷系统(液冷)、供配电系统(柴发、变压器、SST、UPS/HVDC、配电柜等)、光模块、交换机等。

付玲20260815 · 5分钟阅读

22.68万起!魏牌V8X上市:长城智驾好起来了

日前,刘念(化名)向记者反映,其丈夫邢志(化名)今年39岁,在深圳某公司做程序员。2026年4月23日,猝死在厕所内。随后,公司向深圳市人力资源和社会保障局申请工伤认定,却得到了不予认定为工伤的决定。

周翔20260815 · 8分钟阅读

图片报:拜仁拟卖5%股份给维斯曼,套现2.5亿欧

一个演员,为什么在长达半个世纪的职业生涯中,对表演始终如一、毫无倦意,甚至不惜豁出半条命去?为什么他的角色总能留在观众心底?答案,就在“珍惜”二字。

张智峰20260815 · 6分钟阅读

【早报】欧洲之王!巴黎卫冕欧超杯单年夺4冠!

京东在推进服务业务升级的同时也在推进服务人员的培训和升级,京东开展了国内最大规模的蓝领就业培训,涵盖家政保洁师、维修工程师、客服、养车技师等183个一线服务岗位。

高爱贞20260815 · 8分钟阅读

罗马诺:费兰和霍茨都已经到达巴黎,即将接受体检

企业表态、致歉信、重大战略消息,这些与企业自身立场高度绑定的内容,一旦发布,就意味着企业对于产业链、对于社会发起一次思考邀请,甚至需要接受对抗性审视。比如,被Deedy Das指责为AI写作的那篇内容,正是Zomato创始人在关于“零工经济”的社会争论中的回应。

王平20260815 · 8分钟阅读

人为智能“踩大坑”!无人驾驶配送车一路直行:心甘情愿冲进沟槽翻车

北京贝赛思双语学校今年9月也将迎来新校长,新校长为原成都贝赛思的校长Mr. Mark Sylte。Mark Sylte拥有超过25年的教学管理经验,曾任职于多所美国顶尖私立学校和国际学校,作为富布赖特项目学者进行博士研究并荣获“2022年芝加哥大学杰出教育家奖”,还担任过中国贝赛思首席学术官。

丁耕付20260815 · 6分钟阅读

王曦雨辛辛那提站晋级次轮夺正赛首胜

爱范儿/APPSO 独家获悉,Google DeepMind 重组后将把更多资源转向成本更低的 Flash 模型,短期内没有更新 Pro 模型的计划。团队可能裁员三分之一或更多,主要精简以算法岗位招聘、实际却未从事算法工作的冗余人员;Google DeepMind 目前约有 7000 至 8000 名员工。

徐金忠20260815 · 6分钟阅读

谷歌安卓掌管人畅想未来:只有说清想做什么,系统就能替你实现

四篇成果有机贯通,从“高压激发—活性验证—全球意义—资源挖掘”四个维度,完整刻画了地球海洋最深处的微生物活动机制及其资源潜能,揭示了异常繁荣的深渊生态系统在全球物质循环中的潜在枢纽地位。

邱莲莲20260815 · 1分钟阅读

雅思组合明确暗示无意进军文艺圈

在单步生成中,模型倾向于走"最安全"的路——生成一个保守的、变化最小的输出,避免出错。这会导致视频里人物头部几乎一动不动,表情呆滞,完全不像真人说话时的自然状态。

程舟权20260815 · 4分钟阅读

话题度拉满!NBA颁布开幕战+圣诞大战赛程:詹姆斯将战湖人

截至发稿时,马斯克这个帖子在不到一天时间里已收获250万浏览量,评论区有很多到访过中国的网友分享来华真实体验,诸如“我今年第一次去了中国,它让我大开眼界。科技和基础设施非常先进!人们既好奇又非常友好,美食也是一绝。中国和你从新闻里听到的完全不一样”。但评论区中另一些人则继续重复着与中国现实毫不相干的负面论调。一个帖子,两种反应,折射出当下国际舆论场中耐人寻味的现实:对中国的认知正被撕裂成两个世界——亲眼所见的“真实中国”与道听途说的“失真中国”。

张换平20260815 · 7分钟阅读
【网站地图】