当前位置: 首页 » 达芬奇的恶魔 » 正文

断头谷

超越字节的社会野心在“多重闪光”中破灭。对腾讯微信有最终意义吗?_我的网站

风中的女王

一 |     这项由意大利帕多瓦大学计算声学研究中心(Centro di Sonologia Computazionale,CSC)信息工程系主导的研究,于2026年7月以预印本形式发布在arXiv平台,论文编号为arXiv:2607.08526。研究围绕一个极具现实意义的工程问题展开:当AI音乐生成模型越来越强大,我们能否把它从"只能在云端数据中心运行"的笼子里解放出来,让它跑在普通人买得起的硬件上?          你可能从来没有想过,每次让AI给你写一段背景音乐,背后其实要动用服务器机房里价值数万元的显卡,还要依赖一整套庞大的Python程序框架——光是把这套框架启动起来,就需要十几秒甚至更长时间。不聊天,不信摇,不朋友摇,字节打社会突破,落在“多重闪光”上。1月15日下午,Byte Bousing正式推出社交产品“Multi-Flash”,专注于青少年视频社交网络。该产品主要分为三个模块:消息列表、跟踪和世界。消息列表是朋友的对话列表。它可以发送文本、表达、赞美和红包。

二 | 图片和视频是主要功能。研究团队认为,这个问题不是模型本身造成的,而是模型外面那层"重型包装"造成的。他们于是动手拆掉这层包装,写了一个叫做 **aria** 的轻量级运行引擎,并在论文中详细记录了它的工作原理、性能表现,以及一个颇为特别的应用场景——用音乐去"模拟味道"。         ---          一、为什么要把AI音乐搬到你自己的机器上          现在市面上最受欢迎的AI音乐生成服务,比如Suno和Udio,都是"云服务"——你在网页上点一下,请求飞到远方的服务器,服务器算完再把音频传回来。在后续内容发布后,朋友可以在消息列表的顶部收到提示,打开的视频内容将保留72小时。

三 | 这种模式有个天然的短板:你必须联网,必须等待,必须接受服务商的使用条款,而且一旦服务商调整策略或关闭服务,你什么都没有了。         对于音乐人、声音设计师,或者任何想在本地实时生成音效的人来说,这种"每次都得出门借厨房才能做饭"的体验并不理想。世界是一个公共视频区。

四 | 视频内容包括两类:你可能认识的人和你可能关注的人。

五 | 更别说物联网设备、智能音箱、嵌入式艺术装置这类场景——它们根本不可能每次都去请求远端服务器。

六 |          真正让人头疼的并不是模型本身太大太重。值得注意的是,在同一天,除了字节弹跳,公司创始人王新新正式发布了他的新社交产品“厕所mt”和子弹短信。其中,厕所山昨天晚上开始形成势头,罗永浩将亲自出席今晚在国家游泳中心举行的春季新子弹短信会议。以微信和QQ为标志,腾讯在社会领域的巨人地位难以动摇。但不能否认,新的社会产品被赋予了统一的意义,这是对社会巨人的挑战。无论产品形态是不是,都可以直接面对战争。以当前最先进的开源音乐生成模型之一 Stable Audio 3(简称SA3)为例,它的参数量大约在1到12亿之间,远比那些动辄千亿参数的大语言模型小得多。

七 | 麻烦在于它的"官方启动套件"——一整套Python环境、PyTorch深度学习框架、GPU驱动……光是冷启动(从零开始加载模型、生成第一段音乐)就需要11到22秒,还会在8GB显存的显卡上直接内存溢出,连加载都完不成。要定位短视频社交网络,首先需要明确的是,多重闪现主要定位在年轻人关系链中熟人的社交场景中,与颤栗有很强的相关性。换句话说,multi-flash是由Tremble推出的社交产品,而不是字节跳跃公司的独立社交产品。据特雷莫洛总裁张楠介绍,多闪速研发的背景是基于特雷莫洛用户的新的社会需求,“目前还没有很好地满足这些需求”。随着视频社交网络需求的不断增长,Tremble采用了多闪存技术。         帕多瓦大学的研究团队决定从头开始,只用C语言和CUDA(英伟达显卡的编程接口)重写整条生成流水线,去掉一切外部依赖,做成一个可以独立运行的单一程序。这个程序就是aria。同时,DoubleFlash正式上线后,Tremble也正式宣布升级私有消息功能。两种产品相辅相成,在社会领域的战栗有所增加。它大约有7700行代码,除了C语言自带的数学库和线程库,不依赖任何第三方组件。         ---          二、aria到底是怎么工作的          要理解aria,先得了解SA3的工作流程。当你输入一句话,比如"一段轻快的爵士钢琴",SA3会经过三个主要步骤:首先,文本编码器(T5Gemma)把这句话变成机器能理解的数字向量;然后,扩散变换器(DiT)从随机噪声出发,经过八次去噪迭代,在一个压缩的"音频潜空间"里生成音乐的抽象表示;最后,音频自编码器(SAME)把这个抽象表示解码成真实的音频波形。         aria把这三个步骤全都用原生代码重写了一遍,从文本分词器、文本编码器,到扩散变换器里的每一个注意力层、前馈网络,再到最终的音频解码器,全部自己实现。权重文件(也就是模型"学到的知识")直接从磁盘以半精度浮点格式(fp16)映射到内存,不需要任何格式转换。目前,多胜唯一的登陆口也在颤抖。很多用户在经历了多闪之后,都情不自禁地表达出“和而不同、战栗般”的感觉。         在运行效率上,aria采用了几个关键设计。在产品特定模块中,多闪具有“密友”聊天场景、跟踪、世界等主要功能。

八 | 具体来说,它包括视频场景中的特殊效果和贴纸、聊天盒中的自动关联表达包、红色信封视频和其他“萌芽”属性,以及删除公共社交场景和在后续照片中自动设置72小时的视频内容,使其成为自己可见的隐私。显卡端(GPU)的每步去噪循环被"捕获"成一张计算图,之后每次运行都直接"重放"这张图,省去了重复组装计算任务的开销——类似于录好一段广播后反复播放,而不是每次都重新录制。多闪速聚合在亲密的友谊中,用户对话可以通过小视频直接进行。

九 | 音频解码器采用了"窗口化解码"策略,每次只处理一小段音频,把内存占用控制在一个固定上限内,无论要生成多长的音频都不会撑爆内存。CPU端的计算经过多线程并行化和向量指令优化,充分利用现代处理器的计算能力。         此外,aria还提供了一个常驻批处理模式和HTTP服务器模式。

十 | 在这种模式下,模型在内存里始终保持加载状态,每个新请求过来直接生成,不需要重新加载模型。

十一 | 在设计级别,多闪光灯对话框中最突出的按钮是摄像机。正式来说,这个设计是希望用户在对话中使用更多的视频进行交流。

十二 | 同时,该产品还提供了一个开放的社会场景“世界”。

十三 | 这就好比餐厅厨师一直在厨房待命,而不是每次有客人才从家里赶来——吞吐量因此翻了一番(每个任务从0.60秒降到1.23秒)。

十四 | 很容易理解加倍强调年轻和亲密的情况。

十五 |          ---          三、和官方版本比,快在哪里          研究团队在一块RTX 3070显卡(8GB显存)和一台纯CPU机器上,对aria和官方SA3 PyTorch实现做了系统对比,分三种场景分别计时。

十六 |          "热启动"场景是模型已经在内存里,直接生成一段10秒音频。徐芦兰,1993年出生。这里两者速度相当,aria略有优势:小模型用0.13秒,中等模型用0.37秒,分别比官方的0.146秒和0.443秒快一点点。这说明一旦框架开销被去掉,两者的实际计算量是差不多的。         "调用"场景模拟从命令行一次性调用,需要额外支付文本编码和权重上传到显卡的时间,aria分别需要1.23秒(小模型)和2.55秒(中等模型)。

十七 | 多闪团队的成员都是90后,另外,许鲁然是多闪的第一位产品经理。         "冷启动"场景是从零开始:启动进程、加载权重、生成音频,aria分别需要1.6秒和2.9秒,而官方实现需要11.58秒和22.23秒。这个差距大约是7到7.7倍,原因就在于Python解释器启动、PyTorch框架初始化、CUDA上下文建立这些"前置工作"在aria里根本不存在。据介绍,该产品于2018年正式推出,“尊重亲密”,徐鲁兰表示,这是该社交产品的起源。为此,doubleflash没有设计公开表扬、评论等功能。

十八 |          显存占用方面,aria也更节省:小模型1395 MB对比官方的2330 MB,中等模型4215 MB对比5948 MB,大约节省了40%到29%。官方实现的中等模型在加载过程中甚至短暂需要约7.1 GB显存,在8 GB显卡上会溢出,不得不使用低内存加载路径。         纯CPU模式下,aria用20线程跑10秒小模型音频需要2.5秒,中等模型需要9.8秒,大约是实时速度的4倍(生成1秒音频需要0.25秒时间)。官方的CPU社区版本在同类硬件上据报道约需11秒每次生成,而且仍然依赖PyTorch。         在长音频场景(60秒)下,情况更有趣。中等模型上,aria以1.28秒完成单次去噪步骤,官方的1.38秒;开启8位整数算术模式后,aria进一步降到1.12秒。朋友圈的赞扬和评论将由私人信托直接发给我。

十九 | 2019年微信社交产品嘉年华的底线昨晚正式开始。小模型上,由于自注意力计算比例更高,官方的融合注意力内核略占优势(0.38秒对0.52秒),这是aria目前唯一明确落后的场景,研究团队也在论文末尾指出这是下一步要解决的问题。无论互联网从业者与否,同日发布的三款新社交产品的盛大活动都是旁观者。         ---          四、精度可以降,但降多少才合适          现在来聊一个核心工程问题:AI模型里的权重(可以理解为模型"记忆"的内容)通常用32位或16位浮点数存储,就像用小数点后很多位来精确记录每个数值。如果我们允许精度降低,用更少的位数来存储,比如8位整数或4位整数,文件就会变小,内存占用就会降低,甚至计算速度也可能加快。但问题是:精度降低了,生成出来的音乐还好不好听?          研究团队把这个问题当作一个需要实测的部署维度,而不是拍脑袋假设一个可接受的精度损失上限。除了flash,王鑫的匿名社交产品“toilemt”今天上午在深圳正式推出。春季新子弹短信息会议也将于今晚7:30在国家游泳中心举行。他们设计了三项独立的质量评估指标。罗永浩本人将担任主旨演讲人。同时推出三款新的社会产品,挑战了腾讯垄断下的社会地位。

| 一个微信友谊圈的截图显示,马化腾15日凌晨2:57转发了《企业微信:连接好的那部分》一文,说“发展正在逐步到位,模块正在变得更加成熟,现场需要推动产品研发,今年要努力”。第一项是提示词吻合度,用CLAP模型(一个专门做文本和音频相互理解的模型)衡量生成音频和输入文字描述的匹配程度。然而,今天下午2:30正式举行了多闪会议,就在几分钟前,朋友圈里有多闪个人名片二维码共享。第二项是分布质量,用弗雷歇音频距离(FAD)来衡量不同精度生成的音频在统计特征上与fp16基准版本有多大差异,FAD越小说明两者越像。

| 但几分钟后,云搜索发现二维码被微信屏蔽。此外,以字节跳跃为重点的登陆页面的下载链接不能通过微信直接打开,需要登录浏览器。第三项是味觉保真度,用一个叫wav2taste的专门模型来检测音频携带的味觉关联特征,后面会详细解释这个维度。这与14日晚王鑫的社交产品“马桶山”的结果相似。         为了给这三项指标一个"合理误差范围",研究团队做了一件聪明的事:用同样的fp16模型、同样的提示词,但换不同的随机种子重新生成一批音频,测量这三项指标在"仅换随机种子"情况下的变化幅度。这个变化幅度就成了"噪声基准线"——如果某种精度引入的变化小于这个基准线,就说明它造成的影响还不如换一次随机种子大,可以认为是无损的。当晚9点,王新发发微博问:“我不知道你害怕什么?”但腾讯没有回应。

|          测试结果在论文中以表格和散点图呈现。8位权重存储(q8)和8位权重加8位激活值计算(W8A8)在所有三项指标上都落在噪声基准线以内。换句话说,把模型从16位压缩到8位,质量损失小到在统计上无法与正常的随机波动区分开来。与此同时,GPU显存占用下降约21%,树莓派5的内存使用从1198 MB降到836 MB。多闪速产品发布网站,由于微博中的分享被封锁,多闪速应用需要使用网页进行下载。更妙的是,W8A8模式(利用显卡上专门的8位整数计算单元)不仅不牺牲质量,反而是所有模式里最快的GPU模式,10秒音频只需0.10秒的热启动时间,比fp16的0.13秒还快。

| 但是,微聊中的网站仍然被阻止,必须通过自链接到浏览器进行下载。         4位精度(q4)就不一样了。发射场有人对此事耳语。今天的首席执行官陈林,在事件发生后直接高呼和推特:我们不是竞争对手,我们希望停止阻止。

| 10月,社会产品赛马马马华腾也是一名弯腰的幸存者。它在提示词吻合度上偏差达到基准线的5倍,在分布质量和味觉特征上也明显超出基准线。他曾经问,“在未来十年,什么样的基本科学突破将影响互联网技术产业?”工业互联网和消费互联网的融合创新将带来什么变化?在11月初举行的腾讯2018年全球伙伴关系大会上,腾讯正式宣布将扎根消费互联网,拥抱工业互联网。这意味着4位量化确实会带来可感知的质量损失。但研究团队并不是因此就否定4位量化,而是指出它的价值在于"能用"而非"无损"。正是得益于4位压缩,拥有12亿参数的中等模型可以在只有8GB内存的树莓派5上运行,峰值内存约900 MB。在今天跳动着社会心的社会棺材上,也开展了强有力的新社会产品宣传。如果没有量化,光是加载模型就会溢出。上周,陈林,今天的首席执行官,提出了中国社交网络的最后一个问题,他的问题和答案是:中国的社交网络行业结束了吗?未来社会部门可能会有哪些发展和创新?据信,标题社交产品将很快推出。腾讯已经成为头条对社交产品的最大期望。早些时候,今天的头条被披露,它已经秘密购买了三个域名,包括feiliao.com、f15.com和flipchat.com,并在今年年底推出了一个名为flying chat的社交产品。据报道,该产品已关闭很长时间,未来将独立上市。在今天下午的产品发布之前,投票者赞助商还将讨论即将推出的轰动一时的社交产品。此外,被称为“应用程序工厂”的标题还说,“没有人知道标题里有多少产品在生产。”因此,它的社交产品在正式发布之前受到了广泛关注。但是,“没什么惊喜。”这是大多数人对多闪的客观评价。         研究团队还特别强调了一个重要设计决策:当模型权重被压缩成低精度版本后,原来的高精度版本会被立即释放掉。徐鲁然介绍说,大多数人的朋友圈、陌生人圈和熟人圈都是混在一起的。这意味着低精度不是在原有内存上额外叠加,而是真正替代了原有内存,是内存的"瘦身"而非"加负担"。加倍希望用户可以自由地分享他们的生活,并在没有压力的情况下成为自己。         ---          五、在音乐里"注入"一个指令:激活引导          aria的另一个独特能力,来自它"拥有"整个计算过程的所有中间数据。

| 陈林在社交场合对腾讯大喊:“打一个鸡蛋,打一块石头”,而现在的“打一个字节”已经没有勇气了。(多闪产品负责人徐鲁然,字节弹跳图片)张小龙在广州举行的微信开放课程专业版活动上发表演讲。据他介绍,今年8月,微信每天登陆人数超过10亿。通常,当你想改变AI模型生成内容的风格,你需要重新训练模型,或者至少微调一部分参数——这就像想让厨师做一道新菜,得把他送去重新培训。”这是一个巨大的里程碑。但aria提供了一种更轻便的方式:激活引导(Activation Steering)。中国互联网上还没有一款应用程序做到这一点。”2018年,在子弹短信的月份内,超过700万注册用户注册,一周内收到两轮融资。         扩散变换器里有很多层,每一层都会产生一组数字(叫做激活值或残差流),这些数字携带了当前生成状态的信息。研究人员发现,某些语义属性(比如"明亮"、"悲伤"、"甜蜜")在这些数字里往往有一个固定的"方向"——就像在一个多维空间里,"甜"这个概念对应一个特定的指向。

| 初创企业在社会领域掀起了波澜。

| 如果在生成过程中,沿着这个方向轻轻推一下激活值,生成的音乐就会向"更甜"的方向偏移。然而,此后子弹短信的衰落也为人们理性思考这一领域未来发展的机遇提供了一个舞台。”苦味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味味然而,当微信建立了一个强大的生态系统时,挑战者需要攀登的悬崖再次变得困难起来。

| 最好把多重闪光行为定义为“生存曲线”。         aria的GPU计算图在捕获之前就把这个"推一下"的操作纳入其中。随着5G时代的到来,短视频有可能进一步爆炸。

| 每步去噪时,程序读取一个强度值,如果强度为零,输出和没有引导时完全一致(比特级别的完全相同);如果强度不为零,就沿着预先载入的方向向量施加一个推力。在字节跳跃方面,主流社会产品起源于3G时代,仍然以图形和文本作为信息的主要载体。

| 整个操作在显卡上是图的一部分,不需要重新编译,没有额外开销。随着5G时代的到来,视频将成为一种新的主流信息载体,社会产业将迎来新的变化。         这种设计让研究团队得以用一个有趣的应用场景来测试激活引导的效果:音乐与味觉的跨感官关联,也就是"声音调味"(Sonic Seasoning)。         ---          六、音乐能有"味道"吗          这个方向听起来有些奇特,但背后有一套严肃的心理学研究。

| 多位研究者(包括英国牛津大学的感官科学家查尔斯·斯彭斯)发现,人类在听到不同特征的音乐时,会产生不同的味觉联想。高音调、协和、流畅的旋律倾向于让人联想到甜味;低沉、不协和、缓慢的音乐则让人联想到苦味;明亮、快节奏的音乐与酸味相关;还有咸味和辣味对应的声音特征。这些关联在不同文化背景的人群中相当稳定,甚至有实验表明,特定背景音乐真的能改变品酒者对葡萄酒口感的评价。”视频对于拥有丰富社会资产的人来说是最好的方式。

|          研究团队以这五种基本味觉(甜、酸、苦、咸、辣)作为目标,尝试用激活引导让SA3生成带有特定味觉联想的音乐。         方向向量的计算方法是"均值差异法":找一批听起来像某种味道的音乐,找一批听起来不像的,计算两组音频在模型某一层激活值上的平均向量差,归一化后就得到方向向量。

| 研究团队实际上准备了两种来源的对比集:一种是靠文本提示词(比如"甜美的音乐"对比"音乐"),另一种是靠一个包含377首真实音乐片段、每首都有人工味觉评分的数据集,让人们评价每首音乐让他们想到哪种味道,然后取评分最高和最低的若干首作为对比。         测试发现,基于真实音频的对比集生成的方向向量更稳定、更单调,在提高引导强度时不容易"过头"。基于文本提示的方向向量则容易出现"到了一个强度后就开始走下坡路"的非单调现象,可靠性更低。

| ”vlog视频社交产品的创始人何旭告诉云搜索。然而,到目前为止,媒体已经陆续曝光,如聊天、握手等头条新闻都是社交产品,在正式推出之前,还不能完全排除腾讯在社交领域的头条新闻的破灭野心。此前,有各种迹象表明,双方展开了多轮正面对抗。其中,陈林在头条活力大会上正式宣布了今天头条应用的具体进展情况,并表示,包括头条店、猫眼电影、小米购物中心和58名城市生活助理已上线,开通了包括文章详情页面、微头条、小视频在内的8个应用流量门户。

| S、搜索、账户主页、个人中心、钱包和信息流广告空间。更重要的是,在未来,其他的头条产品,如特雷莫洛将推出小节目。于是最终实验以音频侧方向向量为主。

|          ---          七、评测陷阱与多重验证机制          这里有一个微妙的陷阱,研究团队花了很大篇幅来讨论并设法规避。他们用来优化引导方向的指标是wav2taste,一个专门预测音频味觉分数的学习模型。但如果用同一个指标来评价引导是否成功,就存在循环论证的风险:引导强度越大,wav2taste分数越高,于是就报告"我们成功了"——但实际上高分可能仅仅是因为音频被扭曲成了模型不擅长处理的奇怪声音,wav2taste在这种分布外的音频上给出了错误的高分。

|          为了避免这个问题,研究团队引入了三个独立的"质检员",它们都没有参与过方向向量的训练。第一个是CLAP文本-音频相似度,检测生成音频是否真的在语义上更接近"某某味道的音乐"这样的文字描述。第二个是FAD,检测生成音频的整体分布是否已经离正常音乐太远(如果音频已经退化成噪声,FAD会急剧升高)。第三个是音频漂移,检测加了引导之后音频与基准版本在语义嵌入空间里的距离,衡量变化幅度是否合理。

|          所有音频在评测前都被归一化到同一响度(-14 LUFS),确保没有任何指标因为音量变化而被蒙混过关。         研究团队在论文的图2中展示了一个典型的"退化示范":以酸味(SOUR)轴为例,把引导强度从0慢慢提高到1.0。在强度较低时(约0.1),wav2taste分数上升,CLAP相似度也上升,FAD保持在合理范围内——这说明是真实的语义偏移。但在强度超过0.1之后,wav2taste继续爬高,而CLAP相似度开始下滑变负,FAD急剧飙升到1000以上——音频已经退化成了噪声状的东西,但wav2taste反而给出了更高的"酸味分数",正是因为它在这种失真音频上失去了判断能力。这个图清楚地展示了"单靠优化目标指标"的危险性,以及为什么独立质检是必要的。         ---          八、实验结果:哪些味道真的可以调          研究团队把所有结论整理在论文的表三中。关键发现是:在严格的多重验证条件下,甜味、酸味、苦味这三个轴可以在小的引导强度下实现真实的语义偏移,而咸味和辣味的效果即使在"干净"区间内也很微弱,CLAP分数几乎不动,研究团队坦诚地将后两者列为负面结果。         甜味(SWEET)最稳定。在小模型的第16层注入,强度0.3时,wav2taste分数偏移+0.119,CLAP相似度偏移+2.11,FAD维持在515(相比基准),属于有意义的真实控制。更大的中等模型在甜味上表现更好,在强度0.15时就能达到wav2taste +0.143,CLAP正值,FAD更低,"干净窗口"也更宽。

| 这说明模型规模越大,激活引导的可控性越好。

|          酸味(SOUR)在强度0.1时效果最强(wav2taste +0.419),但窗口极窄——强度一旦超过0.1,CLAP就变负,FAD爆升。苦味(BITTER)类似,在0.1时有效,0.15时就退化。         研究团队还测试了不同的注入操作。

| 除了"加法"(直接把方向向量加到激活值上),还测试了"投影放大"(放大激活值中已经存在的该方向分量)。对于酸味,投影放大在同等味觉偏移量下比加法产生更小的FAD,质量更好;而对甜味,由于其方向分量本身太小,投影放大没有效果。这说明不同属性适合不同的操控方式,两种操作是互补的。

|          注入位置也有影响。把引导施加在音频潜空间(SAME编码器的紧凑表示)上,对酸味效果良好,FAD甚至比残差流注入更低;但对甜味效果相反,会导致CLAP变负。

| 在文本条件向量上注入,两个轴都失败,连最小的强度都会导致退化,说明在文本嵌入空间推移会把条件信号推离训练数据分布,而不是增加味觉信息。         注入发生在去噪过程的哪个阶段也有区别。

| 只在后半段(第4到7步)注入,效果与全程注入相当,但质量损失更小;只在前半段(第0到3步)注入,CLAP直接崩塌,因为早期去噪步骤负责建立全局音乐结构,在这里施力会破坏整体骨架。

|          ---          九、和微调方法比怎么样          研究团队还训练了一个对照组:针对每个味觉轴,用相同的对比数据微调一个LoRA适配器(rank=8,800步),让模型通过训练学会"给我生成甜味音乐"。         结果令人意外:LoRA在任何一个轴上都没能找到一个同时让wav2taste上升和CLAP保持正值的操作点。

| 酸味的LoRA在wav2taste上的分数比激活引导更低,而CLAP已经变负;甜味的LoRA在统计上甚至没有显著效果。

| 换更大的适配器(rank=32,训练3倍步数)结果也一样。         代价比较同样明显:LoRA每个味觉轴需要约5分钟训练时间、515万参数、10.4 MB存储空间,而激活引导不需要任何训练,只需存一个4到6 KB的方向向量,在计算图里运行零额外开销,随时可以关掉(强度归零即可)。对于这种词汇描述困难、语义边界模糊的属性,用参数更新的方式反而不如用方向向量来得有效。         ---          十、激活引导在实时流中也能用          因为引导运行在显卡计算图内部,研究团队还测试了"动态调整"的场景:在一段连续生成的12块音频流中,把甜味强度按0→0.5→0的节奏慢慢调上去再调回来。测量结果显示,每块音频的味觉分数与强度安排的斯皮尔曼相关系数为0.78(p=0.003),说明音频确实在跟着强度变化。

| 在回调阶段,分数下降稍微滞后,这是因为后续音频会从前面已生成的内容里继承一些"惯性"。

|          在树莓派5上,开了引导和没开引导的生成时间几乎完全一样(32.9秒对32.8秒),证明这个功能真的是"零额外成本"。         ---          十一、还有哪些事情没做完          研究团队在论文末尾非常坦诚地列出了当前的边界和下一步计划。目前自动评测指标可以给出有限的客观参照,但没有人类聆听测试来证实。研究团队计划开展一项人类听感对比实验,用Bradley-Terry成对比较模型来量化听众对不同引导强度音频的感知偏好,以外部验证自动指标指示的"真实控制"是否真的让人感受到了味觉联想的变化。         在工程层面,小模型的长音频生成速度仍然略逊于官方的融合注意力路径,根源是全注意力的注意力权重分布太分散,现有的带状注意力近似不够准确,下一步计划加入FlashAttention类的融合注意力内核作为可选编译选项。此外,持久化的服务器模式和潜空间流式续生成也在规划中。         ---          说到底,这项研究做了两件在方向上都很有价值的事情。第一件:证明了AI音乐生成模型的"重量"有很大一部分其实来自它外面的框架包装,而不是模型本身。一旦把包装拆掉,用原生代码重写,同样的模型可以在普通人买得起的硬件上以可接受的速度运行,甚至可以在一台树莓派5上完整运行12亿参数的模型。第二件:证明了当你"拥有"整个运行过程的每个中间值时,控制模型生成方向这件事会变得出乎意料地轻便——一个几KB的向量,一行加法,就能把音乐往某个语义方向推,而且不需要重新训练任何东西。         当然,这不是一个"一切都解决了"的故事。味觉控制只对三个轴有效,窗口很窄,人类听感验证还没有做。

| 4位精度让12亿模型跑上了树莓派,但质量损失是真实存在的。这些局限性研究团队自己说得很清楚,并没有过度美化。

| 对于真正想在本地部署开源音乐生成、或者想探索音乐语义控制的开发者和研究者来说,aria和这篇论文提供了一个扎实的出发点。有兴趣深入了解的读者可以通过arXiv编号2607.08526查阅完整论文,代码也已在GitHub上以aria为名开源。         ---          Q&A          Q1:aria运行时比官方SA3 PyTorch快多少,主要快在哪里?          A:aria的冷启动速度是官方实现的7到7.7倍,官方需要11到22秒,aria只需1.6到2.9秒。速度差异主要来自aria去掉了Python解释器启动、PyTorch框架初始化和CUDA上下文建立这些"前置开销",不是因为模型本身计算更快。热启动(模型已在内存中)时两者速度接近,aria略快约10%。         Q2:8位量化会不会影响SA3生成音乐的质量?          A:研究测试显示,8位权重(q8)和8位权重加激活值(W8A8)在提示词吻合度、音频分布质量、味觉特征三项独立指标上,偏差都没有超过换一次随机种子带来的自然波动。

| 可以理解为无损压缩——占用内存减少约20%到40%,GPU上8位算术模式还是最快的运行模式,0.10秒生成10秒音频。

|          Q3:激活引导的"味觉控制"对所有五种味道都有效吗?          A:不是。在多重独立验证条件下,甜味、酸味、苦味三个轴可以在低强度下实现真实的语义偏移,验证通过。咸味和辣味即使在有效区间内,独立语义检测指标(CLAP相似度)几乎不动,效果太弱,研究团队将其列为负面结果。所有轴的控制窗口都很窄,强度稍大就会导致音频退化。

Current article:http://www.yuejinhuapennuochoudengying.cyou/pvkhetk/20260826/832.doc

Published on:05:44:00


 
[ 怀玉公主 ]  [ 轩辕剑之天之痕 ]  [ 怪物岛 ]  [ 舞出我人生 ]  [ 盗墓笔记 ]  [ 爸爸去哪儿 ]

 
 
推荐图文
一虎一席谈
推荐资讯
点击排行
绝命毒师 |  封神榜 |  机器人总动员 |  战争之王 |  海派甜心 |  倒数第二次恋爱 |  那时花开 |  缝纫机乐队 |  铁石心肠
Copyright © 2001-2018 断头谷 Corporation, All Rights Reserved
断头谷--河南省综合性门户网站,致力于为河南企业及网民提供信息化服务!   断头谷地方网站联盟成员   通用网址:断头谷

腐女   死亡笔记   世界第一等   吐槽   快乐男声   大学生了没

女帝