云计算百科
云计算领域专业知识百科平台

AI 日报(2026年9月24日)

今日主题:Meta与谷歌发力端侧与语音,Anthropic探索AI生物发现与工具生态

本期概览:2026年9月24日,AI技术与应用呈现多元化演进态势。硬件与端侧方面,Meta在Connect大会发布首款轻量化VR眼镜与无摄像头智能眼镜,全面接入Muse智能体;谷歌上线Gemini 3.8 Flash TTS可定制语音模型,并在DeepMind推动私密计算与服务端内存融合。行业与前沿科研领域,Anthropic湿实验实验室利用Claude发现CRISPR样新型酶系统,并推出一站式Claude Marketplace聚合插件生态;DeepSeek公布支撑数百万大规模Agent强化学习的弹性计算沙盒DSec。此外,阿里在云栖大会披露Qwen4已进入训练及递归自我改进(RSI)新进展;vLLM于Apple Silicon推出并发推理服务框架vllm-metal,简化本地推理工程化。治理层面,中美双方正就类似冷战热线的AI安全通报机制展开磋商。

本期精选 25 条 · 国内 6 / 国际 19

模型发布

1. 谷歌推出Gemini 3.8 Flash TTS系列语音模型,支持文本定制AI音色与双人对话

Google与DeepMind推出Gemini 3.8 Flash TTS与Flash-Lite TTS两款文本转语音模型,覆盖超过100种语言。新模型支持直接通过自然语言文本描述生成全新人声音色,且允许通过30秒音频样本快速完成声音克隆。此外,模型引入了针对台词的舞台情绪指令解析,能够仅凭单一脚本直接生成多角色自然对话音频。

2. 阿里发布Qwen-Audio-3.1音频模型矩阵,音频API调用价格最高降幅达95%

阿里千问团队推出了涵盖5款模型的Qwen-Audio-3.1音频产品矩阵,覆盖语音识别(ASR)、文本转语音(TTS)与实时双工语音交互场景。新版ASR强化了多语言方言识别与口语冗余词过滤,ASR-Next则引入了带时间戳的多发言人识别与情绪和环境噪声检测。伴随技术升级,阿里将相关AI音频接口价格大幅下调,最高降幅达95%。

3. 云栖大会开幕:Qwen4已进入训练,阿里披露递归自我改进新进展

2026云栖大会在杭州开幕,阿里集中发布通义千问一年进展。阿里巴巴表示,大模型递归自我改进(RSI)已从论文概念进入真实的训练、推理和芯片协同环节;基于新一代架构的Qwen4已进入训练,往后Qwen4.5、Qwen5的参数规模将扩展至5万亿至10万亿。

产品应用

1. Meta发布首款约100克轻量化VR眼镜,原生集成Meta AI智能体操作系统

Meta在Connect大会上发布了首款轻量化VR眼镜Meta VR Glasses,采用机身与独立计算盒分体设计,重量仅约100克。设备搭载高通骁龙Reality Elite芯片与5K Micro-OLED屏幕,首发获得IMAX Enhanced认证,计划2027年春季以1299.99美元上市。操作系统直接集成了Meta AI智能体,全面支持语音、眼球追踪与手势混合控制,摆脱传统手柄。

2. DeepMind公开私密AI计算架构新进展,实现服务端安全持久化记忆

Google Private AI Compute团队公布了其机密计算架构的技术升级,实现了具备端侧隐私保护水准的服务端跨设备AI持久记忆。该技术解决了智能助手既需要跨设备长期上下文记忆又必须严格保护数据资产的工程矛盾。通过隔离计算与端到端安全机制,保障云端模型处理用户私密数据时全程不可泄露与篡改。

3. Anthropic推出Claude Marketplace,集中聚合第三方插件与企业智能体服务

Anthropic正式上线Claude Marketplace,为开发者与企业客户提供集成插件、连接器、现成Agent以及专业集成服务的统一平台。该市场允许客户直接将已签署的云预算(如Snowflake、Vercel等合作伙伴)用于采购Claude生态工具。此举标志着Anthropic正加速构建其以企业级工作流为核心的平台生态壁垒。

4. OpenAI为ChatGPT移动端引入语音智能体工作流支持

OpenAI宣布在ChatGPT移动端全面上线基于语音的智能体控制功能,允许订阅用户直接通过自然语音触发复杂生产力任务。Plus和Pro用户可通过专属标签页以语音指令驱动文档起草、邮件摘要以及跨应用协作,并支持调用云浏览器进行多步操作。普通免费用户也将陆续开放第三方插件与连接应用的语音联动能力。

5. 阿里推出手机智能全栈方案Qwen Intelligence,荣耀Magic9确认首发搭载

阿里巴巴在云栖大会发布针对AI手机的全栈智能体解决方案Qwen Intelligence(QI),涵盖模型底座、执行框架Harness以及任务规划系统。方案首发推出移动规划、跨应用操作和影像创作三套Agent模块,并将首发落地于荣耀Magic9系列与Robot Phone设备。阿里明确不造整机硬件,而是定位于为终端手机厂商提供端云协同的智能体闭环中枢。

6. Meta推出无摄像头智能音频眼镜Ray-Ban Meta Audio并探索独立AI硬件

Meta在Connect 2026大会上推出了首款去除摄像头的智能音频眼镜Ray-Ban Meta Audio,旨在应对大众对穿戴式摄录设备的隐私争议。该设备聚焦播客播放、电话接听、实时翻译,并支持语音唤醒Muse AI助手。此外,扎克伯格在演讲末尾展示了独立硬件形态Muse Charm原型,无需依赖手机即可直连智能体交互。

7. 蚂蚁密算发布企业级可信智能云平台“密算一号”并开启邀测

在云栖大会上,蚂蚁密算发布企业级可信智能云服务平台“密算一号”,正式开启首批定向企业邀测。平台以密态计算为核心,连接大模型、Agent与多方敏感数据,实现数据在“可用不可见”状态下参与跨机构分析与云端推理调用。平台首推治数、问数、用数三大模块,并已在医保核验、信贷风险评估等高合规场景完成试点部署。

8. YouTube更新创作工具与推荐机制:自定义Feed与Gemini辅助编辑

在Made on YouTube年会上,谷歌旗下YouTube展示了多项AI更新规划:用户可通过输入自然语言描述,自动生成自定义推荐分栏的Custom Feeds。创作者工具方面,YouTube Studio新增故事讲述助手,可分析脚本与粗剪并给出节奏、结构和叙事调整建议,创作者可同时对最多三个剪辑版本进行A/B测试;动态缩略图会自动为不同观众展示三张预览图中最合适的一张。同时,Gemini正由聊天式助手扩展为完整的剪辑工具,可重排画面、裁剪片段并与音乐节拍同步。

9. Meta扩展Muse智能体能力:配置专属邮箱并支持电脑操作与视频交互

Meta宣布为其新一代AI智能体Muse进行重要功能升级,为每个Agent分配独立电子邮箱地址,便于其通过邮件收发处理日程与长周期事务。同时,Muse的macOS端应用即将获得操作屏幕和调用底层应用的能力,未来还将支持用户通过视频实时与其虚拟形象进行互动。这显示出Meta正加快将Muse从对话工具升级为自动化跨平台操作者。

研究论文

1. Anthropic宣布Claude在其湿实验生物实验室发现CRISPR样新型酶系统

Anthropic正式公开其生命科学研究团队及自营湿实验实验室,致力于利用Claude在DNA数据中挖掘未知蛋白家族并自动生成实验假设。在科学家的高层指导下,Claude发现了一种具备类似CRISPR特征的新型酶系统。该突破展示了通用AI大模型将生物基础科学发现系统化并大幅提速的实际潜力。

2. DeepSeek公开大规模Agent训练沙盒平台DSec技术细节

DeepSeek创始人梁文锋等130余位研究人员发表最新论文,全面公开了支撑其V3.2至V4.1模型强化学习与评测的弹性沙盒平台DSec。该平台生产单元拥有约160个CPU节点、3万核与250TB内存,单日可调度服务约300万个沙盒,峰值并发达38万个。DSec通过统一SDK支持函数、容器、微虚拟机及完整虚拟机四类后端,解决了长程Agent交互中环境频繁复原与资源挂起的瓶颈。

3. OpenAI联手80位专家推出心理健康对话评测基准MentalHealthBench

OpenAI宣布与80多位持牌心理健康专家合作开发了MentalHealthBench基准,用于开源评估大模型在真实心理健康交互中的回答质量。该基准着重考量模型在面对高压力、人际困扰或情感求助时的事实准确性、判断边界与同理心表达。此举为全球海量用户依赖AI倾诉的现实场景提供了量化的安全与健康对齐规范。

4. Flash-dLLM:面向扩散大语言模型的高效IO感知KV缓存与并行解码

arXiv预印本论文提出了针对扩散语言模型(dLLM)的无需训练加速框架Flash-dLLM,首次聚焦解决KV缓存重用与并行验证叠加带来的显存IO瓶颈。该框架引入IO感知融合KV缓存算子,并构建了基于模型自验证的草稿验证解码策略。基准测试显示,该方案在GSM8K和HumanEval任务上相较前代基线分别获得了5.1倍与11.0倍的速度提升。

5. Agensh框架探索无中心编排的多Agent组织演进,成功扩展至1024节点

arXiv论文提出了名为Agensh的去中心化自组织多Agent协同框架,彻底摒弃了传统受限于性能单点的中心调度器。智能体通过共享工作区、统一通信接口和公共上下文实现异步任务认领、执行与校验。实验显示,在pandoc编程任务上将Agent节点从1个扩展至1024个时,测试通过率由33.89%提升至55.06%,表明Agent数量正成为多智能体组织扩展的一个新维度。

开源工具

1. vLLM推出针对Apple Silicon优化的并发推理服务框架vllm-metal

vLLM团队正式发布vllm-metal,将调度器、分页KV Cache和OpenAI兼容服务框架原生移植至Apple Silicon架构。该项目底层由MLX与Metal接管执行核心,有效解决了Mac设备多并发请求重叠时的首字延迟(TTFT)与内存增长问题。首批正式版本已支持多Token预测(MTP)、GGUF量化格式及混合模型部署。

2. CliffCompaction长周期编码压缩技术开源,大幅降低Agent上下文开销

arXiv论文提出了面向超长会话编程智能体的自动压缩方法CliffCompaction,已开源提供无侵入的API代理实现。该技术坚持仅丢弃或截断冗余上下文、绝不使用模型重写改述,从而从机制上消除了信息漂移累积,单次执行推理成本最高下降50%。在KernelBench跨400步测试中,智能体编写CUDA算子加速比达到3.58倍,性能超过定制化搜索模型。

行业动态

1. OpenAI向乌克兰政府开放Daybreak网络防御项目以保护民用基础设施

在联合国大会期间,OpenAI宣布将向乌克兰数字化转型部提供Daybreak防御计划的使用权限,协助其应对民用关键设施的网络攻击。乌克兰技术团队将借助该工具识别软件供应链漏洞并加速安全补丁的研发与验证。这是前沿AI研发机构将其网络攻防测试能力向主权国家民用防线延伸的代表性范例。

2. Meta智能体Muse发布一周用户破50万,被指深度借鉴开源项目OpenClaw

Meta全新的AI智能体Muse上线首周即吸引超过50万用户,并登顶苹果App Store免费榜。不过Meta承认该产品“重度借鉴”了开源项目OpenClaw,部分文件名与内容几乎完全一致;OpenAI已开始讨论相应的应对方案。

3. AI天然药物研发初创企业Enveda获3.11亿美元E轮融资,估值达20亿美元

利用AI解析自然界复杂天然产物分子结构的生物科技公司Enveda宣布完成3.11亿美元E轮融资,公司估值在一年内翻倍至20亿美元。本轮融资由Catalio Capital Management领投,资金将主要用于推进其通过AI发现的天然候选药物进入人体临床试验阶段。这标志着AI制药正从传统虚拟分子筛选向天然生物化学空间实质性拓展。

4. 英伟达参投AI云服务商Nscale美股招股书被曝隐去大客户字节跳动名称

据英国金融时报披露,获得英伟达投资的欧洲AI云基础设施提供商Nscale在其提交的美国IPO招股说明书中,未直接披露其核心客户字节跳动的名称。数据显示,字节跳动贡献了该公司2025年3300万美元总营收的73%,相关算力采购通过新加坡子公司签署,涉及部署于挪威的2304张B200芯片。招股说明书对客户身份的模糊处理引发市场关注。

政策观点

1. 英国监管机构拟强制谷歌在Android和Chrome中展示默认AI助手选择屏

英国竞争与市场管理局(CMA)发布反垄断监管提案,拟要求谷歌在用户初次配置Android设备和打开Chrome浏览器时,强制展示第三方搜索引擎与AI助手选择界面。提案规定,只要符合技术与隐私安全标准的AI服务均有权进入选择列表供用户一键更换默认入口。该提案目前正公开征求各界意见,预计于2026年底形成终审裁定。


本文由 AI225 AI 日报 自动聚合整理,共收录 25 条 AI 领域动态。内容基于公开信息进行 AI 摘要与归纳,可能存在疏漏或偏差,仅供参考。完整内容及相关来源请访问: https://daily.ai225.com/daily/2026-09-24

赞(0)
未经允许不得转载:网硕互联帮助中心 » AI 日报(2026年9月24日)
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!