你对手机里的 AI 说一句话,它能不能不连云端,就听懂、思考,再直接开口回答?高通给出的新答案,是把更大的模型塞进手机:据 TechCrunch 报道,Qualcomm 发布 Snapdragon 8 Elite Gen 6 和 Snapdragon 8 Elite Extreme Gen 6,其中 Extreme 版本宣称可在本地运行一个 30B 混合专家模型。
30B 是约 300 亿个参数。参数可以理解为模型训练后保存下来的内部数值。不过,这不等于手机每次都要调动全部 300 亿参数。此次信息全部来自 TechCrunch 对 Qualcomm 发布会的报道,尚无独立测试;“手机运行 30B”究竟有多快、多耗电,仍需谨慎看待。
30B,并不是全开 30B
这次的关键是混合专家模型,也就是 MoE。它把模型分成多个“专家”子网络,处理一次任务时,只叫其中一部分上场。像一家拥有许多专科医生的医院:医生总数很多,但一次问诊不需要全员会诊。
因此,30B 描述的是模型的总参数规模,不是单次推理——也就是模型实际处理请求——所动用的参数量。MoE 让总模型可以做大,同时把每次计算控制在手机更可能承担的范围内。它改写的是大型模型进入手机的路径,并不代表手机已经能流畅运行同等规模、每次都调用全部参数的 dense model(稠密模型)。
高通没有披露这个 MoE 每次激活多少参数,也没有说明是否使用量化。量化是用精度较低的数字保存模型权重,以减少体积和计算需求;这是大型模型进入手机的常见办法,但压缩过度也可能影响效果。
不只是一个更大的聊天模型
两款芯片还加入了新的 sensing hub,可以理解为持续处理环境和设备信号的低功耗模块。高通称,它能运行最高 2 亿参数的小模型,让手机在本地充当个人记录员、区分不同说话者,并根据使用习惯形成记忆,为自动化任务提供建议。
公司还宣称,新芯片能够完整运行“语音输入、语音输出”的智能体:用户说话,系统理解和处理,再用语音回应,不必把整个流程都交给云端。端侧 AI 的吸引力就在这里——它通常能减少网络等待和原始数据上传。不过,手机的内存、电量和散热都有限,这些约束不会因为模型成功启动就消失。
作为参照,TechCrunch 称 Apple 在 2026 年 6 月 WWDC 发布了一个 20B MoE 模型。这个比较只能说明手机厂商正把更大的 MoE 推向端侧,不能直接说明高通方案效果更好,因为材料没有提供相同任务下的速度、质量或能耗对照。
为什么值得关注?
Snapdragon 是 Android 旗舰手机的主要芯片平台之一。如果 Qualcomm 的主张能在量产设备上兑现,端侧 AI 的上限会从“小模型执行单项功能”,继续推向能听、能答、能记忆的完整智能体。与此同时,硬件竞争也会从峰值算力,转向模型如何编排、压缩,以及能否长时间稳定运行。
产品落地已有一个明确去向。据 TechCrunch 报道,Motorola 宣布 Motorola Signature 27 将采用 Extreme 版本,并计划在 2026 年内上市。Qualcomm 还称正在推进超过 40 款 AI 设备。Extreme 芯片同时支持 8K 60fps、4K 240fps 视频录制和 Advanced Professional Video(APV)编解码器,显示它仍是一颗覆盖 AI、影像等任务的综合手机芯片,而非专用 AI 芯片。
局限与未知
- Qualcomm 尚未披露 30B MoE 的激活参数量、量化精度、内存占用、速度、功耗和持续运行温度,也未说明演示基于量产手机还是参考平台。
- “完整语音智能体”“更好个性化”等说法没有对应的模型名称、基准测试或对照数据,目前应视为发布会主张,而非媒体实测结论。
- TechCrunch 在 Motorola 机型处使用了不同的芯片词序,可能是笔误;正式上市前仍需核对官方命名和最终配置。