Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.098 — 2026-10-10
NEWS 约 1 分钟

audio.cpp再砍近半TTS显存

audio.cpp把Higgs Audio TTS峰值显存压到约6GB,HTDemucs分轨也快了约一倍。

IMAGE — r/LocalLLaMA 日榜

想在自己的电脑上给视频配音,最先卡住你的可能不是模型能力,而是显卡装不下。audio.cpp——一个让多种音频模型在本地轻量运行的工具——最近继续降低了这道门槛。其作者称,Higgs Audio TTS 的峰值显存降至约 6GB,比此前实现少48%。TTS就是把文字合成为语音;显存则像显卡手边的工作台,模型和计算过程放不下时,程序往往无法直接运行,或要把任务挪到更慢的内存。

这次调整发生在运行时,也就是模型真正执行计算的底层环节。作者称,优化没有牺牲结果一致性和正确性,Higgs Audio TTS的速度变化不大,为1.01至1.09倍;主要收益是更省显存。另一项明显改进来自HTDemucs——一种把歌曲拆成人声、鼓等声部的神经网络工具:其GPU分轨速度在CUDA环境下提升至2.21倍,在Vulkan环境下提升至1.95倍。换句话说,一边让语音合成更容易装进普通显卡,一边缩短本地分轨等待时间。不过,供稿未披露具体测试硬件、输入规模和实现细节,实际收益仍会随设备与任务而变。


供稿材料 SOURCES — 1

← 返回 2026-10-10 · 开源板块