头版Folia Daily Briefing
← 返回头版
科技

Inflect-Micro-v2:仅用936万参数实现完整文本转语音

开发者Owen Song独立完成并开源了Inflect-Micro-v2,这是一款参数量低于1000万的完整文本转语音(TTS)合成模型。该模型包含9,356,513个可部署参数,FP32格式下占用37.53 MB的存储空间。

开发者Owen Song独立完成并开源了Inflect-Micro-v2,这是一款参数量低于1000万的完整文本转语音(TTS)合成模型。[1]该模型包含9,356,513个可部署参数,FP32格式下占用37.53 MB的存储空间。[1]

Inflect-Micro-v2在性能和易用性上具有多项优势。[1]模型支持确定性种子设置、长文本处理以及CPU和CUDA两种推理方式,采用英文音素前端和端到端架构设计。[1]在盲测评估中,该模型获得66.2%的人类偏好率(21胜10负3平),UTMOS22评分达到4.395分。[1]在自动语音识别(ASR)智能度测试中,经Qwen3-ASR、Nemotron 3.5和Whisper分别检测的错误率为2.52%、5.45%和2.73%。[1]模型输出规格为24 kHz单声道音频,采用Apache-2.0开源许可证,已发布在Hugging Face平台。[1]


Inflect-Micro-v2文本转语音TTS模型轻量化模型本地推理