物界前沿 · 资讯情报卡(IT之家 · 2026/9/16)
讯飞发布全国产算力语音基座大模型Spark-Audio-1.0
核心事实
- 科大讯飞上线Spark-Audio-1.0-Preview,基于纯国产算力集群训练。
- 模型采用0.65B音频编码器与30B-A3B MoE结构,使用1300万小时音频数据。
- 支持99种语言及202种方言识别,具备端到端理解语义、情绪及环境音能力。
- 在Fleurs中文测试集取得SOTA,多项语音评测得分高于Gemini-3.1 Pro。
- 相比同尺寸竞品在多语言识别上占优,通用知识任务未出现明显性能下降。
关键数据
0.65B音频编码器参数
30B-A3BLLM结构参数
1300万小时训练音频时长
99种支持语言数
物界观察
讯飞此举标志着国产AI基础设施从“可用”迈向“好用”。全链路国产化训练不仅规避了算力断供风险,更通过端到端架构解决了传统级联方案的信息损耗痛点。其在高噪声等真实场景的领先表现,证明国产模型已具备替代国际顶尖闭源模型的实战潜力,为垂直领域落地提供了高性价比的新选择。
来源:IT之家原文 ↗
物界前沿