魔搭中文开源模型社区:模型即服务-ModelScope助力语音AI模型创新与应用(下)

本文涉及的产品
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
模型训练 PAI-DLC,100CU*H 3个月
交互式建模 PAI-DSW,每月250计算时 3个月
简介: 魔搭中文开源模型社区:模型即服务-

二、 ModelScope社区助力语音AI发展

 

达摩院语音实验室通过ModelScope社区,把过去积累的优秀算法开源,并开放了算法生产的模型。达摩院希望每个模型开发者都可以通过ModelScope社区,接触到达摩院的算法和预训练模型。

 

image.png

 

在ModelScope社区,模型开发者不但可以复原达摩院生产的预训练模型,而且可以在自己的数据领域,进行定制化开发。

 

image.png

 

目前,达摩院在ModelScope社区开放了五大领域的三十多个不同模型。包括语音识别、语音合成、语音唤醒、语音信号处理、口语语言处理领域。

 

image.png

 

用户可以在每个模型的详情页,看到详细的模型信息及模型效果。用户可以直接通过网页进行交互,直观体验语音识别跟语音合成的效果。

 

image.png

 

接下来,介绍一下达摩院创新的语音识别模型“Paraformer”。目前,主流语音识别模型是端到端的自回归模型。Paraformer模型在自回归模型的基础之上,大幅提升了推理时的效率,给予用户十倍的效能提升,降低模型的服务成本。

 

image.png

 

与此同时,阿里云线上Uni-ASR模型通过ModelScope社区,首次开放开源。阿里云希望行业应用者,研究机构的研究者可以在此基础上,产出比达摩院更好的模型。

 

image.png

 

除了中文模型,达摩院的新加坡实验室在ModelScope社区开放了很多其他语种的语言模型。

 

image.png

 

在语音合成方面,ModelScope社区开放了达摩院创新的语音合成声学模型SAMBERT,并且开放了达摩院预先训练好的音色,方便大家直接使用。当用户需要定制声音,只需要使用training pipeline,通过预训练模型加翻译的方式,自主定制自己喜欢的音色。

 

image.png

 

在语音唤醒方面,达摩院开放了语音唤醒词定制模型。用户只需要收集少量的唤醒词数据,就可以定制自己喜欢的唤醒词。

 

image.png

 

在信号处理方面,达摩院首批开放了降噪模型,回声消除模型。方便用户对语音进行降噪,回声消除等等。

 

image.png

 

在口语语言处理方面,达摩院开源开放了最新的口语长文本语言处理基础模型“PoNet”。PoNet主要用来处理口语长文本的篇章级内容,在运算效率跟理解能力上,优势突出。大家可以将PoNet模型,作为预训练模型使用。

 

image.png

 

如上图所示,ModelScope社区为AI模型开发者提供开箱即用的环境,大家只需点击右上角即可。

 

image.png

 

如上图所示,用户只需要两行代码,就能在服务器后端拉起模型,把模型加载到本地并运行。不同模态的模型都可以通过修改两行参数,直接获取。

 

目前,平台的三百多个模型都可以通过两行代码中的两个参数实现拉取。如果用户需要把模型部署到自己的云端,让云端服务进行推理。用户可以通过SDK直接实现。

 

image.png

 

除此之外,达摩院为AI模型开发者提供了,完整的工业级语音合成模型训练recipe。达摩院在ModelScope社区,将SAMBERT语音合成模型开源。

 

开发者可以基于达摩院ModelScope SAMBERT预训练模型及自有音库,实现完全自主语音合成模型训练。目前,更多其它各类模型训练recipe陆续开源中。

 

image.png

 

在应用,阿里云即将推出语音AI模型服务。当用户进入语音AI模型服务,只需语音模型,就能建立一个API服务。用户在享受模型高精度的同时,该服务是完全弹性的。让大家以更高精度、更低成本,使用模型API应用。

 

image.png

 

达摩院希望通过ModelScope社区,释放AI模型创新的原动力,通过阿里云语音AI模型服务,为用户提供一站式的API服务。ModelScope社区与AI创新者、应用者并肩携手,让语音AI技术产生更高价值。


 

 

相关实践学习
达摩院智能语音交互 - 声纹识别技术
声纹识别是基于每个发音人的发音器官构造不同,识别当前发音人的身份。按照任务具体分为两种: 声纹辨认:从说话人集合中判别出测试语音所属的说话人,为多选一的问题 声纹确认:判断测试语音是否由目标说话人所说,是二选一的问题(是或者不是) 按照应用具体分为两种: 文本相关:要求使用者重复指定的话语,通常包含与训练信息相同的文本(精度较高,适合当前应用模式) 文本无关:对使用者发音内容和语言没有要求,受信道环境影响比较大,精度不高 本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。 讲师介绍: 郑斯奇,达摩院算法专家,毕业于美国哈佛大学,研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。
相关文章
|
7天前
|
存储 人工智能 NoSQL
AI大模型应用实践 八:如何通过RAG数据库实现大模型的私有化定制与优化
RAG技术通过融合外部知识库与大模型,实现知识动态更新与私有化定制,解决大模型知识固化、幻觉及数据安全难题。本文详解RAG原理、数据库选型(向量库、图库、知识图谱、混合架构)及应用场景,助力企业高效构建安全、可解释的智能系统。
|
7天前
|
人工智能 算法 Java
Java与AI驱动区块链:构建智能合约与去中心化AI应用
区块链技术和人工智能的融合正在开创去中心化智能应用的新纪元。本文深入探讨如何使用Java构建AI驱动的区块链应用,涵盖智能合约开发、去中心化AI模型训练与推理、数据隐私保护以及通证经济激励等核心主题。我们将完整展示从区块链基础集成、智能合约编写、AI模型上链到去中心化应用(DApp)开发的全流程,为构建下一代可信、透明的智能去中心化系统提供完整技术方案。
101 3
|
8天前
|
消息中间件 人工智能 安全
云原生进化论:加速构建 AI 应用
本文将和大家分享过去一年在支持企业构建 AI 应用过程的一些实践和思考。
144 15
|
8天前
|
人工智能 JavaScript 前端开发
GenSX (不一样的AI应用框架)架构学习指南
GenSX 是一个基于 TypeScript 的函数式 AI 工作流框架,以“函数组合替代图编排”为核心理念。它通过纯函数组件、自动追踪与断点恢复等特性,让开发者用自然代码构建可追溯、易测试的 LLM 应用。支持多模型集成与插件化扩展,兼具灵活性与工程化优势。
56 6
|
18天前
|
人工智能 安全 中间件
阿里云 AI 中间件重磅发布,打通 AI 应用落地“最后一公里”
9 月 26 日,2025 云栖大会 AI 中间件:AI 时代的中间件技术演进与创新实践论坛上,阿里云智能集团资深技术专家林清山发表主题演讲《未来已来:下一代 AI 中间件重磅发布,解锁 AI 应用架构新范式》,重磅发布阿里云 AI 中间件,提供面向分布式多 Agent 架构的基座,包括:AgentScope-Java(兼容 Spring AI Alibaba 生态),AI MQ(基于Apache RocketMQ 的 AI 能力升级),AI 网关 Higress,AI 注册与配置中心 Nacos,以及覆盖模型与算力的 AI 可观测体系。
348 18
|
19天前
|
人工智能 运维 安全
聚焦 AI 应用基础设施,云栖大会 Serverless AI 全回顾
2025 年 9 月 26 日,为期三天的云栖大会在杭州云栖小镇圆满闭幕。随着大模型技术的飞速发展,我们正从云原生时代迈向一个全新的 AI 原生应用时代。为了解决企业在 AI 应用落地中面临的高成本、高复杂度和高风险等核心挑战,阿里云基于函数计算 FC 发布一系列重磅服务。本文将对云栖大会期间 Serverless+AI 基础设施相关内容进行全面总结。
|
20天前
|
设计模式 机器学习/深度学习 人工智能
AI-Native (AI原生)图解+秒懂: 什么是 AI-Native 应用(AI原生应用)?如何设计一个 AI原生应用?
AI-Native (AI原生)图解+秒懂: 什么是 AI-Native 应用(AI原生应用)?如何设计一个 AI原生应用?
|
21天前
|
人工智能 负载均衡 API
Vercel 发布 AI Gateway 神器!可一键访问数百个模型,助力零门槛开发 AI 应用
大家好,我是Immerse,独立开发者、AGI实践者。分享编程、AI干货、开源项目与个人思考。关注公众号“沉浸式趣谈”,获取独家内容。Vercel新推出的AI Gateway,统一多模型API,支持自动切换、负载均衡与零加价调用,让AI开发更高效稳定。一行代码切换模型,告别接口烦恼!
195 1
Vercel 发布 AI Gateway 神器!可一键访问数百个模型,助力零门槛开发 AI 应用
|
24天前
|
边缘计算 人工智能 算法
AI在智慧能源管理中的边缘计算应用
AI在智慧能源管理中的边缘计算应用
99 13
|
24天前
|
人工智能 Cloud Native 中间件
划重点|云栖大会「AI 原生应用架构论坛」看点梳理
本场论坛将系统性阐述 AI 原生应用架构的新范式、演进趋势与技术突破,并分享来自真实生产环境下的一线实践经验与思考。