|
阿里云近日在阿里云通义智能硬件展现场发布了多模态交互开发套件。该套件集成了千问、万相、百聆三款通义基础大模型,并预置10多款生活休闲、工作效率等方面的Agent和MCP工具,为开发者提供了能听、会看、能思考,并与物理世界交互的多模态AI赋能工具。
“随着多模态大模型的发展,大模型已开始具备理解、感知以及和物理世界交互的能力,越来越多的硬件和终端设备厂商开始通过接入大模型来提升交互体验。然而,仅靠基础大模型仍无法同时满足硬件设备对低成本、低时延、功能丰富和高质量效果的需求。”阿里云通义大模型业务总经理徐栋表示。为此,阿里云推出了多模态交互开发套件,为硬件企业和解决方案商提供了低开发门槛、响应速度快、场景丰富的平台。
在芯片层面,该套件适配了30多款主流ARM、RISC-V和MIPS架构终端芯片平台,满足市面上绝大多数硬件设备的快速接入需求。未来,通义大模型还将与玄铁RISC-V实现软硬全链路的协同优化,实现通义大模型家族在RISC-V架构上的极致高效部署和推理性能。在模型优化层面,除通义模型家族外,阿里云还针对大量多模态交互场景进行分析,推出适合AI硬件交互的专有模型,全面支持全双工语音、视频、图文等交互方式,端到端语音交互时延低至1秒,视频交互时延低至1.5秒。
此外,该套件预置10多款MCP工具和Agent,覆盖生活、工作、娱乐、教育等多个场景,例如,基于预置的出行规划Agent,用户可直接调用路线规划、旅行攻略、吃喝玩乐探索等能力。该套件同时接入了阿里云百炼平台生态,用户不仅可以添加其他开发者提供的MCP和Agent模板,还能通过A2A协议兼容三方Agent,大幅拓展了应用的能力边界,帮助企业灵活搭建业务场景。
“我们观察到,用户与AI的交互具有碎片化、高黏性的特征。大模型与所有硬件品类都有深度融合的潜力,特别是垂直小品类赛道上的创新硬件。”徐栋表示。
在AI眼镜领域,基于千问VL、百聆CosyVoice等模型,阿里云打造了感知层、规划层、执行层以及长期记忆的完整交互链路,可一站式实现同声传译、拍照翻译、多模态备忘录、录音转写功能,有效解决交互不自然、回答准确率低的难题。面向具身智能领域,乐聚机器人将基于阿里云全栈AI能力,包括算力、AI平台、千问模型,打造人形机器人训练场合作场景,实现机器人在语音交互、知识库问答、实时对话等场景下,响应更快、答案更准、互动更自然。
谈及人工智能赋能制造业发展,徐栋表示,目前“人工智能+制造”已在工业质检、流程分析等领域取得了广泛应用。未来阿里云通义大模型将在工业大模型能力泛化、数据整合、VLA等方向持续发力。
|