自动化所发布跨模态通用AI平台“紫东太初”—新闻

作者：赵广立来源：中国科学报发布时间：2021/7/9 22:46:51

选择字号：小中大

瞄准成为实现通用人工智能的“开天之斧”

自动化所发布跨模态通用AI平台“紫东太初”

7月9日，中国科学院自动化研究所（以下简称自动化所）所长、研究员徐波在2021世界人工智能大会（WAIC2021）上就人工智能的最新进展进行报告，并发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。

徐波.jpg

徐波在WAIC2021上发布“紫东太初” 自动化所供图

据介绍，“紫东太初”以多模态大模型为核心，基于全栈国产化基础软硬件平台，可支撑全场景AI应用。

多模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。自动化所 “紫东太初” 跨模态通用人工智能平台瞄准成为实现通用人工智能的开天之斧，在智能世界混沌初开之际开辟新局。

会上，徐波展示了自动化所打造的虚拟人“小初”，并演示通用多模态大模型的人机对话，展示了不同模态间的互相转换和生成实例，涵盖视频描述、智能问答、图像检索、吟诗作赋、中文续写、双语翻译、语音识别等多个功能。对该成果的演示证明，通过图—文—音三模态的关联与协同，可以有效地提升机器的理解和生成能力。

据介绍，依托面向超大规模的高效分布式训练框架，自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型，并开拓性地通过跨模态语义关联实现了视觉—文本—语音三模态统一表示，构建了三模态预训练大模型，赋予跨模态通用人工智能平台多种核心能力。

这也使得“紫东太初”兼具跨模态理解和生成能力。与单模态和图文两模态相比，其采用一个大模型就可以灵活支撑图—文—音全场景AI应用，具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

值得一提的是，引入语音模态后的多模态预训练模型，可实现共性图文音语义空间表征和利用，并突破性地直接实现三模态的统一表示。特别地，首次使 “以图生音”和“以音生图”成为现实，对更广泛、更多样的下游任务提供模型基础支撑，达成AI在如视频配音、语音播报、标题摘要、海报创作等更多元场景的应用。

“小初”展示能力.png

“小初”展示“以图生音”技能截图自动化所提供

此外，自动化所研发团队还提出了弱关联三模态数据的语义统一表达，可同时支持三种或任两种模态弱关联数据进行预训练，有效降低了多模态数据收集与清洗成本。

编辑部推荐博文
基金本子“瘦身提质”，配图不要踩这3种坑！祝贺！科学网2025年度十佳博文评选活动结果揭晓为何古代沉积盆地的面积总是被小看？辞去教学副系主任后，他为何持续“发声”？蒸镀超薄spiro-OMeTAD助力太阳能电池效率基于MAPPO和时间差分行为克隆的目标跟踪算法更多>>