中文EN
【热词新语】多模态语言
2026-08-14 来源:社科院专刊 总第877期 作者:储泽祥
分享到:

  储泽祥(文学研究所)

  多模态语言是指信息传递中同时融合两种或两种以上符号模态的综合性表达与理解系统。它既反映了人类自然交流中多感官协同的本质,也特指人工智能领域内跨模态信息处理的技术范式。

  从书面上看,多模态语言的原始形式可能是让标点符号单独构成句子,即所谓的“标点社交”。这种情形在互联网产生以前就存在,常见的是用“?”代替问句,通常限于互相了解的熟人之间。新技术、新媒介带来了划时代的语言变化,最突出的表现就是多模态语言在广度和深度上的双重跃升。如图片与文字的关系发生了质的飞跃,体现在两个方面:一是“图片+文字”的模板化;二是语言要素的“图符”化。

  在传统的插图中,图片往往用来解释或辅助文字。如今,图片变成了语言结构的一部分,可以通过图片与文字的特定组合传达立场和观点,通过固定的视觉模板和可变的文本填充,形成一条高效的认知捷径,让人们能够在极短的时间内完成意义的构建与传递。

  新技术、新媒介使书面汉语发生了从未有过的变化。语素、词、短语甚至句子,不再局限于文字形式,而是产生了新的表现形式——“图符”。“图符”是图片、表情包等的合称,根据组配情况,可以分为图符语素、图符词、图符短语、图符句。如用“打+篮球图片+吗”表示“打篮球吗?”的意思,篮球图片代替了“篮球”这个名词。

  多模态语言得益于大语言模型的进步。多模态大语言模型能同时理解并生成文本、图像、音频、视频等多种信息形态,它们不再只认文字,而是能“看懂”图片推理、“听出”语音情绪,实现人机无缝交互。

  多模态语言是对人类原始交流本能的数字化复刻,一方面揭示出语言从未脱离身体与情境的真相,另一方面推动人工智能从“读文字”走向“感知世界”,成为连接符号与感知、人类与机器的桥梁。

责任编辑:崔园园(报纸) 张赛(网络)