基于多模态的涉藏媒体短视频舆情感知 与以往单模态相比,多模态借助对混合数据各个模态的信息予以处理,使得具备相似语义的模态具有相似的结果,通过映射和处理单模态的基础上实现语义一致。文中从视觉、听觉、文本处理涉藏媒体短视频的舆情感知,具体而言使用Vision Transformer(VIT)、Transformer端对端方式进行多模态融合,提出模型构建方法和工作方法。 魅力中国 2026年08月07日 0 点赞 0 评论 4 浏览