国际期刊投稿平台
登录 | 注册
当前位置: 首页 > > 基于多模态特征融合的智慧景区推荐研究

  • 主办单位: 
  • ISSN: 
  • 期刊分类: 
  • 出版周期: 
  • 投稿量: 
  • 浏览量: 

相关文章

暂无数据

基于多模态特征融合的智慧景区推荐研究

Research on Smart Scenic-Spot Recommendation Based on Multimodal Feature Fusion

发布时间:2026-09-02
作者: 谢宜彤 :安徽大学 安徽合肥; XIE Yitong :Anhui University, Hefei;
摘要: 随着智慧旅游与移动互联网技术的深度融合,景区个性化推荐服务日益受到关注。传统推荐系统多依赖单一模态数据,如用户历史行为或景点文本描述,难以充分刻画游客的真实兴趣与景点的多维特征,导致推荐结果同质化、精准度不足等问题。针对上述问题,本文提出一种面向智慧景区的多模态特征融合推荐方法,综合利用景点文本描述、图像视觉特征、游客位置轨迹以及用户行为序列等多源异构数据,设计了单模态特征提取与基于注意力机制的动态跨模态融合框架,并在此基础上构建融合特征驱动的推荐模型。实验部分基于智慧景区导览小程序脱敏数据构建的测试集,从准确率、召回率及归一化折损累计增益等指标对方法进行了验证,结果表明该方法相较于位置规则匹配、协同过滤及单模态、早期融合等基线方法,在推荐精度与排序质量上均取得明显提升。本文的研究可为智慧景区导览系统个性化推荐功能的设计与优化提供理论参考与实践依据。
Abstract: With the deep integration of smart tourism and mobile Internet technologies, personalized recommendation for scenic spots has attracted increasing attention. Conventional recommender systems mostly rely on a single data modality, such as user behavior logs or textual descriptions of attractions, which makes it difficult to fully characterize tourists' genuine interests and the multi-dimensional features of scenic spots, leading to homogeneous and imprecise recommendations. To address this problem, this paper proposes a multimodal feature fusion recommendation method for smart scenic areas, which jointly exploits heterogeneous data including textual descriptions, visual images, tourist location trajectories, and behavioral sequences. A unified single-modal feature extraction framework and an attention-based dynamic cross-modal fusion strategy are designed, upon which a fusion-driven recommendation model is further constructed. Experiments conducted on a dataset built from anonymized logs of a smart tour-guide mini-program show that the proposed method consistently outperforms location-rule matching, collaborative filtering, single-modal and early-fusion baselines in terms of precision, recall, and NDCG, providing both theoretical reference and practical guidance for personalized recommendation design in smart scenic-area guide systems.
关键词: 多模态融合;推荐系统;智慧旅游;注意力机制;位置服务
Keywords: multimodal fusion; recommender system; smart tourism; attention mechanism; location-based service

引言

近年来,随着国民旅游消费水平的持续提升与移动互联网技术的深度普及,智慧旅游已成为文旅产业转型升级的重要方向。以微信小程序、位置服务(LBS)为代表的电子导游系统,在一定程度上缓解了传统人工导游服务成本高、覆盖范围有限、信息更新滞后等问题。然而,现有的多数智慧景区应用在提供个性化推荐服务时,往往仅依赖单一维度的数据来源:或是基于游客当前地理位置进行“就近推荐”,或是基于景点类别标签进行简单的关键词匹配,鲜少对景点的文本描述、视觉图像、游客的历史行为轨迹等多源异构信息进行系统性融合利用。这种单一模态驱动的推荐方式难以全面刻画景点的语义特征与游客的深层兴趣偏好,容易造成推荐结果同质化、“千人一面”,难以满足游客日益增长的个性化、精细化游览需求。

多模态融合作为人工智能领域的重要研究方向,通过对文本、图像、时空轨迹等异构数据进行联合建模,能够挖掘不同模态之间的互补信息与语义关联,已在电子商务推荐、内容分发等场景中得到广泛验证。将多模态融合思想引入智慧景区推荐场景,综合利用景点的文字介绍、实景图片、游客的位置轨迹与历史交互行为,有望突破单一模态数据的信息瓶颈,实现更加精准、个性化的景区导览与推荐服务。

有鉴于此,本文面向智慧景区场景,提出一种基于多模态特征融合的推荐方法。论文的主要贡献包括:(1)构建了涵盖文本、图像、位置轨迹与行为序列四种模态的特征提取框架;(2)设计了基于注意力机制的动态跨模态融合策略,实现不同模态特征的自适应加权融合;(3)在融合特征基础上构建推荐模型,并通过实验验证了方法的有效性。论文其余部分安排如下:第2节介绍相关研究现状;第3节详细阐述多模态融合推荐方法的设计;第4节给出实验设置与结果分析;第5节对全文进行总结并展望未来工作。

1 相关工作

1.1 智慧旅游推荐系统研究现状

国内外学者围绕智慧旅游推荐系统开展了大量研究。国外方面,Harahap等对近十年智慧旅游生态系统的技术演进与可持续影响进行了系统梳理,指出多源数据融合与智能化服务是智慧旅游未来发展的重要趋势;Abluton等设计并实现了面向情境感知与可持续推荐的旅游实验平台,验证了融合游客情境信息进行个性化推荐的可行性;Wang等则从工作特征视角探讨了人机协同对导游工作意义感的影响,为智能导览系统与人工服务的协同设计提供了参考。国内方面,陈垚磊探讨了智慧旅游背景下风景区规划中数字技术的应用路径;杜志强等提出了基于大模型与多源数据融合的景区导览优化策略,将大语言模型与地理、文本等多源数据结合以提升导览交互体验,为本文的多模态融合思路提供了重要启发。总体来看,现有研究已关注到多源数据融合对提升智慧旅游服务质量的重要作用,但在如何系统化地融合文本、图像、位置轨迹与行为序列等多模态数据以支撑精准推荐方面,仍有较大的探索空间。

1.2 多模态特征融合方法研究现状

多模态特征融合方法大致可分为早期融合、晚期融合与混合融合三类。早期融合在特征层面直接拼接不同模态的原始特征或浅层表示,实现简单但难以充分挖掘模态间的高阶语义关联;晚期融合则分别训练单模态模型后再对决策结果进行加权组合,虽能保留各模态的独立性,但忽视了模态间的交互信息。近年来,基于注意力机制的动态融合方法逐渐成为主流,其核心思想是通过可学习的权重系数,根据任务需求自适应地调整不同模态特征的贡献度,从而实现更细粒度的模态交互建模。在位置服务相关研究中,潘波等系统梳理了LBS技术在多个领域中的应用场景,指出位置轨迹数据蕴含着丰富的用户行为语义信息;周宇轩针对多元化场景下的视觉与惯性信息融合定位问题开展了研究,验证了多源传感器信息融合在提升定位与场景理解精度方面的有效性,为本文将位置轨迹作为独立模态纳入融合框架提供了方法论支撑。

2 面向景区推荐的多模态融合方法设计

2.1 问题定义与总体框架

设景区推荐系统涉及游客集合U与景点集合I,对任意游客u∈U与景点i∈I,系统需要综合利用四类模态数据:景点文本描述模态T、景点图像模态V、游客位置轨迹模态L以及游客历史行为序列模态B,学习游客u对景点i的偏好评分s(u,i),并据此生成Top-K推荐列表。本文提出的多模态融合推荐方法整体框架自下而上分为三层:(1)数据层,负责采集与清洗景点文本、图像、游客轨迹及行为日志等原始数据;(2)特征层,针对四类模态分别设计特征提取网络,得到统一维度的模态表示向量;(3)融合与决策层,通过跨模态注意力融合模块生成综合特征,并输入推荐模型计算游客—景点匹配得分。

2.2 单模态特征提取

2.2.1 文本特征提取

景点文本模态包括景点简介、游客评论等自然语言数据。本文采用预训练语言模型对文本进行编码,将景点描述与游客评论分别映射为固定维度的语义向量h_T,并通过均值池化得到景点或游客的文本表示,充分捕捉文本中的语义信息与情感倾向。

2.2.2 图像特征提取

景点图像模态取自景点实景照片与游客上传的游览图片。本文采用预训练卷积神经网络作为图像编码器,提取图像的深层视觉特征h_V,经全局平均池化与线性映射后得到与文本特征同维度的图像表示,用于刻画景点的视觉风格、自然景观类型等信息。

2.2.3 位置轨迹特征提取

位置轨迹模态来源于游客在小程序端产生的GPS定位序列。本文首先将连续的经纬度坐标序列离散化为POI访问序列,再利用序列编码网络对该序列进行建模,得到能够反映游客空间移动模式与兴趣区域偏好的轨迹表示h_L,弥补了传统LBS推荐仅利用当前单点位置信息的不足。

2.2.4 行为序列特征提取

行为序列模态涵盖游客的浏览、收藏、分享、语音导览触发等历史交互记录。本文将各类行为按时间顺序组织为行为序列,通过序列编码网络学习游客的短期兴趣漂移与长期偏好模式,得到行为表示h_B。

2.3 多模态特征融合策略

在获得四类模态的统一维度表示h_T、h_V、h_L、h_B后,本文设计了基于门控注意力机制的动态融合策略。具体地,首先针对每一模态表示学习一个注意力权重:

α_m = softmax( w^T · tanh(W_m · h_m + b_m) ),m ∈ {T, V, L, B}

其中W_m、w、b_m为可学习参数。随后以注意力权重对各模态表示进行加权求和,得到融合特征:

F = Σ_m α_m · h_m

与简单拼接的早期融合策略相比,该方法能够根据不同游客—景点对的具体情境,动态调整各模态的贡献权重,例如当游客尚无足够行为记录(冷启动场景)时,模型可自适应地提高文本与图像模态的权重,缓解行为数据稀疏带来的推荐质量下降问题。此外,针对部分游客位置轨迹缺失、图像数据不完整等模态缺失情形,本文引入模态掩码机制,在权重归一化时屏蔽缺失模态,保证融合过程的鲁棒性。

2.4 融合特征驱动的推荐模型

将融合特征F输入多层感知机,映射为游客与景点的联合表示,并通过内积或多层非线性变换计算匹配得分s(u,i)。模型训练采用贝叶斯个性化排序(BPR)损失函数,通过对比正样本(游客实际访问或收藏的景点)与负样本(未交互景点)的得分差异进行参数优化,使模型学习到能够正确排序游客偏好的表示空间。训练完成后,系统根据得分s(u,i)对候选景点集合排序,生成个性化的Top-K推荐列表,并可与位置服务模块联动,在推荐结果中融入实时距离信息,实现“个性化+就近”的双重推荐策略。

3 实验与分析

3.1 实验数据与设置

为验证所提方法的有效性,本文基于某智慧景区导览小程序的脱敏日志构建实验数据集,涵盖景点文本简介、实景图片、游客脱敏位置轨迹及浏览、收藏、分享等行为记录。数据集按时间顺序划分为训练集与测试集,训练集用于模型参数学习,测试集用于评估推荐效果。实验选取以下方法作为对比基线:(1)基于位置就近匹配的规则推荐方法(LBS-Rule);(2)传统协同过滤方法(CF);(3)仅使用文本模态的推荐方法(Text-Only);(4)仅使用图像模态的推荐方法(Image-Only);(5)采用简单特征拼接的早期融合方法(Early-Fusion)。

3.2 评价指标

实验采用推荐系统常用的Precision@K、Recall@K与归一化折损累计增益NDCG@K作为评价指标,K取5与10,综合衡量推荐结果的准确性与排序质量。

3.3 实验结果与分析

各方法在测试集上的实验结果如表1所示(K=10)。

表1 各方法推荐效果对比(K=10)
方法 Precision@10 Recall@10 NDCG@10
LBS-Rule(位置规则匹配) 0.182 0.201 0.196
CF(协同过滤) 0.224 0.238 0.231
Text-Only(仅文本模态) 0.241 0.256 0.249
Image-Only(仅图像模态) 0.233 0.247 0.238
Early-Fusion(早期拼接融合) 0.267 0.281 0.273
本文方法(注意力动态融合) 0.312 0.329 0.318

实验结果表明,单一依赖位置信息的规则推荐方法效果最弱,说明仅依靠地理邻近性难以准确刻画游客的真实兴趣;传统协同过滤方法由于存在数据稀疏问题,效果提升有限;单模态的文本或图像方法虽能捕捉一定的语义信息,但难以全面反映游客偏好;早期融合方法通过简单拼接多模态特征取得了一定改善,但仍未能充分建模模态间的交互关系。本文提出的基于注意力机制的动态融合方法在各项指标上均取得最优表现,相较早期融合方法,Precision@10、Recall@10与NDCG@10分别提升了约16.9%、17.1%与16.5%,验证了动态跨模态融合策略相较于简单拼接的优势。

3.4 消融实验

为进一步分析各模态对推荐效果的贡献,本文设计了消融实验,依次去除文本、图像、位置轨迹与行为序列模态,观察NDCG@10指标的变化情况。实验结果显示,去除行为序列模态后指标下降幅度最大,说明历史交互行为是刻画游客偏好的核心信息来源;去除位置轨迹模态后指标同样出现明显下降,表明游客的空间移动模式蕴含着重要的兴趣线索;相较而言,去除文本或图像模态对指标的影响略小,但仍带来了不同程度的性能损失,说明文本与图像模态能够为行为数据稀疏的游客提供有效的语义补充。上述结果验证了本文所提四模态融合框架中各模态的必要性与互补性。

4 结束语

本文面向智慧景区个性化推荐需求,提出了一种基于多模态特征融合的推荐方法,综合利用景点文本描述、视觉图像、游客位置轨迹与行为序列等多源异构数据,设计了统一的单模态特征提取框架与基于注意力机制的动态跨模态融合策略,并在此基础上构建了融合特征驱动的推荐模型。实验结果表明,相较于位置规则匹配、协同过滤及单模态方法,本文方法在推荐准确性与排序质量方面均取得明显提升,验证了多模态融合思路在智慧景区推荐场景中的有效性与必要性。

后续工作可从以下几个方面展开:一是探索引入大语言模型对景点文本与游客评论进行更深层次的语义理解,进一步提升文本模态的表征能力;二是研究跨景区、跨城市场景下的推荐模型迁移与冷启动问题,提升方法的泛化能力;三是结合实时位置流数据设计在线增量融合机制,以支持游览过程中的动态推荐更新;四是在保证模型效果的同时,进一步关注游客位置与行为数据的隐私保护问题,探索联邦学习等隐私保护技术与多模态融合方法的结合路径。

参考文献:

  1. [1] Harahap P E, Sediyono E, Hasibuan A Z, et al. Thematic analysis smart tourism ecosystems: A decade of technological advancement and sustainable impact[J]. Human behavior and emerging technologies, 2026, 2026(01): 8688311.
  2. [2] 周宇轩. 面向多元化场景的视觉惯性定位与建图方法研究[J]. 武汉大学学报(信息科学版), 2026, 51(04): 867.
  3. [3] 潘波, 郑晓东, 王岩. 位置服务LBS技术的应用[J]. 集成电路应用, 2024, 41(10): 34-35.
  4. [4] Wang Y, Ye L, Guo M, et al. Can human-AI collaboration enhance tour guides' meaningfulness at work? A job characteristics perspective in smart tourism[J]. Journal of hospitality and tourism management, 2026, 67: 101442.
  5. [5] Abluton A, Leon B L, Benetti S, et al. Design and implementation of a tourism experimentation platform for context-aware and sustainable recommendations[J]. Applied sciences, 2026, 16(08): 3937.
  6. [6] 陈垚磊. 基于智慧旅游背景的风景区规划数字技术应用研究初探[J]. 城市建设理论研究(电子版), 2026(09): 7-9.
  7. [7] 陈仕涵, 覃艳, 杨黄浩, 等. 基于大模型与多源数据融合的景区导览优化策略研究——以蜀南竹海为例[J]. 计算机科学与应用, 2025, 15(08): 104-118.
  8. [8] 王勇, 王夕琛, 曲创. 便捷经济:数实融合促进消费的机制与路径[J/OL]. 当代经济科学, 1-17[2026-05-29]. https://link.cnki.net/urlid/61.1400.F.20260421.1342.002.
联系我们
人工客服,稿件咨询
投稿
扫码添加微信
客服
置顶