多模态融合
概述
多模态融合是将来自不同模态(图像、文本、光谱、结构化数据等)的信息进行整合,以提升识别和决策准确性的技术。在得物鉴别业务中,鉴别不仅依赖图像,还需融合商品来源信息、版本信息、材质光谱数据、工艺标准文本等跨模态信息。
关键内容
- 鉴别业务的多模态数据:
- 图像模态:商品外观照片、细节特写(Logo、缝线、印刷位)
- 文本模态:工艺标准文档、版本信息、来源信息
- 光谱模态:材质光谱数据(包装材质、乳液成分)
- 结构化数据:品牌、品类、批次、产地等元数据
- 核心技术:
- 多模态大模型微调:在通用多模态模型基础上,针对鉴别场景做领域适配
- 特征融合:跨模态特征对齐与融合,提升单一模态无法捕捉的鉴别信号
- 检索匹配:多模态检索,将待鉴别商品与正品样本库进行跨模态匹配
- 与细粒度视觉识别的关系:多模态融合是对纯视觉鉴别的补充,当图像模态不足以区分时,引入其他模态信息提升判别力。
来源
- raw/articles/essays/thinking-series/013-得物面试 — 全文