Type: entity
Confidence: 0.82
Created: 2026-04-16
Updated: 2026-04-16
Tags: AI工程

MetaFind

概述

MetaFind 是元宇宙/3D 场景感知的多模态资产检索系统,核心创新是 ESSGNN(场景感知等变图编码器)+ ULIP-2 三模态对齐,实现文本/图片/3D 模型任意组合查询,并能感知场景上下文(已有家具的风格/尺寸/功能关系)。

关键内容

  1. 双塔架构
  2. 画廊编码器(Gallery Encoder):提前编码所有 3D 资产(3D 形状+图像+文字描述)生成"数字暗号"(向量),离线存储
  3. 查询编码器(Query Encoder):将用户输入(文本/图片/3D 草稿任意组合)编码为同格式向量
  4. ULIP-2:统一翻译器,使文本/图片/3D 三模态向量可互相比较(三模态对比学习对齐)

  5. 核心创新 ESSGNN(Scene-Aware Equivariant Graph Scene Graph Neural Network)

  6. 将已有场景布局建模为图(节点=家具,节点特征=尺寸+风格+3D 位置,边=空间关系+功能关系)
  7. 保持 SE(3) 等变性:无论场景如何旋转/平移,相对关系保持不变(沙发在电视前方始终正确)
  8. 让查询编码器能"读懂整个场景上下文",推荐与已有家具风格/尺寸/功能匹配的资产

  9. 训练策略:两阶段训练(先学基础跨模态对齐,再针对场景感知微调)+ 鲁棒性优化(随机遮挡部分节点,防止过拟合)。

  10. 参考论文:ESSGNN 相关论文 arXiv:2510.04057(2.5 ESSGNN: Scene-Aware Equivariant Graph Encoder)。

  11. 典型应用场景:元宇宙装修助手——用户上传已有家具图片/3D 模型/文字描述,系统在资产库中找风格/功能/尺寸匹配的搭配建议。

来源

相关