细粒度视觉识别
概述
细粒度视觉识别(Fine-grained Visual Recognition)是计算机视觉的子领域,专注于区分同一超类下的相似子类别(如不同品种的鸟、不同品牌的鞋)。核心难点在于类间差异极小(像素级偏差)而类内差异极大(不同批次、产地、拍摄条件)。
关键内容
- 四大核心难点:
- 类间差异极小、类内差异极大:正品与高仿差异可能仅几像素,而同一商品不同批次工艺差异显著
- 数据分布极不均衡:热门品类数十万样本,小众品牌仅几百样本,冷启动困难
- 场景鲁棒性要求高:生产环境拍摄角度、光照、设备差异大,不能仅依赖实验室完美数据
- 正负样本风险不对等:漏检(假货判正品)后果远严重于误检
- 优化方案:
- 分层注意力机制:聚焦核心鉴别区域(鞋标、五金、印刷位)
- 对比学习:拉大正品与高仿特征距离,缩小正品类内差异
- 小样本学习 + Few-shot 微调:预训练通用特征提取器,新类目快速适配
- 域自适应训练 + 异常检测:适应不同拍摄场景,质量不达标图像提示重拍
- 损失函数加权:给漏检样本更高惩罚权重,分级判定阈值
来源
- raw/articles/essays/thinking-series/013-得物面试 — 全文