Type: concept
Confidence: 0.85
Created: 2026-04-16
Updated: 2026-04-16
Tags: AI工程

学习排序

概述

学习排序(Learning to Rank, LTR)是搜索排序模型的机器学习范式,用人工标注的查询-文档相关性数据训练排序模型,是传统 BM25 向神经排序演进的关键中间阶段。工业级搜索中常用于两阶段检索的第二阶段精排

关键内容

  1. 三种建模范式
  2. Pointwise:独立预测每个文档的相关性分数,回归/分类问题,简单但忽略文档间关系
  3. Pairwise:预测两文档哪个更相关,RankSVM 的基础,比 Pointwise 更符合排序任务
  4. Listwise:直接优化整个排名列表的评估指标(NDCG/MAP),LambdaMART 是代表

  5. 主流 LTR 模型

  6. RankSVM:最大化相关文档对间的 margin
  7. LambdaMART:梯度提升树(GBDT)+ Lambda 梯度,直接优化 NDCG,工业界最广泛使用的传统 LTR 算法

  8. 特征工程(传统 LTR 的核心):

  9. 查询-文档特征:TF-IDF/BM25 分数、查询词覆盖率、最小词距
  10. 文档特征:PageRank/入链数量、文档长度、URL 深度、内容新鲜度
  11. 查询特征:查询长度、查询频率(是否热门查询)
  12. 交互特征:点击率(CTR)、停留时间(Dwell Time)、跳出率

  13. 排序演进谱系:布尔模型 → 向量空间模型TF-IDF)→ 概率模型(BM25)→ LTR(RankSVM/LambdaMART)→ 神经排序(BERT/DPR/ColBERT)。

  14. 两阶段检索中的定位:第一阶段 BM25+WAND 高效召回 Top-1000(延迟<20ms),第二阶段 LTR 或神经重排器(BERT reranker)精排(延迟<100ms),最终返回 Top-10。

  15. 评估指标:NDCG@K(归一化折扣累积增益)、MAP(平均精度均值)、MRR(平均倒数排名)。

来源

相关