第 1 / 3 轮 · TOP-3 排位赛
看偏好,把三件商品排好。
人物、候选与标准顺序均为教学模拟,不是线上用户、模型预测或真实 benchmark。
本轮模拟用户
正在读取…
你的推荐结果
按顺序选 3 件
候选商品点击加入下一名
点击候选加入排名;选中后可上移、下移或移除。所有得分只用于这局教学模拟。
教学模拟反馈
结果
参考顺序来自本页预设的确定性教学规则,不是模型输出,也不用于证明推荐效果。
STEP 1 · 第 1/3 步
找商品
几万个商品不可能全部精排。先根据用户历史,从全量商品中快速找到最可能感兴趣的一批。
选择一段合成浏览历史
推荐结果
从 读取中… 中找出的前 10 个
查看技术细节召回算法、近似检索与真实离线指标
召回算法
检索方式
- 公开数据
- 亚马逊公开评论数据集 · 工业与科学品类
- 评估用户
- 读取中…
- 评估方式
- 保留最后一次行为 · 全训练商品目录
上方三组浏览历史与推荐列表是明确标注的合成概念样例,不来自真实用户。技术细节中的聚合指标来自冻结公开数据实验记录。矩阵分解与双塔召回没有保存用户级模型检查点,因此页面不会生成替代推荐。近似检索召回率表示近似结果对精确结果的覆盖程度,不等于推荐相关性召回率。
STEP 2 · 第 2/3 步
预测点击
候选商品找出来以后,再预测用户最可能点击哪个。
选择离线模型
公开测试集概率校准分组
模型给出的平均预测概率
数值来自冻结的概率校准分组,不对应下方展示的单行特征,也不是真实线上点击率。
查看算法指标ROC-AUC、LogLoss、Brier、ECE
- 公开数据
- Criteo 公开点击日志 · 固定子集
- 切分
- 读取中…
- 特征
- 读取中…
冻结实验记录没有保存逐行预测。Criteo 对正负样本采用不同比例下采样,因此这里的概率不能直接解释为总体点击率。
STEP 3 · 第 3/3 步
为什么排第一的不一定最好
排第一的商品天然更容易被点击,所以点击多不一定代表用户更喜欢。
怎样估计真实效果
一句话解释:排在第一位更容易被看见,因此“第一名点击更多”不等于商品本身更相关。
查看技术细节权重截断、有效样本量、倾向概率与实验范围
最小倾向概率
- 公开数据
- Open Bandit 公开数据集 · 完整归档
- BTS
- 读取中…
- Random
- 读取中…
- Reference
- 读取中…
这里的倾向概率表示日志策略在某个位置选择某件商品的概率,不是用户查看该位置的概率。实验可以诊断策略选择偏差,但不证明已经消除所有位置查看偏差。