模型与负采样
同一 dev 人口 · NDCG@100
| 候选 | 重排 | 负样本 | 召回 | NDCG |
|---|
Hard negative 没有获胜;Uniform 在冻结 dev 上胜出。失败结果保留,不为叙事换模型。
端到端推荐算法实验室
从召回候选到重排、校准与可信离线评估
同一份用户、商品、历史和 metadata 协议贯穿召回与排序;广告 CVR 和 OPE 保持为独立数据任务,不拼接不存在的业务漏斗。
FROZEN TEST · 端到端结果
统一 Amazon 协议贯穿召回与重排。下面全部来自冻结的公开离线聚合报告,不是合成指标,也不是线上 lift。
区间在冻结离线协议下不跨 0;这不是在线显著性或业务收益声明。Test 在 dev 选择和 train-only calibration 冻结后只打开一次。
同一 dev 人口 · NDCG@100
| 候选 | 重排 | 负样本 | 召回 | NDCG |
|---|
Hard negative 没有获胜;Uniform 在冻结 dev 上胜出。失败结果保留,不为叙事换模型。
冻结 checkpoint 输入置零
不是逐变体重训,因此只能解释冻结模型的特征依赖。
Recall–latency–size
| M / efS | Recall | p95 | 索引 |
|---|
本机进程计时,不是生产 SLA。
只用严格早于评估事件的特征
5-core 切分没有真实冷启动 support,因此不伪造冷启动效果;同时间戳样本只从 cohort 分析排除,主测试人口保持完整。
公开数据 · 规模化补充验证
主推荐效果仍以 冻结目录 的协议为准;这里单独展示更大公开数据上的检索、点击与转化验证,不混写成线上业务结果。
真实公开商品去重目录
固定官方 parquet shard 全量行
含曝光、点击与转化标签的公开样本
以上数字均从仓库内已冻结 JSON artifact 动态读取。百万级实验只支持本地 CPU 检索规模与延迟陈述;CTR/CVR 只支持公开离线评估陈述。
STEP 1 · 第 1/3 步
几万个商品不可能全部精排。先根据用户历史,从全量商品中快速找到最可能感兴趣的一批。
选择一位合成演示用户
推荐结果
召回算法
检索方式
热门召回和相似商品召回的前 10 个结果,来自同一份冻结公开数据切分的确定性回放。矩阵分解与双塔召回没有保存用户级模型检查点,因此页面不会生成替代推荐。近似检索召回率表示近似结果对精确结果的覆盖程度,不等于推荐相关性召回率。
STEP 2 · 第 2/3 步
候选商品找出来以后,再预测用户最可能点击哪个。
选择离线模型
合成交互样例 · 聚合指标来自公开实验
数值来自真实概率校准分组,不是这个人的单样本预测,也不是真实线上点击率。
冻结实验记录没有保存逐行预测。Criteo 对正负样本采用不同比例下采样,因此这里的概率不能直接解释为总体点击率。
已执行 · 官方 Criteo impression 数据
| 模型 / 任务 | AUC ↑ | LogLoss ↓ | Brier ↓ | ECE ↓ |
|---|
固定前 200,000 条 timestamp-sorted impressions;同一 population 同时含 click 与 conversion 标签。UID、标签、attribution 和点击后字段均未作为 feature。结果是三 seed 的公开离线测量,不代表在线 lift。
STEP 3 · 第 3/3 步
排第一的商品天然更容易被点击,所以点击多不一定代表用户更喜欢。
怎样估计真实效果
一句话解释:排在第一位更容易被看见,因此“第一名点击更多”不等于商品本身更相关。
最小倾向概率
这里的倾向概率表示日志策略在某个位置选择某件商品的概率,不是用户查看该位置的概率。实验可以诊断策略选择偏差,但不证明已经消除所有位置查看偏差。