推荐算法互动实验室 公开离线指标 · 合成交互演示

端到端推荐算法实验室

一条链路,解释推荐结果

从召回候选到重排、校准与可信离线评估

同一份用户、商品、历史和 metadata 协议贯穿召回与排序;广告 CVR 和 OPE 保持为独立数据任务,不拼接不存在的业务漏斗。

统一数据协议 读取中… 用户 / 商品 / 历史 / metadata
Two-Tower 学习检索向量 冻结查询与商品 embedding
HNSW Top-K 近似召回候选 对照 exact retrieval
Hard Negative 学习最接近的错误 对比 uniform / in-batch
DIN / DCN 候选重排 特征消融与冷启动分组
Calibration + Eval 校准并成对评估 用户级 bootstrap CI
开始 3 分钟演示
统一链路召回与 ANN点击 / 转化理解 OPE检查证据边界

FROZEN TEST · 端到端结果

先看证据,再看演示

统一 Amazon 协议贯穿召回与重排。下面全部来自冻结的公开离线聚合报告,不是合成指标,也不是线上 lift。

Dev 选中配置
读取中…
成对评估人口
读取中…
95% 用户级 CI
读取中…

区间在冻结离线协议下不跨 0;这不是在线显著性或业务收益声明。Test 在 dev 选择和 train-only calibration 冻结后只打开一次。

01

模型与负采样

同一 dev 人口 · NDCG@100

候选重排负样本召回NDCG

Hard negative 没有获胜;Uniform 在冻结 dev 上胜出。失败结果保留,不为叙事换模型。

02

Feature 消融

冻结 checkpoint 输入置零

    不是逐变体重训,因此只能解释冻结模型的特征依赖。

    03

    HNSW 权衡

    Recall–latency–size

    M / efSRecallp95索引

    本机进程计时,不是生产 SLA。

    04

    冷启动与数据边界

    只用严格早于评估事件的特征

    读取中…读取中…

    5-core 切分没有真实冷启动 support,因此不伪造冷启动效果;同时间戳样本只从 cohort 分析排除,主测试人口保持完整。

    公开数据 · 规模化补充验证

    从算法效果,走到系统规模

    主推荐效果仍以 冻结目录 的协议为准;这里单独展示更大公开数据上的检索、点击与转化验证,不混写成线上业务结果。

    01 · ANN 检索 读取中…

    真实公开商品去重目录

    ANN Recall@100
    本机 p95
    02 · CTR 预测 读取中…

    固定官方 parquet shard 全量行

    DeepFM ROC-AUC
    LogLoss
    03 · CVR / ESMM 读取中…

    含曝光、点击与转化标签的公开样本

    CTCVR ROC-AUC
    相对独立塔 Δ

    以上数字均从仓库内已冻结 JSON artifact 动态读取。百万级实验只支持本地 CPU 检索规模与延迟陈述;CTR/CVR 只支持公开离线评估陈述。

    STEP 1 · 第 1/3 步

    找商品

    几万个商品不可能全部精排。先根据用户历史,从全量商品中快速找到最可能感兴趣的一批。

    选择一位合成演示用户

    他最近看过
    合成样例中的下一件商品

    推荐结果

    读取中… 中找出的前 10 个

    相似商品召回 · 精确检索
    选择用户后,点击按钮生成推荐。
      查看技术细节召回算法、近似检索与真实离线指标

      召回算法

      检索方式

      公开数据
      亚马逊公开评论数据集 · 工业与科学品类
      评估用户
      读取中…
      评估方式
      保留最后一次行为 · 全训练商品目录

      热门召回和相似商品召回的前 10 个结果,来自同一份冻结公开数据切分的确定性回放。矩阵分解与双塔召回没有保存用户级模型检查点,因此页面不会生成替代推荐。近似检索召回率表示近似结果对精确结果的覆盖程度,不等于推荐相关性召回率。

      下一步:看系统怎样预测点击

      STEP 2 · 第 2/3 步

      预测点击

      候选商品找出来以后,再预测用户最可能点击哪个。

      选择离线模型

      合成交互样例 · 聚合指标来自公开实验

      模型给出的平均预测概率

      数值来自真实概率校准分组,不是这个人的单样本预测,也不是真实线上点击率。

      点击按钮读取冻结结果
      选择模型后查看公开离线结果。
      查看算法指标ROC-AUC、LogLoss、Brier、ECE
      合成展示样本
      公开数据
      Criteo 公开点击日志 · 固定子集
      切分
      读取中…
      特征
      读取中…

      冻结实验记录没有保存逐行预测。Criteo 对正负样本采用不同比例下采样,因此这里的概率不能直接解释为总体点击率。

      已执行 · 官方 Criteo impression 数据

      CVR / ESMM 不再是 synthetic smoke

      COMPLETE · OFFLINE
      模型 / 任务AUC ↑LogLoss ↓Brier ↓ECE ↓
      固定切分
      读取中…
      Test-once gate
      读取中…
      Artifact
      读取中…

      固定前 200,000 条 timestamp-sorted impressions;同一 population 同时含 click 与 conversion 标签。UID、标签、attribution 和点击后字段均未作为 feature。结果是三 seed 的公开离线测量,不代表在线 lift。

      下一步:看看“排第一”为什么会骗人