先看一个反直觉的结论
回传不是越多越好。同一个用户加粉,被重复上报三次,模型看到的不是”三个转化”,而是”加粉转化被放大了三倍”——它会去追那些本就容易加粉的人,而不是帮你去拓新。结果就是:短期报表好看,长期模型越学越窄,成本越跑越高。
这篇文章讲回传去重。它是回传配置里最不起眼、却最能直接影响模型质量的一环。
重复上报从哪来
- 同一个 click_id 多次回传:用户点了广告 → 加粉 → 又通过别的入口再触发一次,埋点没做幂等,同一个 click_id 回传了两次。
- 加粉与开口事件混报:一次加粉既报了”加粉成功”,又报了”有效开口”,如果模型里这两个事件都被当成转化,等于一次行为记了两笔。
- 秒删/无效加粉没过滤:加进来秒删、零互动的人,本不该作为转化回传,却原样喂给了模型。
去重的三个动作
- click_id 幂等:回传前用 click_id 做唯一键去重,同一个 click_id 同一种事件只允许上报一次。
- 事件分层:明确”加粉”和”开口”是两个不同层级的事件,别让一次行为同时命中多个转化事件。
- 无效过滤:把秒删、拉黑、零互动的”伪加粉”在回传前过滤掉,只把有效转化喂给模型。
这三个动作在叮咚外链后台都能通过回传规则配置完成,不用自己写代码。
为什么去重比加量更值钱
很多人优化回传的思路是”多回传、让模型多吃数据”。但模型要的是干净的真信号,不是被放大的假信号。
- 重复上报会让加粉成本虚低,误导你继续加预算。
- 无效加粉会让模型去追”容易加但留不住”的人,后链路(开口、成交)崩掉。
- 去重之后,回传量会下降,但模型找对人的能力会上升——短期报表会”难看”一点,长期成本是往下的。
落地清单
- [ ] 回传用 click_id 做唯一键,幂等去重已开启
- [ ] “加粉”与”开口”事件分层,不混报
- [ ] 秒删/拉黑/零互动的伪加粉已在回传前过滤
- [ ] 去重后回传量下降是预期内的,别慌着加回去
回传的本质是给模型喂”谁是对的”。喂重复和喂垃圾,都是在教模型做错题。把去重做干净,比多回传一万条都值。