先讲一个反直觉的事实
很多人以为回传越勤、越实时,模型就学得越好。于是每个加粉事件都疯狂实时上报,甚至把中间态(点击、停留)也频繁回传。结果:回传量巨大,但模型优化反而变差,成本还上去了。
回传不是”报得越勤越好”,它有频次和节流的讲究。这篇文章讲回传频次怎么把握,才能既实时、又不给模型喂噪音。
回传过勤的两个问题
- 噪音变多:频繁回传中间态(点击、停留),等于给模型喂大量低价值信号,稀释了”加粉/成交”这些真信号。
- 模型过拟合:模型被高频次的重复信号带着走,过度聚焦在某个细粒度上,反而丧失泛化能力。
回传频次怎么把握
- 只回传关键事件:加粉成功、有效开口、成交这些真转化才回传,中间态(点击、浏览)原则上不回传。
- 事件去重:同一 click_id 的同一事件,只回传一次,靠幂等去重,不做重复上报。
- 合理节流:对高频事件(比如同一个用户短时间多次触发),做节流合并,避免刷屏。
用叮咚外链,回传的去重和节流可以自动配置,关键事件即触发即传,重复和中间态自动过滤。
什么时候才该”报勤一点”
- 归因窗口短、决策快的场景,回传要尽量实时,让模型及时吃到转化反馈。
- 转化稀疏的场景,每一条转化都珍贵,要保证及时、准确回传,别延迟。
注意:这里的”勤”是及时,不是重复。及时是好事,重复是坏事,别把两者搞混。
落地清单
- [ ] 只回传加粉/开口/成交关键事件,中间态不回传
- [ ] click_id 幂等去重已开启,不重复上报
- [ ] 高频事件已做节流合并
- [ ] 稀疏转化场景保证及时回传,不延迟
回传的质量,不在于”报了多少”,在于”报的对不对、重不重”。勤报关键事件、掐掉噪音和重复,模型才学得干净、学得准。