个性化系统可以一边学习“给谁什么”,却不能因此兼任自己的实验裁判。它越快把流量给眼前表现好的动作,越可能减少公平比较,并把短期点击误当长期价值。AI-native 增长需要两套彼此制衡的能力:一套在明确边界内选择体验,另一套保留稳定对照,判断整套选择策略是否真的改善用户结果。
过去做个性化,常先把人分成“新用户、活跃用户、流失风险用户”,再为每组配置固定内容。问题是,同一个人会随任务、设备状态和时间变化:第一次连接设备时需要步骤,连接成功后再推步骤就是打扰;主动进入 AI 助手时需要回答,正在顺利完成任务时弹出提示反而中断。
Personalization Policy(个性化策略),大白话是:系统看到当前允许使用的情境后,用一套规则或模型决定“这一次给什么,或者什么都不给”。这里的 policy 不是一份运营方案,而是一个可执行的选择器。
生活类比是导航。它不会永久给一个人贴上“走高速的人”标签,而会根据当前位置、拥堵、目的地和道路限制,决定这一刻走哪条路。更重要的是:导航每次重新选路,不等于它已经证明新算法比旧算法更好。要判断整套导航是否改善到达时间与安全,仍要用独立评估比较新旧策略。
Momcozy APP 的待验证例子是设备绑定帮助。策略可以读取当前旅程节点、明确错误码、APP / 系统 / 固件版本和此前是否已展示帮助,在批准的低风险范围选择“展示步骤、继续等待、进入排障、交给人或不动作”。但它不能因为帮助卡点击高,就自行认定策略成功。真正结果可能是首次稳定连接、再次失败、正确接管与负面体验,而且部分结果需要等待。
这也解释了 Contextual Bandit(情境老虎机算法):它会在不同动作间保留少量探索,同时逐渐把更多机会分给在某类情境中表现较好的动作。它适合持续选择,却容易被奖励指标带偏。若奖励只写“点击帮助”,系统会越来越会制造点击;若结果延迟数周,它也无法像广告点击那样即时学习。因此,个性化策略负责选,随机实验负责判,不能揉成一个“自动优化黑箱”。
Spotify:把个性化当产品能力,把 A/B test 当独立裁判
Contextual bandit 能决定不同用户看哪个版本,但它本身是被评估的产品,不是天然可信的实验方法。
Spotify 2026 年 1 月公开说明,其机器学习栈负责实时个性化,实验平台 Confidence 负责把“新个性化系统”与旧系统或静态体验随机比较。文章指出,多臂老虎机常按一个即时指标动态倾斜流量,但真实产品需要同时看多个目标;只优化熟悉歌曲的即时收听,可能损害音乐发现和长期满意度。很多关键结果还要数周成熟,无法频繁更新流量权重。Spotify 因此没有把普通多臂老虎机用于实验分流;2025 年,仅移动端首页就有 58 个团队运行 520 个实验。
Netflix GenRec:LLM 能做推荐,也必须在真实流量中接受长期指标检验
模型离线排得更准,不等于用户长期体验更好;个性化系统仍要作为一个整体进入在线 A/B test。
Netflix 2026 年 7 月公开 GenRec:它把用户历史、内容和当前情境转成文字,让 LLM 对目录内内容排序,并用长期满意度代理信号与业务目标加权训练。离线阶段,GenRec 用约少 40 倍的第二阶段标注样本,相对成熟生产模型的 Mean Reciprocal Rank(平均倒数排名,衡量相关内容是否排得靠前)提升约 1.6%。随后 Netflix 仍用约 10% 流量运行约四周在线 A/B test,才观察短期与长期线上指标的显著改善。
先认识这个人,以及今天新增什么
Ronny Kohavi 曾负责微软实验平台,也做过 Amazon 个性化与 Airbnb 搜索实验。我们此前借他的访谈讲过 SRM(样本比例失配)和实验可信门;今天新增的是约 28:14–35:41 的 OEC(Overall Evaluation Criterion,整体评估标准):不是只问某个指标涨没涨,而是预先定义“什么样的整体变化才算长期好结果”。
核心机制:优化目标必须带着代价
Ronny 举搜索广告为例:多放广告一定能抬高短期收入,但可能让用户更慢找到结果并增加流失。正确目标不是裸收入,而是“在用户体验预算或护栏内提高长期价值”。这叫 constraint optimization(约束优化):系统可以追求一个目标,但不得越过明确限制。
访谈里更直接的例子来自 Amazon 推荐邮件。团队最初把“用户从邮件进入后购买”都记成邮件贡献,于是多发邮件就能让归因收入上升,系统自然学会发送更多。后来团队把退订造成的未来价值损失纳入评价;Ronny 说,加入这项代价后,超过一半正在发送的 campaign(触达活动)变成负价值。更细的“只退订某类邮件”又降低了全局退订伤害。
AI 改变了哪一步
过去,错误目标让人按月多发一些;AI 可以实时选人、选内容、选频次,因而会更快放大目标漏洞。反过来,AI 也能持续估计不同动作对长期结果、退订、重复失败和人工接管的影响,但前提是人先定义成功、代价与禁止项,并用长期实验校准这些代理指标。
最容易误解的是把 OEC 当作“一条万能总分”。总分会隐藏冲突,所以高风险指标仍应是硬护栏:涉及隐私、设备安全、儿童或健康语境,不能用更多转化抵消一次严重伤害。Momcozy 也不能照搬 Amazon 邮件频率或 Netflix 内容推荐;设备任务低频、结果延迟、错误代价更高。
我们能借什么
每个个性化动作先写五项:希望改变的真实结果、允许使用的情境、动作选项、长期代价、不可突破的护栏。然后让策略学习“何时行动、何时不动作”,再用独立对照评估整套策略。这样 AI 学习的是受约束的用户价值,不是最快上涨的活动指标。
以“绑定帮助个性化策略”为例。
系统读取什么:经批准的旅程节点、真实曝光、明确错误与版本、此前动作、稳定任务结果、再次失败、正确接管和负面 VOC。数据按当前目的最小化使用;母婴、儿童、健康和设备数据不得跨场景拼成营销画像。
形成什么判断:估计当前情境下“展示步骤、继续等待、进入排障、交给人、不动作”各自的预期结果与不确定性,同时检查频控、安全和隐私限制。证据不足时,“不动作”是合法答案。
能做什么:在已批准的影子模式或低风险范围生成动作建议;保留稳定随机对照;记录策略版本、选择概率和真实曝光。未经明确授权,不发送 Push、EDM、站内信,不修改生产策略,不根据推断的孕产育阶段自动触达。
如何看结果并更新策略:执行层可根据已成熟、低风险结果更新候选排序;评估层独立比较新策略、旧策略与不动作基线,同时看稳定任务、重复失败、留存、负面 VOC 和接管质量。点击上升但稳定结果不变,策略不能升级;短期改善但信任护栏变差,应停止。
何时交给人:健康或儿童语境、设备安全、连续失败、敏感信息、结果冲突、样本不足、奖励定义变化和任何放量。AI 自动生成个性化内容仍是 AI-assisted Operations(AI 辅助运营);系统持续感知、在权限内选动作、接受独立实验约束并从长期结果更新策略,才接近 AI-native Growth System(AI 原生增长系统)。
场景一:设备绑定与首次稳定价值。 待验证假设是,同一个帮助对明确权限卡点可能有效,对硬件或固件故障则会延误排障。可以先在离线历史样本中模拟策略,只输出“建议动作 + 理由 + 不确定性”,再检查人是否同意。不能只奖点击或一次连接;最先要的证据是哪些动作前信号能区分“可帮助摩擦、需要等待、必须接管”。
场景二:AI 助手首次价值。 待验证假设是,新用户可能需要示例问题,已有明确任务的人更需要直接回答。策略可以基于当前会话内、已授权的低风险上下文选择“给示例、直接回答、澄清或接管”,不能读取敏感历史来提高推荐接受率。最先需要定义的不是会话量,而是合格任务安全解决或正确接管,并保留结果未知状态。
场景三:BBM/VOC 与阶段变化。 系统可以从聚合、脱敏反馈发现某类帮助需求增加,但不能据此推断个人处于某个孕产育阶段并主动促销。可借动态策略的“当前情境优先、证据会过期”,不可照抄流媒体的长期行为画像。任何涉及儿童、健康或主动触达的动作都需要明确授权、频控、停止条件与人工接管。
可以借什么、不能照抄什么:可以借“执行策略与评估裁判分开”、长期目标、硬护栏和不动作选项;不能照抄 Spotify / Netflix 的高频推荐和丰富画像。Momcozy 首先应建立一个窄任务的可解释策略,而不是做一个覆盖全旅程的黑箱推荐引擎。
- Personalization Policy|个性化策略:根据当前情境选择一个动作或不动作。Momcozy 例子:在绑定卡点选择步骤、等待、排障或接管。
- Contextual Bandit|情境老虎机算法:一边少量尝试不同动作,一边把更多机会给当前看来更有效的动作。Momcozy 只能在低风险、可回滚、奖励可靠的场景探索。
- Policy Evaluation|策略评估:不只评价某条文案,而是判断整套“给谁什么”的规则是否优于旧策略。Momcozy 例子:比较个性化帮助策略与固定帮助流程的稳定任务结果。
- OEC / Overall Evaluation Criterion|整体评估标准:把长期价值、主要目标和代价放进同一决策规则。Momcozy 例子:稳定连接改善,同时重复失败和负面体验不能恶化。
- Guardrail Metric|护栏指标:即使主指标上涨也不能被突破的红线。Momcozy 例子:隐私投诉、错误设备指导或高风险漏接管一旦触线就停止。
- 选一个窄场景:设备绑定出现明确卡点;
- 写五个动作:展示步骤、继续等待、进入排障、交给人、不动作;
- 每个动作只写一条允许使用的动作前证据;
- 定义一个真实结果、两个长期代价和两个不可抵消的硬护栏;
- 写清新策略如何与旧策略独立比较,而不是用自己优化的点击率给自己判胜。
产出物是一页“情境—动作—结果—代价—护栏—对照”策略卡。完成后能更新的判断是:我们要做的是更聪明地分发内容,还是建立一套会选择、会克制、也愿意接受独立检验的增长策略?最后只回答一个具体问题:在 Momcozy APP 当前最想个性化的一个场景里,哪项短期指标最容易把 AI 带偏,而哪个更慢的结果才应该拥有最终裁决权?