把人物 / 商品 LoRA、多模型路由、自动评测与 Reward Model 接成可迭代的电商创意系统。
问题同一创意需求会产生大量候选,人工逐张挑选成本高;文字、商品一致性与营销价值也很难由单一分数覆盖。
决策训练 rank-32 人物 / 商品 LoRA,打通 API 与自托管模型路由;以 Rules、VLM-as-Judge、Reward Model 和 Hybrid Reward 联合评测。
结果构建 1,200 组 chosen / rejected 偏好对;隔离测试集 pairwise accuracy 超过 72%,Best-of-N Top-1 人工命中率由 45% 提升到 60%。
1,200偏好数据对
>72%Pairwise Accuracy
45→60%Top-1 人工命中
Qwen-ImageLoRAReward ModelVLM-as-JudgeBest-of-N
PRODUCT LORARANK 32
BASE→LORA
Rank-32 LoRA 验证HYBRID CHECKOCR FAIL
听见未未
RM .95→HYBRID .69
偏好高分,也不能越过硬约束CREATIVEALIGN · END-TO-END08 STAGES
PRODUCT LORA → REWARD MODEL从一副耳机,到可学习的人工偏好。
C01C02C03C04TOP-1C05OCRC06
LoRABriefR1—R4BTBest-of-N
1,200 PAIRS>72% PAIRWISE45→60% TOP-1
HUMAN CONFIRMEDC04 · 听见未来HYBRID