2027 GRADUATE · BUPT M.ENGAIGC APPLICATION ALGORITHMHANGZHOU · CHINA

YINHAISEN

公关照
REAL SELF / 01公关照
REAL SELF / 01公关照
10S AUTO PREVIEW
SCROLL TO EXPLORE
01 / ABOUT

我做AIGC 应用算法,让生成模型真正进入业务,持续创造用户价值与商业结果。

从 MADDPG、MAPPO 到 PPO、GRPO、DPO,我做过多条强化学习与后训练链路; 也把 AIGC 内容做到 40 万+ 全网粉丝,跑通生产、分发与转化。模型、产品与商业三条链路,我都亲自跑过。

02 / EXPERIENCE × SYSTEMS

EXPERIENCE

经历、项目、结果和可操作 Demo 放在同一张证据卡里;直接看我做了什么,也可以进入项目分身继续追问。

01
蚂蚁集团 · AIGC 算法实习生 · 2026—NOW

多模态素材生成与偏好对齐闭环

把人物 / 商品 LoRA、多模型路由、自动评测与 Reward Model 接成可迭代的电商创意系统。

问题

同一创意需求会产生大量候选,人工逐张挑选成本高;文字、商品一致性与营销价值也很难由单一分数覆盖。

决策

训练 rank-32 人物 / 商品 LoRA,打通 API 与自托管模型路由;以 Rules、VLM-as-Judge、Reward Model 和 Hybrid Reward 联合评测。

结果

构建 1,200 组 chosen / rejected 偏好对;隔离测试集 pairwise accuracy 超过 72%,Best-of-N Top-1 人工命中率由 45% 提升到 60%。

1,200偏好数据对
>72%Pairwise Accuracy
45→60%Top-1 人工命中
Qwen-ImageLoRAReward ModelVLM-as-JudgeBest-of-N
打开 Demo
PRODUCT LORARANK 32
BASELORA
Rank-32 LoRA 验证
HYBRID CHECKOCR FAIL
听见未未
RM .95HYBRID .69
偏好高分,也不能越过硬约束
CREATIVEALIGN · END-TO-END08 STAGES
PRODUCT LORA → REWARD MODEL从一副耳机,到可学习的人工偏好。
C01C02C03C04TOP-1C05OCRC06
LoRABriefR1—R4BTBest-of-N
1,200 PAIRS>72% PAIRWISE45→60% TOP-1
HUMAN CONFIRMEDC04 · 听见未来HYBRID
02
清华大学 AIR 智能产业研究院 · 强化学习算法实习生 · 2024—2025

GUI Agent 的 SFT 与过程奖励后训练

把 UI 状态、可执行轨迹、过程奖励和策略优化连接起来,让 Agent 不只会回答,也真正能完成端上动作。

问题

GUI 长轨迹只有最终成功 / 失败标签,无法定位中间哪一步偏离;原始界面数据也不利于稳定学习可执行动作。

决策

将 Android view hierarchy XML 剪枝、语义抽取并归一化为 UTG;把坐标手势转成 code-as-action DSL。以规则过程奖励 + 结果锚定构造标签,蒸馏 PRM 后接入 PPO。

结果

覆盖状态表示、动作语言、SFT、奖励建模、策略优化和端上执行;在 AitW 评测动作准确率,并以 AndroidWorld 完成可交互端到端任务验证。

XML→UTG语义状态表示
ORM→PRM过程奖励建模
4 ROLESPPO 模型职责
GUI AgentUTGSFTPRMPPO / GRPO / DPO
打开 Demo
STATE COMPILERXML→UTG
Semantic State
PROCESS REWARDANCHORED
RULESOUTCOMEPRM
Step Credit
AIR GUI AGENT · END-TO-END07 STAGES
XMLUTGDSLPRMPPO
AitWSFT DATAAndroidWorldINTERACTIVE EVALWebArenaRL METHOD
03
AIGC 内容生成自媒体 · 独立开发者 · 2024—NOW

AIGC 内容生产与商业转化引擎

从人物一致性和视频渲染,一路做到脚本、字幕、发布、社群与 App 转化,把模型能力变成长期运营的产品。

问题

人物类 AIGC 内容容易出现身份漂移、动作失真和生产链路割裂,单条样片很难稳定转化为持续内容供给。

决策

自建数据训练人物 LoRA,以 ControlNet / IP-Adapter 控制身份与动作;改写工作流接通文案、渲染、字幕与一键发布。

结果

独立跑通生产、分发、社群 / 私域与自研 App 的完整商业链路,形成 40 万+全网累计粉丝的真实用户验证。

40万+累计粉丝
0→1独立搭建
FULL生产到转化
Stable DiffusionCharacter LoRAControlNetIP-AdapterAutomation
打开 Demo
IDENTITY LOCKLOCKED
AI 虚拟人物 LoRA 六视角身份数据集6-VIEW / CONSISTENT
LORAIP-ACN
Identity Dataset
DISTRIBUTION04
身份特写
CLOSE-UP
多角度一致性
ANGLE
全身动作
POSE
最终成片
FINAL
内容社群APP
Publish Once
EPISODE 042READY
身份特写内容帧
01 / CLOSE-UP身份特写
多角度一致性内容帧
02 / ANGLE多角度一致性
全身动作内容帧
03 / POSE全身动作
最终成片内容帧
04 / FINAL最终成片
  1. SCRIPT
  2. RENDER
  3. SUBTITLE
  4. PUBLISH
03 / RESEARCH

论文与研究

两篇通信领域会议一作已发表、一篇一作在投;从多智能体强化学习到 Diffusion 决策,始终围绕可靠、高效的序列决策。

PUBLIC METHOD REPLAY / RESEARCH LAB

奖励如何改变策略,Diffusion 又如何生成路由?

把三条一作研究线放进同一个公开安全实验台:切换 MADDPG、MAPPO、过程奖励与 Diffusion,观察动态拓扑、训练信号和去噪决策的作用位置。

打开研究 Demo
公开论文方法回放 + 合成数据,不把演示曲线表述为个人实验结果。
PIMRC 路由方法原创合成可视化
01 / 一作 · 已发表PIMRCREWARD ITERATION
ICC 路由方法原创合成可视化
02 / 一作 · 已发表ICCPROCESS CREDIT
GLOBECOM 路由方法原创合成可视化
03 / 一作 · 在投GLOBECOMDIFFUSION ROUTING

原创合成方法视觉 · 不作为论文实验截图或性能数字。

PIMRC 无人机路由研究视觉一作 · 已发表
01一作 · 已发表
PIMRC

LLM × MADDPG:面向无人机多智能体路由的奖励优化

利用 LLM 迭代优化 MADDPG 奖励函数,改善复杂网络环境下的收敛与训练稳定性,缓解稀疏奖励导致的震荡。

ICC 无人机路由研究视觉一作 · 已发表
02一作 · 已发表
ICC

MAPPO 与过程奖励:动态拓扑下的连续路由决策

引入过程奖励、经验过滤与并行训练,加速冗余路由任务收敛,提升动态拓扑中的决策效率、鲁棒性与执行可靠性。

GLOBECOM 无人机路由研究视觉一作 · 在投
03一作 · 在投
GLOBECOM

Diffusion 路由决策与截断式去噪采样

用 Diffusion 建模路由决策分布,通过截断式去噪减少反向扩散步数,在兼顾路由质量的同时降低推理时延。

04 / EDUCATION

教育与能力

硕士 · 通信工程

北京邮电大学

信息与通信工程学院 · GPA 3.85 · 专业排名 2 / 35

本科 · 通信工程

北京邮电大学

信息与通信工程学院

HONORS & AWARDS
01国家奖学金02全国大学生数学竞赛一等奖03连续 3 年“互联网+”大创赛北京市一等奖04全国大学生计算机设计大赛全国二等奖05北京市三好学生06英语六级口语 A07华为昇腾优秀营员
05 / CONTACT
LET'S BUILDSOMETHING REAL.