Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation
Kangning Zhang*, Haotian Fang*, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, Yong Yu.
CIKM 2026 · Co-first Author · Code

B.Eng. Student @ UM-SJTU Joint Institute, Shanghai Jiao Tong University
我是上海交通大学密西根学院(UM-SJTU Joint Institute)电子与计算机工程专业的本科生。我的兴趣集中在大语言模型的全链路训练(预训练、后训练、强化学习)与具身智能。
目前在 SJTU APEX 数据和知识管理实验室 担任科研助理。此前我在美团做生成式推荐方向的科研实习,在 SJTU X-Lance 实验室担任科研助理,并在上海将然科技有限公司担任过 Agent 开发工程师。研究成果包括 HCGRec(CIKM 2026,Co-first Author)、 CARing(ICLR 2027 在投,Co-first Author)和 Tool-call Reward Model (ICLR 2026 Poster)。
预训练、后训练与强化学习的完整管线:奖励模型、PPO/GRPO、信用分配与训练效率。
让模型在与环境的交互中学习和行动:embodied agents、VLA 与世界模型。
记忆与上下文管理、工具调用、RAG 检索管线,以及支撑 agent 的基础设施。
Kangning Zhang*, Haotian Fang*, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, Yong Yu.
CIKM 2026 · Co-first Author · Code
Kaisong Zhang*, Haotian Fang*, Junmeng Zhou, Hang Lv, Yulan Pan, Yanchao Tan.
ICLR 2027 在投 · Co-first Author · Code & Logs
将疾病名称与 ICD 本体路径压缩为三层 Semantic ID,通过临床语义对齐、 推理激活、coverage-reward GRPO 与多正例监督,改善多个正确诊断的覆盖。 在 MIMIC-III / IV 上,推理模式 R@30 为 46.04% / 46.52%。
Da Ma, Ziyue Yang, Hongshen Xu, Haotian Fang, Kai Yu, Lu Chen.
ICLR 2026 Poster
* Equal contribution.
CIKM 2026 论文官方代码:hint-aware GRPO + constrained decoding 的 Semantic ID 生成式推荐。
ICLR 2027 在投论文代码与实验日志:medical Semantic IDs、coverage-reward GRPO 与 multi-positive supervision,用于下一次就诊多标签诊断预测。
Devin upstream → OpenAI Responses / Anthropic Messages 兼容 API 代理(Go)。
「注意力计算器」复现与扩展:输入常数自动构造定积分恒等式证明,exact 模式输出 ℚ 上机器可检证书。
ZCode IDE 55 个版本逐版逆向拆解:签名快照、逐版 diff 与工作区上传机制分析报告。
2025 腾讯广告算法大赛 TAAC:全模态生成式推荐,HSTU 复现优化 + 混合负采样。
电子与计算机工程(Electrical and Computer Engineering)本科 · 2024.09 — 2028.06(预计)
全国中学生物理竞赛浙江省一等奖(2024)