
方皓天 Haotian Fang
B.Eng. Student @ UM-SJTU Joint Institute, Shanghai Jiao Tong University
About Me
我是上海交通大学密西根学院(UM-SJTU Joint Institute)电子与计算机工程专业的本科生。我的兴趣集中在大语言模型的全链路训练(预训练、后训练、强化学习)与具身智能。
目前在 SJTU APEX 数据和知识管理实验室 担任科研助理。此前我在美团做生成式推荐方向的科研实习,在 SJTU X-Lance 实验室担任科研助理,并在上海将然科技有限公司担任过 Agent 开发工程师。研究成果包括一篇 CIKM 2026 论文(HCGRec)和一篇 ICLR 2026 Poster(Tool-call Reward Model)。
Research Interests
LLM 全链路训练
预训练、后训练与强化学习的完整管线:奖励模型、PPO/GRPO、信用分配与训练效率。
具身智能
让模型在与环境的交互中学习和行动:embodied agents、VLA 与世界模型。
Agent 系统
记忆与上下文管理、工具调用、RAG 检索管线,以及支撑 agent 的基础设施。
Experience
科研助理 (RA) · SJTU APEX Lab
- 在 SJTU APEX 数据和知识管理实验室 担任科研助理(Research Assistant)。
科研助理 (RA) · X-Lance Lab, SJTU
- 产出论文 Empowering LLM Tool Invocation with a Tool-Call Reward Model(ICLR 2026 Poster 已接收)。
- 提出 Tool-call Reward Model (TRM):将过程奖励模型引入工具调用场景,设计「必要性×质量」标注准则与 turn-level 信用分配。
- 在搜索问答与代码数学任务上,使 Qwen2.5 系列 1.5B–7B 模型一致超越 outcome-only RL 基线。
Agent 开发工程师 · 上海将然科技有限公司
- 构建通用型记忆与上下文控制中间件:异步记忆沉淀机制将短期会话转化为长期用户画像。
- 设计多管道并行召回框架与「元数据 + 关键词 + 向量」三路混合检索,评测选定 bge-m3 / bge-reranker。
- 自研覆盖版式分析、共指消解、时间处理的文档预处理管道,支撑高质量下游检索。
Selected Open-Source Projects
CIKM 2026 论文官方代码:hint-aware GRPO + constrained decoding 的 Semantic ID 生成式推荐。
Devin upstream → OpenAI Responses / Anthropic Messages 兼容 API 代理(Go)。
「注意力计算器」复现与扩展:输入常数自动构造定积分恒等式证明,exact 模式输出 ℚ 上机器可检证书。
ZCode IDE 55 个版本逐版逆向拆解:签名快照、逐版 diff 与工作区上传机制分析报告。
2025 腾讯广告算法大赛 TAAC:全模态生成式推荐,HSTU 复现优化 + 混合负采样。
Education
上海交通大学 · 密西根学院(UM-SJTU Joint Institute)
电子与计算机工程(Electrical and Computer Engineering)本科 · 2024.09 — 2028.06(预计)
全国中学生物理竞赛浙江省一等奖(2024)