跳到主要内容
Haotian Fang's avatar

方皓天 Haotian Fang

B.Eng. Student @ UM-SJTU Joint Institute, Shanghai Jiao Tong University

About Me

我是上海交通大学密西根学院(UM-SJTU Joint Institute)电子与计算机工程专业的本科生。我的兴趣集中在大语言模型的全链路训练(预训练、后训练、强化学习)与具身智能。

目前在 SJTU APEX 数据和知识管理实验室 担任科研助理。此前我在美团做生成式推荐方向的科研实习,在 SJTU X-Lance 实验室担任科研助理,并在上海将然科技有限公司担任过 Agent 开发工程师。研究成果包括一篇 CIKM 2026 论文(HCGRec)和一篇 ICLR 2026 Poster(Tool-call Reward Model)。

Research Interests

🧠

LLM 全链路训练

预训练、后训练与强化学习的完整管线:奖励模型、PPO/GRPO、信用分配与训练效率。

🤖

具身智能

让模型在与环境的交互中学习和行动:embodied agents、VLA 与世界模型。

⚙️

Agent 系统

记忆与上下文管理、工具调用、RAG 检索管线,以及支撑 agent 的基础设施。

Experience

至今

科研助理 (RA) · SJTU APEX Lab

2025.09 — 2026.09

科研实习(生成式推荐) · 美团

  • 产出论文 HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDsCIKM 2026code)。
  • 针对 Semantic ID 生成式推荐中 GRPO 的同质零奖励问题,提出 hint-conditioned 训练框架与 hint-aware credit decomposition。
  • 将 zero-advantage 训练样本占比从 70%+ 降至 20% 以下,HR@K / NDCG@K 多项指标持续提升。
曾任

科研助理 (RA) · X-Lance Lab, SJTU

  • 产出论文 Empowering LLM Tool Invocation with a Tool-Call Reward ModelICLR 2026 Poster 已接收)。
  • 提出 Tool-call Reward Model (TRM):将过程奖励模型引入工具调用场景,设计「必要性×质量」标注准则与 turn-level 信用分配。
  • 在搜索问答与代码数学任务上,使 Qwen2.5 系列 1.5B–7B 模型一致超越 outcome-only RL 基线。
2025.03 — 2025.09

Agent 开发工程师 · 上海将然科技有限公司

  • 构建通用型记忆与上下文控制中间件:异步记忆沉淀机制将短期会话转化为长期用户画像。
  • 设计多管道并行召回框架与「元数据 + 关键词 + 向量」三路混合检索,评测选定 bge-m3 / bge-reranker。
  • 自研覆盖版式分析、共指消解、时间处理的文档预处理管道,支撑高质量下游检索。

Selected Open-Source Projects

Education

上海交通大学 · 密西根学院(UM-SJTU Joint Institute)

电子与计算机工程(Electrical and Computer Engineering)本科 · 2024.09 — 2028.06(预计)

全国中学生物理竞赛浙江省一等奖(2024)