长上下文 · 高效注意力
生成式推荐基础模型
设计基于 Transformer / HSTU 的长上下文模型,升级 Varlen Flash Attention 与 Dynamic Batch,解决推荐行为序列中的长期依赖和中长尾建模。
你好,我是
哈尔滨工业大学计算机专业本硕,5年大模型、搜索与推荐算法研发经验。聚焦 Foundation Model 预训练、模型 Scaling、长上下文建模及高效推理。
WHAT I DO
具备从数据构建、模型架构、规模化训练、性能优化到线上部署的完整经验,拥有万卡集群训练推理协作及 10 人以上技术团队管理经验。
FEATURED WORK
从研究原型到全量部署,持续以模型规模、计算效率和业务收益验证技术价值。
长上下文 · 高效注意力
设计基于 Transformer / HSTU 的长上下文模型,升级 Varlen Flash Attention 与 Dynamic Batch,解决推荐行为序列中的长期依赖和中长尾建模。
预训练 · Scaling · 万卡集群
带队 7 人搭建数据、模型、训练、评测与部署 Pipeline,将 Dense 模型扩展至 4B、稀疏模型扩展至百 T 参数、上下文扩展至 110K。
后训练 · 用户理解
打通“用户信息—LLM 兴趣推理—标签生成—下游召回”链路,通过 CoT、Few-shot 与 Qwen3 知识蒸馏提升新用户和低活用户体验。
EXPERIENCE
连续多次 TOP 30% 绩效
连续 TOP 10% 绩效 · 连续晋升三级 · 部门卓越之星
EDUCATION & INTERNSHIPS
计算机科学与技术 · 自然语言处理与人机对话
成绩 90.75 · TOP 0.5%计算机科学与技术
成绩 88.98 · TOP 4%首页推荐算法工程师 · 2020.07—2020.09
OCR 文案可用率 90% → 95%,在线透出率 +7%算法工程师 · 2020.04—2020.07
Slot Filling 准确率 45% → 86%ACHIEVEMENTS
全国大学生数学建模竞赛国家二等奖;CCF 语言与智能技术竞赛 18/163、20/93;京东对话挑战 16/256。
奖学金累计 20w+;国家级奖项 2 项、省级 1 项、校级 20 余项。
A 会一作 2 篇,一作期刊 2 篇;专利 6 篇(其中一作 3 篇);软件著作权 1 篇。
LET'S CONNECT
大模型、搜索推荐、长上下文建模与高效推理。