我是陈衍鑫(Yanxin Chen),复旦大学人工智能方向博士在读,主要研究长视频理解与视频语言模型。
我的工作横跨模型架构与训练系统,重点关注视频模型如何在长上下文中有效推理,以及如何在大规模训练中保持效率和稳定性。
研究方向
长视频推理
研究模型如何检索、连接并推理分散在长视频中的证据,推动长视频理解从表层文本相似度走向结构化多模态理解。
流式视频语言模型
探索 cross-attention 架构与高效图文交互,使模型能够处理长视频和持续到达的视频流。
大规模训练系统
关注分布式 VLM 训练、激活重计算、FlashAttention,以及通信、显存、数据与训练框架之间的系统级问题定位。
代表工作
MOSS-VL
OpenMOSS · Core Contributor参与模型开源发布,负责四阶段预训练、完整 SFT 流程、消融实验和大规模训练验证。
ProEchoMem
SIGIR 2026 · 共同第一作者面向长视频理解的 probe-echo memory 框架,通过构建结构化情景记忆、激活相关证据并进行记忆合成,为后续推理提供更完整的上下文。
开源训练框架适配
LlamaFactory · ms-swift为两个框架加入原生 MOSS-VL 训练与推理支持,覆盖多模态数据处理、LoRA/全参数训练、checkpoint 工作流和专项回归测试。
经历
博士阶段之前,我曾在 CityU AML Lab 和复旦 NLP Group 参与多模态学习、检索增强生成、长视频理解和视频模型训练基础设施等方向的研究。
这些项目覆盖了从问题定义、模型设计和工程实现,到大规模训练验证的完整研究链路。
AI Infra 学习笔记