我是陈衍鑫(Yanxin Chen),复旦大学人工智能方向博士在读,主要研究长视频理解与视频语言模型。

我的工作横跨模型架构与训练系统,重点关注视频模型如何在长上下文中有效推理,以及如何在大规模训练中保持效率和稳定性。

研究方向

长视频推理

研究模型如何检索、连接并推理分散在长视频中的证据,推动长视频理解从表层文本相似度走向结构化多模态理解。

流式视频语言模型

探索 cross-attention 架构与高效图文交互,使模型能够处理长视频和持续到达的视频流。

大规模训练系统

关注分布式 VLM 训练、激活重计算、FlashAttention,以及通信、显存、数据与训练框架之间的系统级问题定位。

代表工作

MOSS-VL

OpenMOSS · Core Contributor

参与模型开源发布,负责四阶段预训练、完整 SFT 流程、消融实验和大规模训练验证。

ProEchoMem

SIGIR 2026 · 共同第一作者

面向长视频理解的 probe-echo memory 框架,通过构建结构化情景记忆、激活相关证据并进行记忆合成,为后续推理提供更完整的上下文。

开源训练框架适配

LlamaFactory · ms-swift

为两个框架加入原生 MOSS-VL 训练与推理支持,覆盖多模态数据处理、LoRA/全参数训练、checkpoint 工作流和专项回归测试。

经历

博士阶段之前,我曾在 CityU AML Lab 和复旦 NLP Group 参与多模态学习、检索增强生成、长视频理解和视频模型训练基础设施等方向的研究。

这些项目覆盖了从问题定义、模型设计和工程实现,到大规模训练验证的完整研究链路。

AI Infra 学习笔记