独家|混元多模态理解负责人胡瀚离职创业,原团队或将聚焦世界模型

前微软亚研院视觉专家胡瀚加盟腾讯,执掌混元多模态大模型

据AI科技评论独家报道,前微软亚洲研究院视觉计算组首席研究员胡瀚已于近期正式加入腾讯,接替此前离职的腾讯混元大模型技术负责人刘威,全面负责多模态大模型的研发工作。这一人事变动标志着腾讯在AI视觉与多模态领域的技术路线迎来重要调整,业内普遍认为胡瀚的加入将加速混元大模型在图像、视频理解等方向的突破。

刘威离职后,腾讯混元多模态由胡瀚接棒

去年11月,腾讯杰出科学家、混元大模型技术负责人之一刘威被曝从腾讯离职,其去向尚未公开。刘威曾与张潼、俞栋并称为腾讯AI Lab“三剑客”,于2016年加入腾讯。胡瀚的接任填补了这一关键空缺,其研究方向与多模态大模型高度契合——他长期深耕计算机视觉与多模态理解,在微软亚研期间主导了多项视觉基础模型的研究。随着胡瀚到位,混元团队在视觉领域的研发重心或将从单一技术迭代转向更宏观的世界模型构建。

胡瀚履历:从清华到微软亚研的视觉计算领军者

胡瀚的学术和职业轨迹堪称计算机视觉领域的“黄金标准”:

  • 2008年本科毕业于清华大学,2014年获清华大学博士学位,师从周杰教授,博士论文获2016年中国人工智能学会优秀博士论文奖。
  • 2012年在宾夕法尼亚大学GRASP实验室访学,师从史建波教授。
  • 毕业后加入百度深度学习研究所(IDL),由余凯挂帅,胡瀚担任tech leader,成为国内最早一批深度学习实践者。
  • 2016年12月加入微软亚洲研究院视觉计算组,后晋升为首席研究员。该组被誉为“计算机视觉界的黄埔军校”,曾诞生孙剑、何恺明、华刚等众多技术领军人物。

Swin Transformer:奠定胡瀚在计算机视觉领域地位的里程碑

胡瀚是经典论文《Swin Transformer: Hierarchical Vision Transformer using Shifted Windows》的核心作者之一。该架构通过移动窗口机制实现了层级化视觉Transformer,性能全面超越DeiT、ViT和EfficientNet等主流主干网络,已成为计算机视觉领域通用的backbone(骨架网络)。这一成果直接影响了后续多模态大模型对视觉特征提取的技术路线,也是胡瀚在学术界和工业界享有盛誉的关键原因。

腾讯混元大模型持续进化,Turbo与文生视频亮点频出

在胡瀚加入之际,腾讯混元大模型正加速迭代:

  • 2024年9月,腾讯发布混元Turbo,采用MoE架构,推理效率提升100%,推理成本降低50%。
  • 12月,混元大模型上线并开源文生视频能力,参数量达130亿,支持中英文双语输入,成为国内首个开源视频生成的大模型。
  • 胡瀚的多模态理解经验有望将混元在图像、视频等内容生成与理解能力推上新台阶,同时配合团队探索世界模型——通过模拟物理规律和时空交互,实现更接近人类认知的智能。