|
|

楼主 |
发表于 2025-1-22 23:48:17
|
显示全部楼层
; B: I/ q {2 s1 O+ L
“东方神秘力量” 爆火国产AI大模型背后的年轻人
6 x& a: C$ @& [ Fhttps://tech.ifeng.com/c/8gMIT2sFcxI
$ a7 _, H, V, X/ q% S
( b8 j' { `+ k, D6 ^8 ?+ U2023年5月,DeepSeek-V2发布,相比于国内外主流大模型,大幅减少了计算量和推理显存,一问世就备受关注。做出这一突破性创新的,是年轻的高华佐和曾旺丁等人。
: K3 `. S3 R9 ^: `
5 V; ^1 }) ~3 [( k3 I/ W- \' m b' C两人都刚从学校出来没几年。高华佐来自广东,2012年在华南师范大学附属中学就读时,曾获第29届全国中学生物理竞赛一等奖,并于次年保送至北京大学物理学院学习。曾旺丁来自湖南省新化县,2017年至2023年就读于北京邮电大学人工智能学院,硕士期间主要学习人工智能方向,导师为张洪刚,2018年曾获全国大学生数学竞赛(非数学类)二等奖。
; ~+ g2 Y: ]9 ~; V8 L
- b* ?- {; a4 j+ ?2 h- bDeepSeek大模型的另一大突破,是通过一种名为GRPO的算法,创新训练方法,大大降低了成本。其中的主角,依然是这些看似缺少经验的年轻人。
. S8 \3 T+ f/ _- O7 I7 ?# `- f q2 d( I: J# @: q% z: ^, ?
核心成员之一邵智宏此前是清华大学交互式人工智能(CoAI)课题组博士生,主要研究自然语言处理、深度学习,对构建稳健且可扩展的AI系统有着独特见解。他曾服务于微软研究院,加入DeepSeek团队之后,参与了多个重要项目的研发,包括DeepSeek-Math、DeepSeek-Prover和DeepSeek-Coder-v2等。8 f! |# b' p+ l& h+ j& Z# s2 [
) _1 y1 b Y. Q* |GRPO算法创新的另一重要贡献者是朱琪豪。这位北京大学计算机学院2024届的博士毕业生,专注于深度代码学习研究。在校期间,他展现了惊人的学术能力,发表CCF(中国计算机学会)-A类论文16篇,获得了软件工程领域顶级会议(ESEC/FSE)杰出论文奖。他的博士论文《语言定义感知的深度代码学习技术及应用》入选了2024CCF软件工程专业委员会博士学位论文激励计划。他在DeepSeek团队最重要的工作,正是基于自己的博士论文,主导开发DeepSeek大模型的一个关键项目。
0 M+ _9 E* k& E2 ?2 K& u) ]
) y' F, Y1 p0 p" K。。。。! y5 q# v; C6 y5 p
7 j0 Z$ P! D! m& Z负责DeepSeek大模型训练及推理基础架构的,是同样刚毕业的工程师赵成钢。加入DeepSeek之前,他曾在英伟达公司实习。赵成钢在学生时代就取得过令人艳羡的成绩。在河北衡水中学就读时,他是信息学竞赛班成员,2016年获得全国青少年信息学奥林匹克竞赛银牌。在清华大学读大二时,他成为学生超算团队正式成员,三次获得世界大学生超算竞赛冠军。1 {* S3 L. r5 ~. [
3 g9 h* M) u1 q. X0 z
DeepSeek团队规模并不大,不到140人,工程师和研发人员几乎都来自清华大学、北京大学、中山大学、北京邮电大学等国内顶尖高校,鲜有“海归”,而且工作时间都不长,不少还是在读博士。即便是团队的管理者,也非常年轻。* G$ ^9 m: W) |. s
|
|