华人AI工程师也搭上了SpaceX的财富火箭....
刘泽在MSRA最出名的工作是Swin Transformer。
2021年,他作为第一作者之一发表了《Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows》,这篇论文获得了ICCV 2021最佳论文奖。
一开始Transformer主要在语言模型里大放异彩,而Swin Transformer通过“移动窗口”的设计,让模型既能处理图像里的局部信息,又能建立更大的视觉结构关系。这套架构后来被广泛用于图像分类、目标检测、语义分割、视频理解等任务,也让刘泽成为视觉基础模型方向里很有代表性的年轻研究者。
后来,刘泽又继续参与Swin Transformer V2和Video Swin Transformer,把这条路径从图像扩展到视频场景。
他进入的时间比前两位稍早,2024年4月,刘泽加入xAI,成为MTS。加入后,他参与了Grok Vision、Grok 2、Grok 3,并共同负责Grok Imagine的视频生成,还做过Grok Voice Mode的预训练。
Grok Vision是让模型看懂图像,Grok Imagine是让模型生成图像和视频,Grok Voice Mode是让模型进入语音交互,Grok 2和Grok 3则是xAI大模型本身的迭代,可以说,刘泽的路线基本覆盖了Grok从文本走向多模态的关键方向。
但这只是xAI留下来的华人技术线索里,最容易被看见的一部分。
多模态决定的是Grok能不能看图、生成图像、生成视频、进入语音交互。另一条更隐蔽的线,则决定模型能不能推理、能不能写代码、能不能在后训练里继续变强。
黄杰本科毕业于中山大学,后来在伊利诺伊大学厄巴纳-香槟分校(UIUC)读计算机博士,导师是Kevin C.C. Chang,研究方向包括大语言模型能力、风险与推理。
博士期间,黄杰还曾在Google DeepMind做研究。他参与的代表性工作之一是《Large Language Models Cannot Self-Correct Reasoning Yet》,该论文讨论了大模型在推理和自我纠错上的边界,入选了ICLR 2024。公开数据里,它的引用量已经超过千次。
黄杰加入xAI的时间点,正好卡在Grok 2发布前夜。
2024年5月,xAI完成60亿美元B轮融资;2024年7月,黄杰加入xAI,做后训练(post-training)、中训练(mid-training)和推理(reasoning);一个月后,xAI发布Grok 2 Beta。
公开简历显示,黄杰是Grok 2、Grok 3、Grok 4以及Grok Imagine Video的核心贡献者。
Grok 2、Grok 3、Grok 4,是xAI大模型能力不断往前推的主线。
黄杰所处的位置,就是让这些模型在训练之后,变得更会对话、更会推理、更会遵循指令,也更接近用户最后看到的形态。
林禹臣本科毕业于上海交通大学IEEE试点班,后来在南加州大学读计算机博士,导师是任翔(Xiang Ren)。
他的履历同样带有MSRA的痕迹。
2017到2018年,林禹臣曾在微软亚洲研究院实习。后来他又先后在Google AI、Meta FAIR做研究。进入xAI之前,他在西雅图的艾伦人工智能研究所担任研究科学家,与知名NLP研究者Yejin Choi合作。
林禹臣长期关注的是大语言模型对齐、奖励建模、评测、合成数据和Agent。
根据他个人主页列出的项目,比如WildBench、ZeroEval、WildVision、Lumos Agent、SwiftSage、LLM-Blender等,它们分别对应模型评测、偏好对齐、视觉模型评测、Agent训练和多模型融合。
可以说,林禹臣做的不是单一模型能力,而是模型进入真实任务之前的一整套训练和评估方法。
2024年11月,林禹臣加入xAI,成为MTS。
他的简历里,xAI这一段写的是RL for agentic coding models,也就是给能写代码、能执行任务的模型做强化学习。
他参与过Grok 3的后训练,用基于rubric的强化学习提升模型的通用对话和推理能力;也参与过Grok 3 Mini的后训练,重点之一是让模型更好地遵循长格式系统指令,尤其是在代码场景里。
模型先要能写代码,再要学会听复杂指令、按要求行动、在长任务里少跑偏。林禹臣做的,正是这部分训练。
沈卓然的路线,更直接落在Grok Code上。
[加西网正招聘多名全职sales 待遇优]
好新闻没人评论怎么行,我来说几句
2021年,他作为第一作者之一发表了《Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows》,这篇论文获得了ICCV 2021最佳论文奖。
一开始Transformer主要在语言模型里大放异彩,而Swin Transformer通过“移动窗口”的设计,让模型既能处理图像里的局部信息,又能建立更大的视觉结构关系。这套架构后来被广泛用于图像分类、目标检测、语义分割、视频理解等任务,也让刘泽成为视觉基础模型方向里很有代表性的年轻研究者。
后来,刘泽又继续参与Swin Transformer V2和Video Swin Transformer,把这条路径从图像扩展到视频场景。
他进入的时间比前两位稍早,2024年4月,刘泽加入xAI,成为MTS。加入后,他参与了Grok Vision、Grok 2、Grok 3,并共同负责Grok Imagine的视频生成,还做过Grok Voice Mode的预训练。
Grok Vision是让模型看懂图像,Grok Imagine是让模型生成图像和视频,Grok Voice Mode是让模型进入语音交互,Grok 2和Grok 3则是xAI大模型本身的迭代,可以说,刘泽的路线基本覆盖了Grok从文本走向多模态的关键方向。
但这只是xAI留下来的华人技术线索里,最容易被看见的一部分。
多模态决定的是Grok能不能看图、生成图像、生成视频、进入语音交互。另一条更隐蔽的线,则决定模型能不能推理、能不能写代码、能不能在后训练里继续变强。
黄杰本科毕业于中山大学,后来在伊利诺伊大学厄巴纳-香槟分校(UIUC)读计算机博士,导师是Kevin C.C. Chang,研究方向包括大语言模型能力、风险与推理。
博士期间,黄杰还曾在Google DeepMind做研究。他参与的代表性工作之一是《Large Language Models Cannot Self-Correct Reasoning Yet》,该论文讨论了大模型在推理和自我纠错上的边界,入选了ICLR 2024。公开数据里,它的引用量已经超过千次。
黄杰加入xAI的时间点,正好卡在Grok 2发布前夜。
2024年5月,xAI完成60亿美元B轮融资;2024年7月,黄杰加入xAI,做后训练(post-training)、中训练(mid-training)和推理(reasoning);一个月后,xAI发布Grok 2 Beta。
公开简历显示,黄杰是Grok 2、Grok 3、Grok 4以及Grok Imagine Video的核心贡献者。
Grok 2、Grok 3、Grok 4,是xAI大模型能力不断往前推的主线。
黄杰所处的位置,就是让这些模型在训练之后,变得更会对话、更会推理、更会遵循指令,也更接近用户最后看到的形态。
林禹臣本科毕业于上海交通大学IEEE试点班,后来在南加州大学读计算机博士,导师是任翔(Xiang Ren)。
他的履历同样带有MSRA的痕迹。
2017到2018年,林禹臣曾在微软亚洲研究院实习。后来他又先后在Google AI、Meta FAIR做研究。进入xAI之前,他在西雅图的艾伦人工智能研究所担任研究科学家,与知名NLP研究者Yejin Choi合作。
林禹臣长期关注的是大语言模型对齐、奖励建模、评测、合成数据和Agent。
根据他个人主页列出的项目,比如WildBench、ZeroEval、WildVision、Lumos Agent、SwiftSage、LLM-Blender等,它们分别对应模型评测、偏好对齐、视觉模型评测、Agent训练和多模型融合。
可以说,林禹臣做的不是单一模型能力,而是模型进入真实任务之前的一整套训练和评估方法。
2024年11月,林禹臣加入xAI,成为MTS。
他的简历里,xAI这一段写的是RL for agentic coding models,也就是给能写代码、能执行任务的模型做强化学习。
他参与过Grok 3的后训练,用基于rubric的强化学习提升模型的通用对话和推理能力;也参与过Grok 3 Mini的后训练,重点之一是让模型更好地遵循长格式系统指令,尤其是在代码场景里。
模型先要能写代码,再要学会听复杂指令、按要求行动、在长任务里少跑偏。林禹臣做的,正是这部分训练。
沈卓然的路线,更直接落在Grok Code上。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
推荐:
华人AI工程师也搭上了SpaceX的财富火箭....