Skip to content 跳到章节

🤖实务与诀窍

AI Researcher · 设计并测试了机器智能背后的算法,在一个领域,现在竞相将自己研究过程中越来越大的份额自动化.

一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

一个人工智能研究员每天做什么?

大部分时间会分读近期论文,写作和调试训练代码,等待和分析长期实验的结果,并与合作者讨论发现. 与流行形象相反,很大一部分工作正在诊断一个模型为什么表现不佳或者结果不会复制,而不是从零开始集思广益的新建筑.

我需要博士才能成为AI研究员吗?

对于大学或顶级工业实验室的独立研究角色来说,实际上是的——博士仍然是该领域真正的证书,因为没有许可证考试。 但“研究科学家”等称号仍然对博士生有很大影响。

AI的研究本身是否面临AI的风险?

其部分明显是: 文献总结,锅炉板实验代码和第一稿相关工作部分已经是例行AI辅助,实验室正在公开实验提出和运行自己实验的系统. 确定结果的实际含义,并对公布的索赔承担责任,证明移交困难得多。

人工智能研究人员能赚多少钱?

雇主和资历差别很大。 2024年,美国“计算机和信息研究科学家”类别的中位数为140,910美元,但加入一个大型技术公司研究实验室的新博士往往比这个高得多,据报道,在2024年至2025年的招聘竞赛中,前沿AI实验室的少数高级研究人员得到了价值7或8位数字的总包。

AI研究员和机器学习工程师有什么区别?.

线条不断模糊,但粗略的区别在于:研究者的产出通常是论文,新方法或对东西为什么起作用的洞察力,通过同行评审判断;工程师的产出通常是生产中的工作系统,根据它是否船只和是否被实际使用来判断. 很多人在职业生涯中都是这样

AI研究使用哪些编程语言和工具?

Python主导,与深层学习框架配对——PyTorch现在是研究中最常见的,JAX流行于大型和Google附属作品. 代码之外,研究人员依赖于共享的GPU或TPU计算集群,Weights & Biases等实验跟踪工具,以及arXiv,其中大多数新结果在正式同行评审前几个月作为预印流通.

打开对比实验室

分享本页

研究者在一闪一闪的洞察力中发明一个聪明的新算法,其形象大多是错误的. 大部分时间都花在运行实验上,这些实验以非信息化的方式失败了,阅读了其他一百个实验室本月公布的内容,并试图判断一个有希望的结果是真实的还是幸运随机种子的文物.

球场内部流传下来的手艺 不太了解要记住哪些建筑 更了解实验性纪律: 如何分离真正导致改进的东西, 何时相信基准,何时不相信基准, 如何防止负面结果被悄悄地扔掉。

工作要求什么

887485668462
数学基础
88
Programming and systems
74
Experimental rigor
85
Literature synthesis
66
Research taste
84
书写和交流
62

数学基础

线性代数,概率,微积分和优化是几乎每一个模型和纸张都用到的语言;没有它们,新方法是无法读取的,而不仅仅是不熟悉的.

Programming and systems

在Python中写入高效的代码和深层学习框架,并理解足够的分布式系统工程,以在数十或数千个处理器中运行训练工作.

Experimental rigor

设计可控比较,运行足够的随机种子以信任一个结果,隔离哪些具体变化实际导致改进而不是假设明显的解释.

Literature synthesis

继续每年出版数以万计的新预印本, 并告诉哪个小块块真正重要, 现在它本身就是一种技能。

Research taste

选择许多可能的方向中哪些值得数月的计算和注意——直接教授最难的技能,通常通过与经验丰富的顾问合作来吸收。

书写和交流

无法清楚地写出在同行审议中幸存下来的结果,或向非专家资助者解释的结果,无论它多么真实,都难以产生任何影响。

一天的样子

检查运行和读取深层工作:实验和代码Lunch会议和阅读小组Analysis and writingOff the clock (mostly) 036912151821 24h
  1. 8–10 检查运行和读取

    审阅过夜实验结果,在当天的焦点工作开始前,对新的arXiv预印和实验室聊天讨论进行滑动.

  2. 10–13 深层工作:实验和代码

    当天最受保护的块,花费了写训练代码,调试一个模型,或者设计一系列的下一个实验.

  3. 13–14 Lunch

    经常和实验室的同僚一起吃东西,而且经常是安排的会议很少产生的那种非正式的思潮的场所。

  4. 14–16 会议和阅读小组

    实验室会议,与顾问或经理进行一对一的会谈,以及轮流的阅读小组,其中有人提出一个小组需要理解的论文.

  5. 16–19 Analysis and writing

    探究一项实验是否奏效的原因,更新一份共同的结果文件,并在截止日期之前起草文件的章节。

  6. 19–8 Off the clock (mostly)

    个人时间——除了在主要会议最后期限前几周,晚上和周末经常消失在完成实验中。

门道

从业者真正口耳相传的技艺——不是鸡汤。

01

单批货过量

在信任整个数据集上的训练之前,请检查该模型是否能够在极少数例子上将其损失推向接近零。 如果它甚至无法记住10个实例,错误就存在于代码中,而不是数据中.

Andrej Karpathy, 'A Recipe for Training Neural Networks,' 2019
02

将基线与新想法一样硬

在比较基线得到与新方法相同的超参数搜索预算后,所公布的“改进”比例会缩水或消失。

Echoed in Lucic et al., 'Are GANs Created Equal? A Large-Scale Study' (2018), and Melis et al. (2017) on LSTM baselines
03

一次减少一个变化

当用五个变化捆绑在一起的新方法击败一个旧的方法时,将每个变化单独去掉,在算入任何单一的想法之前重新测试——否则报纸的故事和收益的实际原因可以悄悄的分化.

Standard ablation-study discipline, formalized across ML methodology since the 2010s
04

不信任一个你最优化的基准

一旦研究人员反复直接调和一般能力时,领导板号码就停止测量一般能力——这种动态长期被称为古德哈特定律,直接引证于对整个NLP和视觉的基准饱和度的批评.

Goodhart's law, popularized in its modern form by anthropologist Marilyn Strathern, 1997
05

在上次试验前写索赔

起草论文的核心主张 早期迫使一个具体、可伪造的目标 对于剩下的实验, 而不是先运行实验 和收集一个叙事 关于任何发生 工作。

Common PhD-advising practice, widely echoed in shared 'how to write a paper' guidance across labs
06

记录什么不起作用,不只是什么

失败的配置,种子和超参数通常在一次运行失败后被丢弃,但记录它们会阻止实验室在半年后以不同的名字悄悄地重新运行同一个死端.

Standard lab-notebook discipline borrowed from experimental physics and biology

行当的工具

PyTorch / JAX

两个占主导地位的深度学习框架;PyTorch在大多数学术和行业研究中领先,而JAX则流行于大型和Google附属作品.

GPU/TPU compute cluster

共享集群,用Slurm等工具排期,将模型设计转化为实际训练有素的网络——往往是对哪些实验是可能的最大的限制.

arXiv

实地事实上的出版地点:新的成果作为预印本在此分发,常常是在正式同行审议前几个月或完全没有进行同行审议。

重量和比ase / tensorBoard

实验跟踪仪表板记录损失曲线、超参数和数百次运行的输出,如果没有这些仪表板,将无法进行比较。

Jupyter notebooks

交互环境用于快速数据探索,调试一个模型在具体实例上的行为,并在代码移动到一个完整的训练管道之前建立原型.

人如何在此失败

在没有机制的情况下追逐领导牌

通过额外的超参数搜索或尺度来挤出分数精度的改进,没有假设它为什么起作用,结果即使数字本身是真实的,其他人也很难继续发展.

只报告最佳随机种子

运行许多种子,只发布最好的种子,而不是中和扩散,使得普通的噪音看起来像真正的效果——这个问题在强化学习和NLP再生研究中反复提出.

未披露数据或计算优势

泄露到预训书的测试数据,或者比论文报告悄悄地大一些的计算预算,可以使一个结果无法复制——一旦发现,对研究人员的可信度的破坏会超过微小,诚实的结果.

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

工程·技术领域的其他职业