单批货过量
在信任整个数据集上的训练之前,请检查该模型是否能够在极少数例子上将其损失推向接近零。 如果它甚至无法记住10个实例,错误就存在于代码中,而不是数据中.
格子越深,表示该主题在这项指标上越高。
低高
大部分时间会分读近期论文,写作和调试训练代码,等待和分析长期实验的结果,并与合作者讨论发现. 与流行形象相反,很大一部分工作正在诊断一个模型为什么表现不佳或者结果不会复制,而不是从零开始集思广益的新建筑.
对于大学或顶级工业实验室的独立研究角色来说,实际上是的——博士仍然是该领域真正的证书,因为没有许可证考试。 但“研究科学家”等称号仍然对博士生有很大影响。
其部分明显是: 文献总结,锅炉板实验代码和第一稿相关工作部分已经是例行AI辅助,实验室正在公开实验提出和运行自己实验的系统. 确定结果的实际含义,并对公布的索赔承担责任,证明移交困难得多。
雇主和资历差别很大。 2024年,美国“计算机和信息研究科学家”类别的中位数为140,910美元,但加入一个大型技术公司研究实验室的新博士往往比这个高得多,据报道,在2024年至2025年的招聘竞赛中,前沿AI实验室的少数高级研究人员得到了价值7或8位数字的总包。
线条不断模糊,但粗略的区别在于:研究者的产出通常是论文,新方法或对东西为什么起作用的洞察力,通过同行评审判断;工程师的产出通常是生产中的工作系统,根据它是否船只和是否被实际使用来判断. 很多人在职业生涯中都是这样
Python主导,与深层学习框架配对——PyTorch现在是研究中最常见的,JAX流行于大型和Google附属作品. 代码之外,研究人员依赖于共享的GPU或TPU计算集群,Weights & Biases等实验跟踪工具,以及arXiv,其中大多数新结果在正式同行评审前几个月作为预印流通.
研究者在一闪一闪的洞察力中发明一个聪明的新算法,其形象大多是错误的. 大部分时间都花在运行实验上,这些实验以非信息化的方式失败了,阅读了其他一百个实验室本月公布的内容,并试图判断一个有希望的结果是真实的还是幸运随机种子的文物.
球场内部流传下来的手艺 不太了解要记住哪些建筑 更了解实验性纪律: 如何分离真正导致改进的东西, 何时相信基准,何时不相信基准, 如何防止负面结果被悄悄地扔掉。
线性代数,概率,微积分和优化是几乎每一个模型和纸张都用到的语言;没有它们,新方法是无法读取的,而不仅仅是不熟悉的.
在Python中写入高效的代码和深层学习框架,并理解足够的分布式系统工程,以在数十或数千个处理器中运行训练工作.
设计可控比较,运行足够的随机种子以信任一个结果,隔离哪些具体变化实际导致改进而不是假设明显的解释.
继续每年出版数以万计的新预印本, 并告诉哪个小块块真正重要, 现在它本身就是一种技能。
选择许多可能的方向中哪些值得数月的计算和注意——直接教授最难的技能,通常通过与经验丰富的顾问合作来吸收。
无法清楚地写出在同行审议中幸存下来的结果,或向非专家资助者解释的结果,无论它多么真实,都难以产生任何影响。
审阅过夜实验结果,在当天的焦点工作开始前,对新的arXiv预印和实验室聊天讨论进行滑动.
当天最受保护的块,花费了写训练代码,调试一个模型,或者设计一系列的下一个实验.
经常和实验室的同僚一起吃东西,而且经常是安排的会议很少产生的那种非正式的思潮的场所。
实验室会议,与顾问或经理进行一对一的会谈,以及轮流的阅读小组,其中有人提出一个小组需要理解的论文.
探究一项实验是否奏效的原因,更新一份共同的结果文件,并在截止日期之前起草文件的章节。
个人时间——除了在主要会议最后期限前几周,晚上和周末经常消失在完成实验中。
从业者真正口耳相传的技艺——不是鸡汤。
在信任整个数据集上的训练之前,请检查该模型是否能够在极少数例子上将其损失推向接近零。 如果它甚至无法记住10个实例,错误就存在于代码中,而不是数据中.
在比较基线得到与新方法相同的超参数搜索预算后,所公布的“改进”比例会缩水或消失。
当用五个变化捆绑在一起的新方法击败一个旧的方法时,将每个变化单独去掉,在算入任何单一的想法之前重新测试——否则报纸的故事和收益的实际原因可以悄悄的分化.
一旦研究人员反复直接调和一般能力时,领导板号码就停止测量一般能力——这种动态长期被称为古德哈特定律,直接引证于对整个NLP和视觉的基准饱和度的批评.
起草论文的核心主张 早期迫使一个具体、可伪造的目标 对于剩下的实验, 而不是先运行实验 和收集一个叙事 关于任何发生 工作。
失败的配置,种子和超参数通常在一次运行失败后被丢弃,但记录它们会阻止实验室在半年后以不同的名字悄悄地重新运行同一个死端.
两个占主导地位的深度学习框架;PyTorch在大多数学术和行业研究中领先,而JAX则流行于大型和Google附属作品.
共享集群,用Slurm等工具排期,将模型设计转化为实际训练有素的网络——往往是对哪些实验是可能的最大的限制.
实地事实上的出版地点:新的成果作为预印本在此分发,常常是在正式同行审议前几个月或完全没有进行同行审议。
实验跟踪仪表板记录损失曲线、超参数和数百次运行的输出,如果没有这些仪表板,将无法进行比较。
交互环境用于快速数据探索,调试一个模型在具体实例上的行为,并在代码移动到一个完整的训练管道之前建立原型.
通过额外的超参数搜索或尺度来挤出分数精度的改进,没有假设它为什么起作用,结果即使数字本身是真实的,其他人也很难继续发展.
运行许多种子,只发布最好的种子,而不是中和扩散,使得普通的噪音看起来像真正的效果——这个问题在强化学习和NLP再生研究中反复提出.
泄露到预训书的测试数据,或者比论文报告悄悄地大一些的计算预算,可以使一个结果无法复制——一旦发现,对研究人员的可信度的破坏会超过微小,诚实的结果.
不限同一领域,六项评分最接近的职业。
每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54 🩺通过问诊与证据诊断疾病并长期管理健康,而非一次手术——医学的通科与长期向导。
抗AI 67 🧠通过药物与心理治疗诊断和治疗精神疾病,是少数拥有法定权力在患者危机时将其强制留院的医学专科之一。
抗AI 73 👔为客户提供法律意见,起草具有约束力的文件,并在案件进入法庭时为其辩护——若建议有误,还须承担个人法律责任。
抗AI 58 🔐通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 🛰️设计、分析并认证离地而行的飞机、火箭与航天器,在不容猜测的安全裕度下工作。
抗AI 74 🌉把河流、岩石与重力变成桥梁、道路与清洁饮水的职业——自伊姆霍特普起,文明安静的承重行当。
抗AI 72 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🔐通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54 🌬️设计、建造和改进风能、太阳能、存储和电网系统,将可再生资源转化为可靠的电力。
抗AI 72