まず単一バッチをオーバーフィットさせる
全データセットでの訓練実行を信頼する前に、ほんの一握りの例に対してモデルが損失をほぼゼロまで下げられることを確認する。10個の例すら記憶できないなら、バグはコードにあり、データにはない。
濃いマスほど、このテーマでその指標が高いことを示します。
低高
多くの日は、最近の論文を読むこと、訓練コードを書いてデバッグすること、長時間走らせた実験の結果を待って分析すること、同僚と発見を議論することに費やされる。世間のイメージとは裏腹に、仕事の大部分はゼロから新しいアーキテクチャを発想することではなく、なぜモデルの性能が振るわないのか、なぜ結果が再現しないのかを突き止めることだ。
大学やトップクラスの産業研究所で独立した研究職に就くには、事実上必要だ。免許試験が存在しないため、博士号がこの分野の実質的な資格であり続けている。博士号を持たない優秀なエンジニアが、企業のレジデンシープログラムや、オープンソースでの実績・被引用プレプリントの公開記録を通じて参入するケースは増えているが、「リサーチサイエンティスト」といった肩書きは依然として博士号保持者に大きく偏っている。
一部は明らかにそうだ。文献の要約、定型的な実験コード、関連研究セクションの下書きはすでにAIの助けを借りるのが日常的になっており、研究所は自ら実験を提案し実行するシステムを公然と試している。だが、ある結果が実際に何を意味するのかを解釈すること、そして公表した主張に責任を持つことは、はるかに引き渡しにくいことが分かっている。
雇用主や経験年数によって大きく異なる。米国のより広い「コンピュータ・情報科学研究者」区分の中央値は2024年で年14万910ドルだったが、大手テクノロジー企業の研究所に入る新博士はそれをはるかに上回る額から始まることが多く、2024〜2025年の採用競争では、フロンティアAI研究所の一部の上級研究者が7桁から8桁ドルに及ぶ総報酬パッケージを提示されたと報じられている。
境界は絶えず曖昧になっているが、大まかな区分はある。研究者の成果は通常、論文や新しい手法、あるいはなぜそれがうまくいくのかについての洞察であり、査読によって評価される。エンジニアの成果は通常、実運用で動くシステムであり、それが実際にリリースされ実使用に耐えるかどうかで評価される。キャリアの中で両方をこなす人も多い。
Pythonが主流で、深層学習フレームワークと組み合わせて使われる。研究の現場ではPyTorchが最も一般的で、大規模な計算やGoogle系の研究ではJAXが人気だ。コード以外では、研究者は共有のGPU/TPU計算クラスタ、Weights & Biasesのような実験管理ツール、そして正式な査読の何カ月も前に新しい成果がプレプリントとして出回るarXivに依存している。
ひらめきの瞬間に巧妙な新アルゴリズムを発明する研究者というイメージは、おおむね間違っている。多くの日は、有益な情報を得られない形で失敗する実験を回し、今月他の百の研究所が発表した内容を読み、有望に見える結果が本物なのか、それとも運の良い乱数シードのアーティファクトなのかを見極めようとすることに費やされる。
この分野の中で受け継がれる技術は、どのアーキテクチャを暗記するかよりも、実験の規律に関わるものだ。何が実際に改善を引き起こしたのかをどう切り分けるか、いつベンチマークを信じていつ信じないか、そして否定的な結果が静かに捨てられてしまわないようにどう保つか、といった規律である。
線形代数、確率、微積分、最適化は、ほぼすべてのモデルと論文が書かれている言語だ。これらがなければ、新しい手法は単に馴染みがないのではなく理解不能になる。
Pythonと深層学習フレームワークで効率的なコードを書き、数十から数千のプロセッサにまたがって訓練ジョブを実行できる程度の分散システム工学の理解を持つこと。
対照比較を設計し、結果を信頼できるだけの十分な乱数シードで実験を回し、改善を実際に引き起こした具体的な変更を、明白そうな説明を鵜呑みにせず切り分けること。
年間数万本もの新しいプレプリントが出る分野に追いつき、その中のどの一握りが実際に重要かを見極めることは、今やそれ自体が一つのスキルだ。
多くのもっともらしい方向性のうち、どれが何カ月もの計算資源と注意を注ぐ価値があるかを選ぶこと――直接教えるのが最も難しいスキルで、通常は経験豊富な指導教員と一緒に働く中で吸収される。
査読に耐えるほど明確に書けなかったり、専門家でない資金提供者に説明できなかったりする結果は、それがどれほど本物であっても影響力を持ちにくい。
一日の集中作業が始まる前に、一晩かけた実験結果を確認し、新しいarXivプレプリントや研究室のチャットでの議論に目を通す。
その日の最も守られた時間帯で、訓練コードを書いたり、モデルをデバッグしたり、一連の実験の次のステップを設計したりする。
しばしば研究室の仲間と一緒にとられ、予定されたミーティングではめったに生まれない類の非公式なアイデア交換の場になることが多い。
研究室のミーティング、指導教員やマネージャーとの1対1、そして誰かがグループが理解すべき論文を発表する持ち回りの輪読会。
実験がうまくいった、あるいはいかなかった理由を掘り下げ、共有の結果ドキュメントを更新し、締め切りを前にした論文のセクションを起草する。
個人の時間――ただし主要な学会の締め切りの数週間前は例外で、夕方や週末は実験の仕上げに日常的に消えていく。
現場で実際に伝えられる技術知 — モチベーション文句ではない。
全データセットでの訓練実行を信頼する前に、ほんの一握りの例に対してモデルが損失をほぼゼロまで下げられることを確認する。10個の例すら記憶できないなら、バグはコードにあり、データにはない。
発表された「改善」の驚くほどの割合は、比較対象のベースラインに新手法と同じハイパーパラメータ探索予算を与えると縮小あるいは消滅する――GANでも言語モデルでも文書化されているパターンだ。
五つの変更を束ねた新手法が旧手法を上回るとき、どのアイデアの功績にもする前に、各変更を独立に除去して再テストする。そうしないと、論文のストーリーと実際の効果の原因が静かに乖離しうる。
リーダーボードの数値は、研究者が繰り返しそれに直接合わせてチューニングし始めた時点で、汎用能力の測定をやめる――ゴハートの法則として長く知られるダイナミクスで、NLPやビジョンにおけるベンチマーク飽和への批判で直接引用されている。
論文の中核となる主張を早い段階で起草することで、残りの実験のために具体的で反証可能な目標が強制される――先に実験を回し、うまくいったことを寄せ集めてストーリーを組み立てるのではない。
失敗した設定、シード、ハイパーパラメータは実行が失敗すると通常捨てられるが、それを記録しておくことで、研究室が6カ月後に別の名前の下で同じ行き止まりを静かに再実行するのを防げる。
二大深層学習フレームワーク。PyTorchはほとんどの学術・産業研究で主流であり、JAXは大規模計算やGoogle系の研究で人気がある。
Slurmのようなツールでスケジュールされる共有クラスタで、モデル設計を実際に訓練されたネットワークに変える――どんな実験が可能かを決める最大の制約になることが多い。
実際にはこの分野の事実上の発表の場。新しい結果はここでプレプリントとして出回り、正式な査読の何カ月も前に、あるいは査読を経ずに公開されることも多い。
何百もの実行にわたって損失曲線、ハイパーパラメータ、出力を記録する実験管理ダッシュボード。これがなければ実験の比較は手に負えなくなる。
素早いデータ探索、特定の例に対するモデルの挙動のデバッグ、コードが本格的な訓練パイプラインに組み込まれる前のプロトタイピングのための対話型環境。
なぜうまくいくのかという仮説なしに、追加のハイパーパラメータ探索や規模拡大でわずかな精度向上を絞り出すことは、たとえその数値自体が本物であっても、他の誰にとっても発展させにくい結果を生む。
多くのシードを実行し、平均とばらつきではなく最良のものだけを発表することは、ただのノイズを本物の効果に見せかける――強化学習やNLPの再現性研究で繰り返し指摘されてきた問題だ。
事前訓練コーパスに漏れ込んだテストデータや、論文が報告するより静かに大きい計算予算は、結果を再現不能にしうる――そして発覚した場合、控えめで正直な結果よりもはるかに研究者の信頼性を傷つける。
分野だけでなく、6つのスコアが近い職業です。
自動車のブレーキから核ミサイルの誘導システムまで、あらゆるコンピュータや携帯電話の中にあるトランジスタを設計・製造する。地球上でごく一部の工場しか動かせないほど精密な機械を使う仕事だ。
AI耐性 60 📦本番環境で機械学習モデルを訓練・配備・監視・ガバナンスするためのシステムを構築する仕事。
AI耐性 54 🩺一度の手術ではなく、診察と根拠に基づいて何年にもわたり病気を見極め健康を管理し続ける——医学のジェネラリストであり長期的な伴走者。
AI耐性 67 🧠薬物療法と精神療法を通じて精神疾患を診断・治療する。医療分野のなかでも数少ない、危機的状況にある患者を法的権限に基づいて強制入院させられる専門職のひとつ。
AI耐性 73 👔依頼人に法的助言を与え、権利義務を縛る文書を起草し、法廷では代理人として弁論する——助言が誤っていれば自ら法的責任を負う職業。
AI耐性 58 🔐デジタル攻撃を発見、防止し、対応することで、システム、データ、人々を保護します。
AI耐性 63現代生活を動かすコードを書き、テストし、保守する仕事であり、AIが自分自身の日々の作業を自動化していく様子を最初に目の当たりにしている職業の一つでもある。
AI耐性 35 🛰️地上を離れる航空機・ロケット・宇宙船を設計・解析・認証する仕事で、推測の余地を残さない安全マージンを守り続ける。
AI耐性 74 🌉川と岩と重力を橋・道路・清潔な水に変える職業――イムホテプ以来、文明を静かに支え続ける仕事。
AI耐性 72 🔌自動車のブレーキから核ミサイルの誘導システムまで、あらゆるコンピュータや携帯電話の中にあるトランジスタを設計・製造する。地球上でごく一部の工場しか動かせないほど精密な機械を使う仕事だ。
AI耐性 60 🦾感知し、判断し、物理世界で行動する機械を設計する仕事。真の難問は知能ではなく、世界そのものだった。
AI耐性 65 🔐デジタル攻撃を発見、防止し、対応することで、システム、データ、人々を保護します。
AI耐性 63 📦本番環境で機械学習モデルを訓練・配備・監視・ガバナンスするためのシステムを構築する仕事。
AI耐性 54 🌬️再生可能な資源を信頼できる電力に変える、風力、太陽光、蓄電、送電網のシステムを設計・構築・改善する。
AI耐性 72