Skip to content セクションへスキップ

📊実務とノウハウ

データサイエンティスト · データからパターンを見つけ予測モデルを構築する職業――2008年生まれの肩書きだが、その土台には数値を数え、検証し、可視化してきた3世紀分の営みがある。

一目で
指標の濃さ

濃いマスほど、このテーマでその指標が高いことを示します。

最終確認 出典とクレジットメディアクレジット方法論

短い答え

データサイエンティストは日々具体的に何をしているのか

「AIモデルを構築している」というイメージとは裏腹に、実際の日々の多くはSQLクエリやPythonコードを書いてデータを取得・整形すること、統計検定やモデル訓練を行うこと、そしてその結果を非技術者の関係者でも行動に移せるチャートやメモに落とし込むことに費やされる。実務者調査では一貫して、データクリーニングと準備が総労働時間の半分以上を占めるという結果が出ている。

データサイエンティストになるには博士号が必要か

いいえ。医学や法律と異なり免許制度や必須の単一学位は存在せず、統計学・コンピュータサイエンス・数学など定量的分野の学士号か修士号が最も一般的な道であり、実際のプロジェクトを積んだポートフォリオの方が、正確な学位よりも採用側にとって重視されることが多い。博士号は研究色の強い職や応用機械学習の職でより一般的である。

データサイエンスは統計学に新しい名前をつけただけなのか

厳密には違う。フィッシャーの実験計画法やテューキーの探索的分析など統計学に強く依拠しているが、伝統的な統計学部ではほとんど教えられてこなかったプログラミング、データベース工学、機械学習を加えている。ウィリアム・S・クリーブランドは2001年に、統計学を置き換えるのではなく、それを土台とした計算集約型の拡張分野を指す言葉として、この用語を提唱した。

データサイエンスはAIによって代替されるリスクがあるか

定型的な部分はすでにその影響を受けている。AutoMLツールは標準的なモデルの構築・調整を行え、AIアシスタントはSQLクエリの作成、探索的チャートの初稿作成、定型的なパイプラインコードの記述を人より速くこなせる。まだ自動化されていないのは、適切な問いを設定すること、パターンが有意義なのか偶然なのかを判断すること、その結果に基づく意思決定に責任を持つことである。

データサイエンティストの給料はどのくらいか

国や経験年数によって大きく異なる。米国労働統計局によると、2023年時点でデータサイエンティスト職の年収中央値は約10万8000ドルであり、ジュニアアナリストは7万~9万5000ドル程度から始まることが多い一方、大手テック企業のシニアまたはプリンシパルデータサイエンティストは株式報酬を含め総報酬20万~40万ドル以上を得ることもある。

データサイエンティストとデータアナリスト、機械学習エンジニアの違いは何か

データアナリストは通常、既存のデータとダッシュボードを使って明確に定義されたビジネス上の問いに答える。データサイエンティストは、より雑然としたデータから新たな統計モデルや予測分析を構築する。機械学習エンジニアは、ノートブックの中にあるモデルを本番環境で確実に、大規模に稼働させる役割を担う。この境界は常に曖昧で、多くの人がキャリアの中でこの3つを行き来している。

このセクションから始める - 実務とノウハウ

比較ラボを開く

このページを共有

データサイエンティストが巧みな予測モデルを構築しているという大衆的なイメージは、真実だが不完全である。実務者調査や体験談は一貫して、多くの人がイメージする「モデリング」の段階よりも、雑然としたデータの発見・整理・整形にはるかに多くの時間が費やされる仕事として描いている。

この分野で受け継がれてきた技巧は、特定のアルゴリズムを暗記することよりも、規律ある懐疑心にある――データを信頼する前にまず自分の目で見ること、パターンがサブグループの中でも成り立つかを確認すること、そして関係者の問いに対する正直な答えが「データではそれを裏付けられない」であることを見極めることである。

仕事が求める力

857870726258
統計学と確率
85
プログラミング(Python、SQL、R)
78
データ整形とパイプライン
70
機械学習モデリング
72
所見の伝達
62
ビジネス・専門領域の理解
58

統計学と確率

仮説検定、回帰分析、そしてp値や信頼区間が実際に何を主張しているのかの理解――仕事の他のすべてが乗っている推論の基盤。

プログラミング(Python、SQL、R)

一度きりのノートブック内分析を試作するだけでなく、大規模にデータを取得・整形・変換できる熟達したコードを書くこと。

データ整形とパイプライン

欠損値、重複レコード、不整合な形式といった雑然とした実世界のデータを、モデルやチャートが実際に使えるものへと変換すること。

機械学習モデリング

問題に適したモデルを選び、訓練し、検証すること、そして単純な回帰の方が凝ったニューラルネットワークより優れている場面を見極めること。

所見の伝達

統計的な結果を、過度に単純化したり本当の不確実性を隠したりせずに、非技術者の経営陣が行動に移せるチャートやメモ、提言に翻訳すること。

ビジネス・専門領域の理解

特定のビジネスや科学分野の中で、ある指標が実際に何を意味するのかを理解し、分析が実際に問われた問いに答えるようにすること。

一日の風景

スタンドアップとダッシュボード確認データ取得とクリーニング昼食モデリングと分析関係者との会議とレビュー業務時間外(概ね) 036912151821 24h
  1. 8–9 スタンドアップとダッシュボード確認

    夜間のパイプライン実行状況と主要指標のダッシュボードを確認し、その日の優先事項についてチームと短く同期する。

  2. 9–12 データ取得とクリーニング

    データウェアハウスに対してSQLクエリを書き、テーブルを結合・整形し、欠損値や不整合な値を処理する――多くの場合、一日の中で最も大きな単一の作業ブロック。

  3. 12–13 昼食

    本当の休憩であり、部門横断の問題が正式な会議に持ち込まれる前に非公式に提起される場になることも多い。

  4. 13–15 モデリングと分析

    統計モデルの構築や改善、実験の有意性検定の実行、あるいは指標が動いた理由を掘り下げる。

  5. 15–17 関係者との会議とレビュー

    プロダクトやビジネスチームへの所見の提示、A/Bテスト結果のレビュー、質問を受けながら分析の前提を弁護すること。

  6. 17–8 業務時間外(概ね)

    プライベートな時間だが、プロダクトの発売や四半期ビジネスレビューの前後は、夕方に急な分析依頼が入り込むこともある。

ノウハウ

現場で実際に伝えられる技術知 — モチベーション文句ではない。

01

モデル化する前にまずデータを見る

何かを当てはめる前に生の分布、散布図、簡単な要約統計をプロットする習慣は、そうしなければモデルが黙って吸収し隠してしまう壊れたデータ、単位の誤り、外れ値を捉える。

ジョン・テューキー、『探索的データ分析』、1977年
02

傾向がサブグループの中でも成り立つか確認する

関連するカテゴリでデータを分割すると、全体的な傾向が完全に逆転することがある――統計学者エドワード・H・シンプソンの1951年の論文にちなんで名付けられた「シンプソンのパラドックス」として知られる現象である。

エドワード・H・シンプソン、1951年論文。この現象自体はカール・ピアソンらによって以前から指摘されていた
03

検証用データを取り分け、最後まで見ない

同じ取り分けたデータに対して繰り返し性能を確認し、モデルを調整することは、そのデータから静かに情報がモデルへ漏れ込むことにつながる――一度しか触れないことが、最終結果の正直さを保つ。

標準的な慣行で、ヘイスティ、ティブシラニ、フリードマン『統計的学習の要素』(2001年)で定式化
04

プロジェクトの大半をモデリングでなくクリーニングに割り当てる

実際のプロジェクトは、逆ではなく、データ準備が約8割、モデリングが約2割という配分になることが一貫して多い――逆の前提でスケジュールを組むことは、プロジェクトが遅延する一般的な原因である。

スティーブ・ロア『ビッグデータサイエンティストにとって「用務員仕事」が洞察への大きな障壁』ニューヨークタイムズ、2014年、以来広く反響を呼ぶ
05

うまくいきそうな最も単純なモデルをまず出荷する

ときには単なるルールや線形モデルであるベースラインは、より複雑なモデルが実際にどれだけの価値を加えているかを明らかにし、それ自体で出荷するのに十分なことも多い。

マーティン・ジンケビッチ、『機械学習の法則:MLエンジニアリングのベストプラクティス』、グーグル、ルール4番
06

パターンが良すぎるときは交絡要因を探す

驚くべき相関は、真の発見であるよりも隠れた第三の変数の産物であることの方が多い――結果を提示する前に、他に何がそれを説明しうるかを積極的に探すべきだ。

フィッシャーの実験計画法の伝統に根ざし、ジューディア・パール『Why の思考法』(2018年)で定式化

仕事の道具

Python(pandas、scikit-learn、NumPy)

データ操作と古典的機械学習の主流言語で、表形式データにはpandas、標準的なモデリングアルゴリズムにはscikit-learnが使われる。

SQL

ほとんどの企業のデータが実際に置かれているリレーショナルおよびクラウドデータウェアハウス――Snowflake、BigQuery、Redshiftなど――からデータを取り出すためのクエリ言語。

Jupyterノートブック

探索的分析のための標準的な対話型環境で、データサイエンティストがコードを実行し、チャートを見て、同じドキュメント内でメモを取ることを可能にする。

Tableau / Power BI

完成した分析を、コードを書かずに非技術者の関係者が調べたり監視したりできるものに変えるビジネスインテリジェンスのダッシュボードツール。

Gitとクラウドプラットフォーム(AWS、GCP、Azure)

コードの、そしてますますモデルのバージョン管理、加えてラップトップでは対応できない規模でデータを保管し訓練ジョブを実行するクラウドインフラ。

失敗する理由

有意になるまで検定を繰り返す

多数の統計的比較を行い、有意水準を超えたものだけを報告することは、再現しない誤発見を生む――pハッキングとしてよく知られる失敗パターンである。

目的変数を漏らしたモデルの出荷

予測対象の結果を符号化してしまう特徴量をうっかり含めると、オフラインでは現実離れした好成績が出るが、本番環境の未知のデータに触れた途端に崩壊する。

誤った問いに対する洗練された答えを構築する

単純なSQLクエリやスプレッドシートの数式で同じように答えられた問題を精緻に調整した機械学習モデルで解くことは、労力を無駄にし、本来のビジネス上の問いを見失いかねない。

似ている職業

分野だけでなく、6つのスコアが近い職業です。

さらに探す

さらに探す

科学・研究のほかの職業

⚛️

物理学者

黒板一枚から3000人の共著者を抱える加速器論文まで、物質・エネルギー・空間・時間を支配する数学的法則を導き検証する仕事。

AI耐性 65
🧬

生物学者

生命そのものを研究する科学者。リンネが種を手作業で命名した時代から、CRISPRでゲノムを編集する今日まで、あらゆる着想を生きた生物で検証し続けてきた。

AI耐性 64
🧪

化学者

物質そのものを作り、測る科学者——バビロニアのタプティの蒸留器から今日のロボット実験室まで、スペクトルの意味を決めるのは常にこの人だ。

AI耐性 70
🔭

天文学者

バビロニアの粘土板から宇宙望遠鏡まで、宇宙を測り続ける科学者。今もデータの中のどの揺らぎが発見なのかを見極めている。

AI耐性 70
🧮

数学者

バビロニアの書記からフィールズ賞受賞者、AI支援証明まで――困難な問いを恒久的な確実性へと変え続けてきた職業、一つの定理ごとに。

AI耐性 70
🧿

量子エンジニア

コンピューティング、センシング、通信、材料研究のために量子状態を利用する装置を構築し、測定し、制御する。

AI耐性 78
🧫

臨床データサイエンティスト

臨床データ、治験データ、医療システムのデータを用いて、より安全な医療、研究、業務上の意思決定のための信頼できるエビデンスを生み出す。

AI耐性 68