モデル化する前にまずデータを見る
何かを当てはめる前に生の分布、散布図、簡単な要約統計をプロットする習慣は、そうしなければモデルが黙って吸収し隠してしまう壊れたデータ、単位の誤り、外れ値を捉える。
データサイエンティスト · データからパターンを見つけ予測モデルを構築する職業――2008年生まれの肩書きだが、その土台には数値を数え、検証し、可視化してきた3世紀分の営みがある。
データサイエンティストが巧みな予測モデルを構築しているという大衆的なイメージは、真実だが不完全である。実務者調査や体験談は一貫して、多くの人がイメージする「モデリング」の段階よりも、雑然としたデータの発見・整理・整形にはるかに多くの時間が費やされる仕事として描いている。
この分野で受け継がれてきた技巧は、特定のアルゴリズムを暗記することよりも、規律ある懐疑心にある――データを信頼する前にまず自分の目で見ること、パターンがサブグループの中でも成り立つかを確認すること、そして関係者の問いに対する正直な答えが「データではそれを裏付けられない」であることを見極めることである。
仮説検定、回帰分析、そしてp値や信頼区間が実際に何を主張しているのかの理解――仕事の他のすべてが乗っている推論の基盤。
一度きりのノートブック内分析を試作するだけでなく、大規模にデータを取得・整形・変換できる熟達したコードを書くこと。
欠損値、重複レコード、不整合な形式といった雑然とした実世界のデータを、モデルやチャートが実際に使えるものへと変換すること。
問題に適したモデルを選び、訓練し、検証すること、そして単純な回帰の方が凝ったニューラルネットワークより優れている場面を見極めること。
統計的な結果を、過度に単純化したり本当の不確実性を隠したりせずに、非技術者の経営陣が行動に移せるチャートやメモ、提言に翻訳すること。
特定のビジネスや科学分野の中で、ある指標が実際に何を意味するのかを理解し、分析が実際に問われた問いに答えるようにすること。
夜間のパイプライン実行状況と主要指標のダッシュボードを確認し、その日の優先事項についてチームと短く同期する。
データウェアハウスに対してSQLクエリを書き、テーブルを結合・整形し、欠損値や不整合な値を処理する――多くの場合、一日の中で最も大きな単一の作業ブロック。
本当の休憩であり、部門横断の問題が正式な会議に持ち込まれる前に非公式に提起される場になることも多い。
統計モデルの構築や改善、実験の有意性検定の実行、あるいは指標が動いた理由を掘り下げる。
プロダクトやビジネスチームへの所見の提示、A/Bテスト結果のレビュー、質問を受けながら分析の前提を弁護すること。
プライベートな時間だが、プロダクトの発売や四半期ビジネスレビューの前後は、夕方に急な分析依頼が入り込むこともある。
Craft knowledge practitioners actually pass on — not motivation.
何かを当てはめる前に生の分布、散布図、簡単な要約統計をプロットする習慣は、そうしなければモデルが黙って吸収し隠してしまう壊れたデータ、単位の誤り、外れ値を捉える。
関連するカテゴリでデータを分割すると、全体的な傾向が完全に逆転することがある――統計学者エドワード・H・シンプソンの1951年の論文にちなんで名付けられた「シンプソンのパラドックス」として知られる現象である。
同じ取り分けたデータに対して繰り返し性能を確認し、モデルを調整することは、そのデータから静かに情報がモデルへ漏れ込むことにつながる――一度しか触れないことが、最終結果の正直さを保つ。
実際のプロジェクトは、逆ではなく、データ準備が約8割、モデリングが約2割という配分になることが一貫して多い――逆の前提でスケジュールを組むことは、プロジェクトが遅延する一般的な原因である。
ときには単なるルールや線形モデルであるベースラインは、より複雑なモデルが実際にどれだけの価値を加えているかを明らかにし、それ自体で出荷するのに十分なことも多い。
驚くべき相関は、真の発見であるよりも隠れた第三の変数の産物であることの方が多い――結果を提示する前に、他に何がそれを説明しうるかを積極的に探すべきだ。
データ操作と古典的機械学習の主流言語で、表形式データにはpandas、標準的なモデリングアルゴリズムにはscikit-learnが使われる。
ほとんどの企業のデータが実際に置かれているリレーショナルおよびクラウドデータウェアハウス――Snowflake、BigQuery、Redshiftなど――からデータを取り出すためのクエリ言語。
探索的分析のための標準的な対話型環境で、データサイエンティストがコードを実行し、チャートを見て、同じドキュメント内でメモを取ることを可能にする。
完成した分析を、コードを書かずに非技術者の関係者が調べたり監視したりできるものに変えるビジネスインテリジェンスのダッシュボードツール。
コードの、そしてますますモデルのバージョン管理、加えてラップトップでは対応できない規模でデータを保管し訓練ジョブを実行するクラウドインフラ。
多数の統計的比較を行い、有意水準を超えたものだけを報告することは、再現しない誤発見を生む――pハッキングとしてよく知られる失敗パターンである。
予測対象の結果を符号化してしまう特徴量をうっかり含めると、オフラインでは現実離れした好成績が出るが、本番環境の未知のデータに触れた途端に崩壊する。
単純なSQLクエリやスプレッドシートの数式で同じように答えられた問題を精緻に調整した機械学習モデルで解くことは、労力を無駄にし、本来のビジネス上の問いを見失いかねない。
黒板一枚から3000人の共著者を抱える加速器論文まで、物質・エネルギー・空間・時間を支配する数学的法則を導き検証する仕事。
AI-resistant 65 🧬生命そのものを研究する科学者。リンネが種を手作業で命名した時代から、CRISPRでゲノムを編集する今日まで、あらゆる着想を生きた生物で検証し続けてきた。
AI-resistant 64 🧪物質そのものを作り、測る科学者——バビロニアのタプティの蒸留器から今日のロボット実験室まで、スペクトルの意味を決めるのは常にこの人だ。
AI-resistant 70 🔭バビロニアの粘土板から宇宙望遠鏡まで、宇宙を測り続ける科学者。今もデータの中のどの揺らぎが発見なのかを見極めている。
AI-resistant 70 🧮バビロニアの書記からフィールズ賞受賞者、AI支援証明まで――困難な問いを恒久的な確実性へと変え続けてきた職業、一つの定理ごとに。
AI-resistant 70