モデル化する前にデータを見る
何かを当てはめる前に、生の分布、散布図、単純な要約統計をプロットすること――この習慣は、そうしなければモデルが静かに吸収し隠してしまう壊れたデータ、単位の誤り、外れ値を発見する。
臨床データサイエンティストが巧みな予測モデルを構築するという一般的なイメージは、真実ではあるが不完全だ。実務者への調査や実体験の記録は一貫して、雑然としたデータを見つけ、整形し、再構成することが、多くの人が思い描くモデリングの工程よりも多くの時間を食う仕事だと述べている。
この分野の中で受け継がれてきた技能は、特定のアルゴリズムを暗記することよりも、規律ある懐疑心にある――どんなモデルを信じる前にもまずデータそのものを見ること、あるパターンがサブグループの中でも成立するかを確かめること、そして関係者の問いに対する誠実な答えが「データではそれを裏付けられない」であることを知ることだ。
仮説検定、回帰分析、そしてp値や信頼区間が実際に何を主張しているのかを理解すること――この仕事の他のすべてが乗っている推論の基盤だ。
二度と実行されないノートブックで分析の試作をするだけでなく、大規模にデータを取得・整形・変換できるほど流暢にコードを書く力。
欠損値、重複レコード、不一致な形式といった雑然とした現実世界のデータを、モデルやグラフが実際に使えるものへと変える力。
問題に適したモデルを選び、学習させ、検証する力、そして単純な回帰が複雑なニューラルネットワークに勝る場面を見極める力。
統計的な結果を、過度に単純化したり本当の不確実性を隠したりすることなく、非専門家の経営層が行動に移せるグラフ、メモ、提言に翻訳する力。
特定のビジネスや科学分野の中である指標が実際に何を意味するかを理解し、分析が本当に問われた問いに答えられるようにする力。
夜間のパイプライン実行結果と主要指標のダッシュボードを確認し、その日の優先事項についてチームと短く同期する。
データウェアハウスに対してSQLクエリを書き、テーブルを結合・整形し、欠損値や不整合な値を処理する――通常、一日の中で最も大きな時間帯だ。
本当の休憩であり、しばしば正式な会議に至る前にチーム横断の問題が非公式に持ち上がる場でもある。
統計モデルを構築・改良したり、実験の有意性検定を実行したり、ある指標がなぜ動いたのかを深掘りしたりする。
プロダクトチームやビジネスチームに発見事項を発表したり、A/Bテストの結果をレビューしたり、質問攻めの中で分析の前提を擁護したりする。
プロダクトのローンチや四半期のビジネスレビューの前後を除けば私的な時間で、その時期には夜が土壇場の分析依頼を吸収することがある。
現場で実際に伝えられる技術知 — モチベーション文句ではない。
何かを当てはめる前に、生の分布、散布図、単純な要約統計をプロットすること――この習慣は、そうしなければモデルが静かに吸収し隠してしまう壊れたデータ、単位の誤り、外れ値を発見する。
全体としての傾向は、関連するカテゴリでデータを分割すると完全に逆転することがある――統計学者エドワード・H・シンプソンの1951年の論文にちなんで「シンプソンのパラドックス」として知られるパターンだ。
同じ保留データに対して繰り返し性能を確認し、それに応じてモデルを調整することは、そのデータからモデルへと静かに情報を漏らしてしまう――一度しか触れないことが最終結果の誠実さを保つ。
実際のプロジェクトは、逆ではなく、一貫してデータ準備が約8割、モデリングが約2割という比率に近づく――その逆を前提にスケジュールを組むことが、プロジェクトが遅れる典型的な原因だ。
ときには単なるルールや線形モデルにすぎないベースラインは、より複雑なモデルが実際にどれだけの価値を加えているかを明らかにし、しばしばそれ単体で出荷して十分なほど優れていることもある。
驚くような相関は、真の発見であるよりも隠れた第三の変数によるアーティファクトであることのほうが多い――結果を提示する前に、他に何がそれを説明しうるかを積極的に探すこと。
データ操作と古典的な機械学習で主流の言語で、表形式データにはpandas、標準的なモデリングアルゴリズムにはscikit-learnが使われる。
多くの企業の実際のデータが置かれているリレーショナルおよびクラウドのデータウェアハウス――Snowflake、BigQuery、Redshift――からデータを取り出すためのクエリ言語。
探索的な分析のための標準的な対話型環境で、臨床データサイエンティストが同じ文書の中でコードを実行し、グラフを見て、メモを取れるようにする。
完成した分析を、コードを書かなくても非専門家の関係者が自ら探索し監視できるものに変えるビジネスインテリジェンスのダッシュボードツール。
コード、そしてますますモデルについてもバージョン管理を行うツールで、ノートパソコンでは扱えない規模でデータを保存し学習ジョブを実行するクラウドインフラと合わせて使われる。
多くの統計的比較を行い、有意性の閾値を超えたものだけを報告することは、再現しない誤った発見を生み出す――「p値ハッキング」としてよく知られた失敗のパターンだ。
予測しようとしている結果を符号化してしまう特徴量を誤って含めると、非現実的に強いオフラインの結果が得られるが、モデルが本当に未知の本番データで動いた途端に崩壊する。
単純なSQLクエリやスプレッドシートの数式でも同じくらいうまく答えられたはずの問題を、丁寧に調整された機械学習モデルで解くことは労力の無駄であり、本当のビジネス上の問いを見失いかねない。
分野だけでなく、6つのスコアが近い職業です。
デジタル攻撃を発見、防止し、対応することで、システム、データ、人々を保護します。
AI耐性 63 🌬️再生可能な資源を信頼できる電力に変える、風力、太陽光、蓄電、送電網のシステムを設計・構築・改善する。
AI耐性 72 🦾感知し、判断し、物理世界で行動する機械を設計する仕事。真の難問は知能ではなく、世界そのものだった。
AI耐性 65 🌿組織が事業上の義務を果たしながら環境・社会への害を減らせるよう、戦略、測定、報告を主導する。
AI耐性 66 🔌自動車のブレーキから核ミサイルの誘導システムまで、あらゆるコンピュータや携帯電話の中にあるトランジスタを設計・製造する。地球上でごく一部の工場しか動かせないほど精密な機械を使う仕事だ。
AI耐性 60 📦本番環境で機械学習モデルを訓練・配備・監視・ガバナンスするためのシステムを構築する仕事。
AI耐性 54黒板一枚から3000人の共著者を抱える加速器論文まで、物質・エネルギー・空間・時間を支配する数学的法則を導き検証する仕事。
AI耐性 65 🧬生命そのものを研究する科学者。リンネが種を手作業で命名した時代から、CRISPRでゲノムを編集する今日まで、あらゆる着想を生きた生物で検証し続けてきた。
AI耐性 64 🧪物質そのものを作り、測る科学者——バビロニアのタプティの蒸留器から今日のロボット実験室まで、スペクトルの意味を決めるのは常にこの人だ。
AI耐性 70 📊データからパターンを見つけ予測モデルを構築する職業――2008年生まれの肩書きだが、その土台には数値を数え、検証し、可視化してきた3世紀分の営みがある。
AI耐性 38 🔭バビロニアの粘土板から宇宙望遠鏡まで、宇宙を測り続ける科学者。今もデータの中のどの揺らぎが発見なのかを見極めている。
AI耐性 70 🧮バビロニアの書記からフィールズ賞受賞者、AI支援証明まで――困難な問いを恒久的な確実性へと変え続けてきた職業、一つの定理ごとに。
AI耐性 70 🧿コンピューティング、センシング、通信、材料研究のために量子状態を利用する装置を構築し、測定し、制御する。
AI耐性 78