KI-Forscher · Entwirft und testet die Algorithmen hinter der maschinellen Intelligenz in einem Bereich, der derzeit darum kämpft, einen wachsenden Teil seines eigenen Forschungsprozesses zu automatisieren.
Die meisten Tage verteilen sich auf das Lesen aktueller Artikel, das Schreiben und Debuggen von Trainingscode, das Warten und Analysieren der Ergebnisse von Langzeitexperimenten und die Diskussion der Ergebnisse mit Mitarbeitern. Entgegen der landläufigen Meinung besteht ein großer Teil der Arbeit darin, zu diagnostizieren, warum ein Modell leistungsschwach ist oder sich ein Ergebnis nicht reproduzieren lässt, und nicht darin, neue Architekturen von Grund auf zu entwickeln.
Brauche ich einen Doktortitel, um KI-Forscher zu werden?
Für eine unabhängige Forschungstätigkeit an einer Universität oder einem Spitzenlabor der Industrie gilt dies praktisch – ein Doktortitel bleibt die eigentliche Qualifikation auf diesem Gebiet, da es keine Lizenzprüfung gibt. Starke Ingenieure ohne einen solchen kommen zunehmend über Industrie-Residency-Programme oder eine öffentliche Aufzeichnung von Open-Source-Arbeiten und zitierten Vorabdrucken herein, aber Titel wie „Forscher“ sind immer noch stark auf Doktoranden ausgerichtet.
Ist die KI-Forschung selbst durch KI gefährdet?
Teile davon sind eindeutig: Literaturzusammenfassungen, Standard-Experimentcode und erste Entwürfe zu verwandten Arbeitsabschnitten werden bereits routinemäßig KI-unterstützt, und Labore experimentieren offen mit Systemen, die ihre eigenen Experimente vorschlagen und durchführen. Es hat sich als viel schwieriger erwiesen, zu formulieren, was ein Ergebnis tatsächlich bedeutet, und die Verantwortung für eine veröffentlichte Behauptung zu übernehmen.
Wie viel verdienen KI-Forscher?
Es variiert enorm je nach Arbeitgeber und Dienstalter. Der US-Median für die breitere Kategorie „Computer- und Informationsforschungswissenschaftler“ lag im Jahr 2024 bei 140.910 US-Dollar, aber neue Doktoranden, die in das Forschungslabor eines großen Technologieunternehmens eintreten, beginnen oft deutlich darüber, und einer kleinen Anzahl leitender Forscher in Grenzlabors für künstliche Intelligenz wurden Berichten zufolge im Rahmen des Einstellungswettbewerbs 2024–2025 Gesamtpakete im sieben- oder achtstelligen Bereich angeboten.
Was ist der Unterschied zwischen einem KI-Forscher und einem Ingenieur für maschinelles Lernen?
Die Grenzen verschwimmen ständig, aber es gibt eine grobe Unterscheidung: Das Ergebnis eines Forschers ist normalerweise eine Arbeit, eine neue Methode oder eine Einsicht darüber, warum etwas funktioniert, beurteilt durch Peer-Review; Bei der Leistung eines Ingenieurs handelt es sich in der Regel um ein funktionierendes System in der Produktion, gemessen daran, ob es ausgeliefert wird und der realen Nutzung standhält. Viele Menschen tun im Laufe ihrer Karriere beides.
Welche Programmiersprachen und Tools nutzt die KI-Forschung?
Python dominiert, gepaart mit einem Deep-Learning-Framework – PyTorch ist heute in der Forschung am weitesten verbreitet, während JAX für groß angelegte und mit Google verbundene Arbeiten beliebt ist. Über den Code hinaus sind Forscher auf gemeinsam genutzte GPU- oder TPU-Rechencluster, Experiment-Tracking-Tools wie Weights & Biases und arXiv angewiesen, wo die meisten neuen Ergebnisse Monate vor dem formellen Peer-Review als Vorabdrucke im Umlauf sind.
Das Bild eines Forschers, der in einem Geistesblitz einen cleveren neuen Algorithmus erfindet, ist größtenteils falsch. Die meisten Tage werden damit verbracht, Experimente durchzuführen, die auf nicht aussagekräftige Weise scheitern, man liest, was hunderte andere Labore diesen Monat veröffentlicht haben, und versucht herauszufinden, ob ein vielversprechendes Ergebnis echt ist oder ein Artefakt eines glücklichen Zufallssamens.
Bei dem in diesem Bereich weitergegebenen Handwerk geht es weniger darum, welche Architektur man sich merken sollte, als vielmehr um experimentelle Disziplin: wie man herausfindet, was tatsächlich zu einer Verbesserung geführt hat, wann man einem Benchmark vertrauen sollte und wann nicht und wie man verhindern kann, dass ein negatives Ergebnis stillschweigend weggeworfen wird.
Was die Arbeit verlangt
Mathematische Grundlagen
88
Programmierung und Systeme
74
Experimentelle Strenge
85
Literatursynthese
66
Geschmack erforschen
84
Schreiben und Kommunikation
62
Mathematische Grundlagen
Lineare Algebra, Wahrscheinlichkeitsrechnung, Berechnung und Optimierung sind die Sprachen, in denen fast jedes Modell und jede Arbeit geschrieben wird; Ohne sie sind neue Methoden nicht nur ungewohnt, sondern unlesbar.
Programmierung und Systeme
Schreiben Sie effizienten Code in Python und einem Deep-Learning-Framework und verstehen Sie ausreichend verteilte Systemtechnik, um Trainingsjobs auf Dutzenden oder Tausenden von Prozessoren auszuführen.
Experimentelle Strenge
Entwerfen Sie kontrollierte Vergleiche, führen Sie genügend zufällige Seeds aus, um einem Ergebnis zu vertrauen, und isolieren Sie, welche spezifische Änderung tatsächlich eine Verbesserung verursacht hat, anstatt die offensichtliche Erklärung anzunehmen.
Literatursynthese
Mit der Veröffentlichung von Zehntausenden neuer Vorabdrucke pro Jahr Schritt zu halten und zu erkennen, welche davon wirklich wichtig sind, ist mittlerweile eine eigenständige Fähigkeit.
Geschmack erforschen
Die Wahl einer der vielen plausiblen Richtungen ist Monate der Berechnung und Aufmerksamkeit wert – die Fähigkeit, die am schwierigsten direkt vermittelt werden kann und die normalerweise durch die Zusammenarbeit mit einem erfahrenen Berater erlernt wird.
Schreiben und Kommunikation
Ein Ergebnis, das nicht klar genug formuliert werden kann, um die Begutachtung durch Fachkollegen zu überstehen, oder einem nicht spezialisierten Geldgeber erklärt werden kann, hat Schwierigkeiten, irgendeine Wirkung zu erzielen, egal wie real es ist.
Ein Tag im Leben
8–10Läufe prüfen und lesen
Überprüfen Sie die Ergebnisse der über Nacht durchgeführten Experimente und überfliegen Sie neue arXiv-Preprints und Diskussionen im Laborchat, bevor die konzentrierte Arbeit des Tages beginnt.
10–13Deep Work: Experimente und Code
Der am besten geschützte Block des Tages, der damit verbracht wird, Trainingscode zu schreiben, ein Modell zu debuggen oder das nächste Experiment in einer Reihe zu entwerfen.
13–14Mittagessen
Wird oft mit Laborkollegen gegessen und ist häufig der Rahmen für einen informellen Gedankenaustausch, zu dem es bei einem geplanten Treffen selten kommt.
14–16Treffen und Lesegruppe
Laborbesprechungen, Einzelgespräche mit einem Berater oder Manager und eine rotierende Lesegruppe, in der jemand einen Aufsatz vorträgt, den die Gruppe verstehen muss.
16–19Analyse und Schreiben
Erforschen Sie, warum ein Experiment funktioniert hat oder nicht, aktualisieren Sie ein gemeinsames Ergebnisdokument und entwerfen Sie Abschnitte eines Papiers vor Ablauf einer Frist.
19–8Außerhalb der Uhr (meistens)
Persönliche Zeit – außer in den Wochen vor einem wichtigen Konferenztermin, wenn die Abende und Wochenenden routinemäßig in der Fertigstellung von Experimenten verschwinden.
Das Know-how
Handwerkswissen, das Praktiker tatsächlich weitergeben — keine Motivationssprüche.
01
Überpassen Sie zunächst eine einzelne Charge
Bevor Sie einem Trainingslauf für den gesamten Datensatz vertrauen, prüfen Sie, ob das Modell seinen Verlust bei einigen wenigen Beispielen auf nahezu Null bringen kann. Wenn es sich nicht einmal zehn Beispiele merken kann, liegt der Fehler im Code und nicht in den Daten.
02
Stimmen Sie die Grundlinie genauso stark ab wie die neue Idee
Ein überraschender Anteil der veröffentlichten „Verbesserungen“ schrumpft oder verschwindet, sobald die Vergleichsbasislinie das gleiche Hyperparameter-Suchbudget wie die neue Methode erhält – ein Muster, das sowohl in GANs als auch in Sprachmodellen dokumentiert ist.
03
Entfernen Sie jeweils eine Änderung
Wenn eine neue Methode mit fünf gebündelten Änderungen eine alte übertrifft, entfernen Sie jede Änderung einzeln und testen Sie sie erneut, bevor Sie eine einzelne Idee erwähnen – andernfalls können die Geschichte der Arbeit und die tatsächliche Ursache des Gewinns stillschweigend auseinandergehen.
04
Misstrauen Sie einem Benchmark, anhand dessen Sie ebenfalls optimieren
Eine Bestenlistenzahl misst die allgemeinen Fähigkeiten nicht mehr, sobald Forscher sich wiederholt direkt dagegen orientieren – eine Dynamik, die seit langem als Goodharts Gesetz bekannt ist und in Kritiken zur Benchmark-Sättigung in NLP und Vision direkt zitiert wird.
05
Schreiben Sie die Behauptungen vor dem letzten Experiment
Die frühzeitige Ausarbeitung der Kernaussagen eines Papiers erzwingt ein konkretes, verfälschbares Ziel für die verbleibenden Experimente, anstatt zunächst Experimente durchzuführen und eine Erzählung rund um das zusammenzustellen, was sich als erfolgreich erwiesen hat.
06
Protokollieren Sie, was nicht funktioniert hat, nicht nur, was funktioniert hat
Fehlgeschlagene Konfigurationen, Seeds und Hyperparameter werden normalerweise weggeworfen, wenn ein Lauf fehlschlägt, aber ihre Aufzeichnung verhindert, dass ein Labor sechs Monate später stillschweigend dieselbe Sackgasse unter einem anderen Namen erneut ausführen kann.
Werkzeuge des Handwerks
PyTorch / JAX
Die beiden vorherrschenden Deep-Learning-Frameworks; PyTorch ist in den meisten akademischen und industriellen Forschungen führend, während JAX für groß angelegte und mit Google verbundene Arbeiten beliebt ist.
GPU/TPU-Rechencluster
Geteilte Cluster, geplant mit Tools wie Slurm, die einen Modellentwurf in ein tatsächlich trainiertes Netzwerk verwandeln – oft die größte Einschränkung für die möglichen Experimente.
arXiv
Der De-facto-Publikationsort des Fachgebiets in der Praxis: Neue Ergebnisse zirkulieren hier als Vorabdrucke, oft Monate vorher oder ganz ohne formelle Begutachtung durch Fachkollegen.
Gewichte und Verzerrungen / TensorBoard
Dashboards zur Experimentverfolgung, die Verlustkurven, Hyperparameter und Ausgaben über Hunderte von Durchläufen hinweg protokollieren, ohne die der Vergleich von Experimenten nicht möglich wäre.
Jupyter-Notizbücher
Interaktive Umgebungen für die schnelle Datenexploration, das Debuggen des Verhaltens eines Modells anhand bestimmter Beispiele und die Erstellung von Prototypen, bevor der Code in eine vollständige Trainingspipeline übergeht.
Wie man daran scheitert
Ohne Mechanismus auf der Jagd nach Bestenlistengewinnen
Das Erzielen einer partiellen Genauigkeitsverbesserung durch eine zusätzliche Hyperparametersuche oder -skalierung ohne eine Hypothese darüber, warum dies funktioniert, führt zu Ergebnissen, auf denen andere nur schwer aufbauen können, selbst wenn die Zahl selbst real ist.
Es werden nur die besten zufälligen Samen gemeldet
Das Ausführen vieler Seeds und das Veröffentlichen nur des besten Seeds anstelle eines Mittelwerts und einer Spread lässt gewöhnliches Rauschen wie einen echten Effekt aussehen – ein Problem, das in Reinforcement-Learning- und NLP-Reproduzierbarkeitsstudien immer wieder hervorgehoben wird.
Unveröffentlichte Daten oder Rechenvorteile
Testdaten, die in einen Korpus vor dem Training gelangt sind, oder ein Rechenbudget, das stillschweigend größer ist als ein Papierbericht, können die Reproduzierbarkeit eines Ergebnisses unmöglich machen – und wenn sie einmal entdeckt werden, schädigen sie die Glaubwürdigkeit eines Forschers mehr, als dies bei einem bescheidenen, ehrlichen Ergebnis der Fall gewesen wäre.
Ähnliche Berufe
Die nächsten Nachbarn im Sechs-Werte-Profil — nicht nur im selben Feld.