먼저 배치 하나에 과적합시켜라
전체 데이터셋에 대한 훈련 실행을 신뢰하기 전에, 모델이 극소수 예시 몇 개에 대해 손실을 거의 0으로 낮출 수 있는지 확인하라. 열 개도 암기하지 못한다면 버그는 데이터가 아니라 코드에 있는 것이다.
진한 칸일수록 이 직업에서 해당 지표가 높습니다.
낮음높음
대부분의 시간은 최근 논문을 읽고, 훈련 코드를 작성하고 디버깅하고, 오래 실행되는 실험 결과를 기다리며 분석하고, 협업자와 발견 사항을 논의하는 데 나뉘어 쓰인다. 대중적 이미지와 달리, 업무의 큰 비중은 새로운 아키텍처를 처음부터 구상하는 것이 아니라 모델의 성능이 왜 부진한지, 왜 결과가 재현되지 않는지를 진단하는 데 있다.
대학이나 최상위 산업 연구소에서 독립적인 연구직을 맡으려면 사실상 그렇다. 자격시험이 존재하지 않으므로 박사 학위가 이 분야의 실질적 자격증 역할을 한다. 박사 학위가 없는 뛰어난 엔지니어들은 산업체 레지던시 프로그램이나 오픈소스 작업과 인용된 프리프린트라는 공개 기록을 통해 점점 더 많이 진입하고 있지만, '연구 과학자' 같은 직함은 여전히 박사 학위 소지자에게 크게 치우쳐 있다.
일부는 명백히 그렇다. 문헌 요약, 상용구 실험 코드, 관련 연구 초안 작성은 이미 일상적으로 AI의 도움을 받고 있으며, 일부 연구소는 스스로 실험을 제안하고 실행하는 시스템을 공공연히 실험하고 있다. 그러나 결과가 실제로 무엇을 의미하는지 해석하고 발표된 주장에 책임을 지는 일은 넘겨주기 훨씬 어려운 것으로 드러났다.
고용주와 연차에 따라 편차가 매우 크다. 미국의 더 넓은 '컴퓨터 및 정보 연구 과학자' 범주 중위 연봉은 2024년 $140,910였지만, 대형 기술기업 연구소에 합류하는 신규 박사들은 흔히 이보다 훨씬 높은 금액으로 시작하며, 2024~2025년 채용 경쟁 중 프런티어 AI 연구소의 극소수 시니어 연구원들은 7~8자리 숫자에 달하는 총보상 패키지를 제안받았다고 알려져 있다.
경계는 끊임없이 흐려지지만, 대략적인 구분은 유지된다. 연구원의 산출물은 대개 논문, 새로운 방법, 또는 무언가가 왜 작동하는지에 대한 통찰이며 동료 심사로 평가받는다. 엔지니어의 산출물은 대개 실제 운영 중인 시스템이며, 출시되고 실사용에서 버텨내는지로 평가받는다. 많은 사람들이 경력 동안 둘 다를 겸한다.
파이썬이 지배적이며 딥러닝 프레임워크와 함께 쓰인다. 파이토치가 현재 연구에서 가장 흔히 쓰이고, 구글 관련 대규모 작업에는 JAX가 인기가 있다. 코드 외에도 연구자들은 공유 GPU·TPU 컴퓨팅 클러스터, Weights & Biases 같은 실험 추적 도구, 그리고 대부분의 새로운 결과가 공식 동료 심사 몇 달 전에 프리프린트로 유통되는 arXiv에 의존한다.
번뜩이는 통찰의 순간에 영리한 새 알고리즘을 발명하는 연구원의 이미지는 대체로 틀렸다. 대부분의 시간은 이유를 알 수 없이 실패하는 실험을 돌리고, 이번 달에 다른 수백 개 연구소가 발표한 것을 읽고, 유망해 보이는 결과가 진짜인지 아니면 운 좋은 무작위 시드의 산물인지 가려내려 애쓰는 데 쓰인다.
이 분야에서 전수되는 기술은 어떤 아키텍처를 외울지가 아니라 실험적 규율에 더 가깝다. 실제로 무엇이 개선을 일으켰는지 분리하는 법, 벤치마크를 언제 믿고 언제 믿지 말아야 하는지, 그리고 부정적 결과가 조용히 버려지지 않게 지키는 법 말이다.
선형대수, 확률론, 미적분, 최적화는 거의 모든 모델과 논문이 쓰인 언어다. 이것 없이는 새로운 방법이 낯선 것이 아니라 읽을 수 없는 것이 된다.
파이썬과 딥러닝 프레임워크로 효율적인 코드를 작성하고, 수십에서 수천 개의 프로세서에 걸쳐 훈련 작업을 실행할 수 있을 만큼의 분산 시스템 엔지니어링을 이해하는 것.
통제된 비교를 설계하고, 결과를 신뢰할 만큼 충분한 무작위 시드를 실행하며, 뻔한 설명을 가정하는 대신 실제로 어떤 특정 변화가 개선을 일으켰는지 분리하는 것.
매년 수만 편의 새로운 프리프린트를 발표하는 이 분야를 따라잡고, 그중 실제로 중요한 소수를 가려내는 것은 이제 그 자체로 하나의 기술이다.
여러 그럴듯한 방향 중 어느 것이 몇 달간의 연산과 관심을 쏟을 가치가 있는지 선택하는 것 — 직접 가르치기 가장 어려운 기술로, 대개 경험 많은 지도교수 곁에서 일하며 흡수된다.
동료 심사를 통과할 만큼 명확하게 작성되지 않거나 비전문가 자금 제공자에게 설명될 수 없는 결과는, 아무리 진짜라 해도 영향력을 갖기 어렵다.
밤새 진행된 실험 결과를 검토하고, 하루의 집중 작업이 시작되기 전 새 arXiv 프리프린트와 연구실 채팅방 논의를 훑어본다.
하루 중 가장 잘 보호받는 시간대로, 훈련 코드를 작성하고 모델을 디버깅하거나 일련의 실험 중 다음 단계를 설계하는 데 쓰인다.
흔히 연구실 동료들과 함께하며, 예정된 회의로는 좀처럼 나오지 않는 종류의 비공식적 아이디어 교환이 벌어지는 자리이기도 하다.
연구실 회의, 지도교수나 매니저와의 일대일 면담, 그리고 누군가 그룹이 이해해야 할 논문을 발표하는 순환식 독서 모임.
실험이 왜 성공하거나 실패했는지 파고들고, 공유된 결과 문서를 업데이트하며, 마감을 앞두고 논문의 일부를 초안하는 시간.
개인 시간 — 다만 주요 학회 마감 몇 주 전에는 저녁과 주말이 남은 실험을 끝내느라 일상적으로 사라진다.
현장에서 실제로 전수되는 기술 지식 — 동기부여 문구가 아니다.
전체 데이터셋에 대한 훈련 실행을 신뢰하기 전에, 모델이 극소수 예시 몇 개에 대해 손실을 거의 0으로 낮출 수 있는지 확인하라. 열 개도 암기하지 못한다면 버그는 데이터가 아니라 코드에 있는 것이다.
발표된 '개선'의 놀랄 만큼 큰 비중이, 비교 기준선이 새 방법과 동일한 하이퍼파라미터 탐색 예산을 받으면 줄어들거나 사라진다 — GAN과 언어 모델 양쪽에서 문서화된 패턴이다.
다섯 가지 변화를 한데 묶은 새 방법이 이전 방법을 이길 때, 각 변화를 독립적으로 제거하고 재검증한 뒤에야 어느 한 아이디어의 공로로 돌려야 한다 — 그렇지 않으면 논문의 서사와 실제 개선 원인이 조용히 갈라질 수 있다.
연구자들이 반복적으로 리더보드 숫자에 직접 맞춰 튜닝하는 순간, 그 숫자는 일반적 능력을 측정하는 것을 멈춘다 — 굿하트의 법칙이라 오래 알려진 역학이며, NLP와 비전 전반의 벤치마크 포화 비판에서 직접 인용된다.
논문의 핵심 주장을 일찍 작성해두면 남은 실험에 대한 구체적이고 반증 가능한 목표가 생긴다. 실험을 먼저 돌리고 나서 우연히 성공한 것을 중심으로 서사를 짜맞추는 것과는 다르다.
실행이 실패하면 실패한 설정, 시드, 하이퍼파라미터는 대개 버려지지만, 이를 기록해두면 연구실이 6개월 후 다른 이름으로 같은 막다른 길을 조용히 다시 밟는 것을 막을 수 있다.
지배적인 두 딥러닝 프레임워크다. 파이토치는 대부분의 학계·산업 연구에서 앞서 있고, JAX는 대규모 및 구글 관련 작업에서 인기가 있다.
Slurm 같은 도구로 일정이 관리되는 공유 클러스터로, 모델 설계를 실제로 훈련된 네트워크로 바꿔준다 — 어떤 실험이 가능한지를 결정하는 단일 최대 제약인 경우가 많다.
이 분야의 사실상 발표 창구로, 새로운 결과가 공식 동료 심사보다 흔히 몇 달 앞서, 또는 아예 그것 없이 프리프린트로 유통된다.
수백 번의 실행에 걸쳐 손실 곡선, 하이퍼파라미터, 산출물을 기록하는 실험 추적 대시보드로, 이것 없이는 실험 비교가 감당할 수 없게 된다.
빠른 데이터 탐색, 특정 사례에 대한 모델 동작 디버깅, 그리고 코드가 완전한 훈련 파이프라인으로 옮겨가기 전 프로토타이핑을 위한 대화형 환경.
왜 작동하는지에 대한 가설 없이 추가적인 하이퍼파라미터 탐색이나 규모 확장만으로 소수점 단위의 정확도 개선을 짜내면, 그 숫자 자체는 진짜라 해도 다른 누군가가 이를 발판 삼기 어려운 결과를 만든다.
여러 시드를 실행하고 평균과 분산 대신 가장 좋은 것 하나만 발표하면 평범한 노이즈가 진짜 효과처럼 보이게 된다 — 강화학습과 NLP 재현성 연구에서 반복적으로 지적된 문제다.
사전훈련 코퍼스에 유출된 테스트 데이터, 또는 논문이 보고하는 것보다 실제로 훨씬 큰 연산 예산은 결과 재현을 불가능하게 만들 수 있으며, 발각되면 겸손하고 정직한 결과보다 연구자의 신뢰도에 더 큰 타격을 준다.
같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.
컴퓨터, 휴대폰, 무기 등 거의 모든 전자기기 내부의 트랜지스터를 설계하고 제조하며, 지구상 극소수 공장만이 다룰 수 있는 초정밀 장비를 다룬다.
AI 내성 60 📦프로덕션 환경에서 기계 학습 모델을 교육, 배포, 모니터링 및 관리하는 시스템을 구축합니다.
AI 내성 54 🩺단 한 번의 수술이 아니라 진찰과 근거를 통해 질병을 진단하고 이후 수년간 건강을 관리하는 사람 — 의학의 제너럴리스트이자 장기적인 동반자.
AI 내성 67 🧠약물치료와 정신치료로 정신질환을 진단하고 치료하며, 위기 상황의 환자를 법적 권한으로 강제 입원시킬 수 있는 몇 안 되는 의료 전문분야 중 하나다.
AI 내성 73 👔의뢰인에게 조언하고 그들을 구속하는 문서를 작성하며 사건이 법정에 이르면 대신 다투는 직업으로, 조언이 잘못되면 개인적으로 법적 책임을 진다.
AI 내성 58 🔐디지털 공격을 찾아내고 예방하며 대응함으로써 시스템, 데이터, 사람을 지킨다.
AI 내성 63현대 사회를 움직이는 코드를 작성하고 테스트하고 유지보수하는 직업이며, AI가 자기 일상 업무를 자동화하는 모습을 가장 먼저 지켜보는 직업 중 하나다.
AI 내성 35 🛰️지상을 벗어나는 항공기, 로켓, 우주선을 설계하고 분석하고 인증하며, 추측의 여지가 없는 안전 여유를 다루는 직업이다.
AI 내성 74 🌉강과 바위와 중력을 다리, 도로, 맑은 물로 바꾸는 직업 — 임호테프 이래 문명을 떠받쳐온 조용한 하중지지의 업.
AI 내성 72 🔌컴퓨터, 휴대폰, 무기 등 거의 모든 전자기기 내부의 트랜지스터를 설계하고 제조하며, 지구상 극소수 공장만이 다룰 수 있는 초정밀 장비를 다룬다.
AI 내성 60 🦾물리적 세계를 감지하고 판단하고 행동하는 기계를 설계하는 사람으로, 진짜 난제는 지능이 아니라 언제나 세계 그 자체였다.
AI 내성 65 🔐디지털 공격을 찾아내고 예방하며 대응함으로써 시스템, 데이터, 사람을 지킨다.
AI 내성 63 📦프로덕션 환경에서 기계 학습 모델을 교육, 배포, 모니터링 및 관리하는 시스템을 구축합니다.
AI 내성 54 🌬️재생 가능한 자원을 신뢰할 수 있는 전기로 전환하는 풍력, 태양열, 저장 및 그리드 시스템을 설계, 구축 및 개선합니다.
AI 내성 72