🤖실무와 노하우

AI 연구원 · 기계 지능을 구현하는 알고리즘을 설계하고 검증하는 직업으로, 이제는 이 분야 스스로 연구 과정의 상당 부분을 자동화하는 경쟁에 뛰어들고 있다.

번뜩이는 통찰의 순간에 영리한 새 알고리즘을 발명해내는 연구자라는 이미지는 대체로 사실과 다르다. 대부분의 날은 별다른 단서도 주지 못한 채 실패하는 실험을 돌리고, 이달에 다른 수백 개 연구소가 발표한 논문을 읽고, 유망해 보이는 결과가 진짜인지 아니면 운 좋은 무작위 시드가 만들어낸 우연인지를 가려내려 애쓰며 지나간다.

이 분야 안에서 전수되는 기술은 어떤 아키텍처를 외우는가보다는 실험의 규율에 가깝다. 실제로 무엇이 성능 향상을 일으켰는지 어떻게 가려낼지, 벤치마크를 언제 믿고 언제 믿지 말아야 할지, 그리고 부정적인 결과가 조용히 묻히지 않게 하려면 어떻게 해야 할지에 관한 것이다.

이 일이 요구하는 역량

887485668462
수학적 기초
88
프로그래밍과 시스템
74
실험적 엄밀성
85
문헌 종합
66
연구 안목
84
글쓰기와 소통
62

수학적 기초

선형대수학, 확률론, 미적분학, 최적화는 거의 모든 모델과 논문이 쓰여진 언어다. 이것이 없으면 새로운 방법론은 낯선 정도가 아니라 아예 읽을 수 없는 것이 된다.

프로그래밍과 시스템

파이썬과 딥러닝 프레임워크로 효율적인 코드를 작성하고, 수십에서 수천 개의 프로세서에 걸쳐 훈련 작업을 실행할 수 있을 만큼 분산 시스템 엔지니어링을 이해하는 능력이다.

실험적 엄밀성

통제된 비교를 설계하고, 결과를 신뢰할 수 있을 만큼 충분한 무작위 시드로 실험을 반복하며, 명백해 보이는 설명을 그냥 받아들이는 대신 실제로 어떤 변화가 성능 향상을 일으켰는지 가려내는 능력이다.

문헌 종합

매년 수만 편의 새 프리프린트가 쏟아지는 이 분야를 따라가면서, 그중 실제로 중요한 몇 편을 가려내는 일 자체가 이제 하나의 독립된 역량이다.

연구 안목

그럴듯해 보이는 여러 방향 중 어느 것이 몇 달치 연산과 관심을 투자할 가치가 있는지 선택하는 능력이다. 직접 가르치기 가장 어려운 역량으로, 대개 숙련된 지도교수 곁에서 함께 일하며 체득한다.

글쓰기와 소통

동료 심사를 통과할 만큼 명확하게 글로 정리되지 못하거나, 비전문가인 투자자에게 설명되지 못하는 결과는 그것이 아무리 진짜라 해도 영향력을 갖기 어렵다.

하루의 풍경

실행 결과 확인과 독서몰입 작업: 실험과 코드점심회의와 논문 스터디분석과 집필퇴근 후(대체로) 036912151821 24h
  1. 8–10 실행 결과 확인과 독서

    그날의 집중 작업이 시작되기 전, 밤새 돌아간 실험 결과를 검토하고 새로 올라온 arXiv 프리프린트와 연구실 채팅방의 논의를 훑어본다.

  2. 10–13 몰입 작업: 실험과 코드

    하루 중 가장 잘 보호되는 시간대로, 훈련 코드를 작성하거나 모델을 디버깅하거나 다음 실험을 설계하는 데 쓰인다.

  3. 13–14 점심

    흔히 연구실 동료들과 함께하며, 정식 회의에서는 좀처럼 나오지 않는 비공식적인 아이디어 교환이 이루어지는 자리이기도 하다.

  4. 14–16 회의와 논문 스터디

    연구실 미팅, 지도교수나 매니저와의 일대일 면담, 그리고 돌아가며 누군가가 그룹이 알아야 할 논문을 발표하는 스터디 모임이 있다.

  5. 16–19 분석과 집필

    실험이 왜 작동했는지 혹은 왜 작동하지 않았는지 파고들고, 공유 결과 문서를 업데이트하며, 마감을 앞두고 논문의 일부를 작성한다.

  6. 19–8 퇴근 후(대체로)

    개인 시간이다. 다만 주요 학회 마감을 앞둔 몇 주간은 예외로, 저녁과 주말이 실험 마무리에 통째로 사라지는 일이 흔하다.

노하우

현장에서 실제로 전수되는 기술 지식 — 동기부여 문구가 아니다.

01

먼저 배치 하나에 과적합시켜라

전체 데이터셋에 대한 훈련 실행을 신뢰하기 전에, 극소수의 예시만으로 모델이 손실을 거의 0까지 낮출 수 있는지 먼저 확인하라. 예시 열 개조차 외우지 못한다면, 버그는 데이터가 아니라 코드에 있는 것이다.

안드레이 카르파티(Andrej Karpathy), 'A Recipe for Training Neural Networks', 2019년
02

새 아이디어만큼 베이스라인도 열심히 튜닝하라

비교 대상이 되는 베이스라인에 새 방법론과 동일한 하이퍼파라미터 탐색 예산을 부여하면, 발표된 '개선'의 상당 부분이 줄어들거나 사라진다. 이는 GAN과 언어 모델 양쪽에서 모두 기록된 패턴이다.

Lucic 외, 'Are GANs Created Equal? A Large-Scale Study'(2018년)와 Melis 외(2017년)의 LSTM 베이스라인 연구에서도 반복적으로 확인됨
03

한 번에 한 가지 변화만 제거해 검증하라

다섯 가지 변화를 한데 묶은 새 방법론이 기존 방법론을 능가한다면, 어떤 하나의 아이디어에 공을 돌리기 전에 각 변화를 독립적으로 제거하며 재검증하라. 그렇지 않으면 논문이 말하는 이야기와 실제 성과의 원인이 조용히 어긋날 수 있다.

2010년대 이후 머신러닝 방법론 전반에서 정형화된 표준 절제 연구(ablation study) 관행
04

직접 최적화하고 있는 벤치마크는 의심하라

연구자들이 특정 리더보드 수치에 직접 맞춰 반복적으로 튜닝하기 시작하면, 그 수치는 더 이상 일반적인 능력을 측정하지 못하게 된다. 이는 오래전부터 '굿하트의 법칙(Goodhart's law)'으로 알려진 현상이며, 자연어처리와 비전 분야 전반의 벤치마크 포화 비판에서 직접 인용된다.

굿하트의 법칙. 인류학자 매릴린 스트래선(Marilyn Strathern)이 1997년 현대적 형태로 대중화함
05

마지막 실험 전에 주장을 먼저 써라

논문의 핵심 주장을 미리 작성해두면, 실험을 먼저 돌린 뒤 우연히 작동한 결과를 중심으로 이야기를 짜맞추는 대신, 남은 실험을 위한 구체적이고 반증 가능한 목표를 강제로 세우게 된다.

박사과정 지도에서 흔히 쓰이는 관행으로, 여러 연구실의 '논문 쓰는 법' 지침에서 널리 반복됨
06

성공한 것뿐 아니라 실패한 것도 기록하라

실패한 설정, 시드, 하이퍼파라미터는 대개 실행이 실패하면 그대로 버려지지만, 이를 기록해두면 여섯 달 뒤 다른 이름으로 같은 막다른 길을 조용히 다시 밟는 일을 막을 수 있다.

실험물리학과 생물학에서 빌려온 표준 실험 노트 관행

일의 도구들

PyTorch / JAX

가장 널리 쓰이는 두 딥러닝 프레임워크다. 학계와 업계 연구 대부분에서 파이토치(PyTorch)가 앞서 있고, JAX는 대규모 작업이나 구글 계열 연구에서 인기가 있다.

GPU/TPU 연산 클러스터

Slurm 같은 도구로 스케줄링되는 공유 클러스터로, 모델 설계를 실제로 훈련된 신경망으로 바꿔준다. 흔히 어떤 실험이 가능한지를 가르는 가장 큰 제약 요인이다.

arXiv

사실상 이 분야의 실질적인 발표 창구다. 새로운 결과는 여기서 프리프린트 형태로 유통되며, 흔히 정식 동료 심사보다 몇 달 앞서, 때로는 아예 심사 없이 공개된다.

Weights & Biases / TensorBoard

수백 번의 실행에 걸쳐 손실 곡선, 하이퍼파라미터, 출력값을 기록하는 실험 추적 대시보드다. 이것이 없으면 실험 간 비교는 관리 불가능한 수준이 된다.

주피터 노트북(Jupyter notebooks)

빠른 데이터 탐색, 특정 사례에서 모델의 동작을 디버깅하는 작업, 그리고 코드가 완전한 훈련 파이프라인으로 옮겨가기 전 프로토타이핑을 위한 대화형 환경이다.

실패하는 이유

메커니즘 없이 리더보드 점수만 좇기

왜 효과가 있는지에 대한 가설 없이 추가적인 하이퍼파라미터 탐색이나 규모 확장만으로 미세한 정확도 향상을 짜내면, 그 수치 자체가 진짜라 해도 다른 누구도 그 위에 무언가를 쌓아 올리기 어려운 결과가 나온다.

가장 좋은 무작위 시드만 보고하기

여러 시드를 돌리고도 평균과 분산 대신 가장 좋은 결과 하나만 발표하면, 평범한 잡음이 진짜 효과처럼 보이게 된다. 이는 강화학습과 자연어처리 재현성 연구에서 거듭 지적된 문제다.

공개하지 않은 데이터나 연산상의 이점

테스트 데이터가 사전훈련 말뭉치에 유출되었거나, 논문이 밝힌 것보다 실제 연산 예산이 조용히 더 컸다면 그 결과는 재현이 불가능해질 수 있다. 그리고 이것이 드러나면, 소박하지만 정직한 결과였을 때보다 연구자의 신뢰도에 훨씬 큰 타격을 준다.

계속 탐색하기