구글 녹취록: 제프 딘이 말하는 추론 하드웨어 특화와 스스로 진화하는 AI 시스템
Y 컴비네이터 스타트업 스쿨 2026, 2026년 9월 20일
AI 모델은 이미 초급 엔지니어 수준일까?
다이아나 후: 자, 시작해 볼까요, 제프?
제프 딘: 네, 좋습니다.
제프 딘: 네, 제프, 환영합니다. 그리고 오늘 이 자리에 함께해 주셔서 정말 감사합니다. 특히 제가 감기에 걸렸는데도 이렇게 참석해 주셔서 감사해요.
제프 딘: 네, 제 목소리가 좀 쉬었네요. 평소에는 이런 목소리가 아닌데, 최선을 다해보겠습니다.
다이아나 후: 제프, 당신은 MapReduce, Bigtable, TensorFlow, TPU, Gemini를 만들었습니다. 당신이 이뤄낸 업적들만으로도 한 시간 전체를 채울 수 있겠지만, 제가 가장 좋아하는 점은 여전히 대중 앞에서 대담한 예측을 내놓는다는 것입니다. 작년 2025년 5월 AI 어센트(AI Ascent)에서 당신은 AI가 초급 엔지니어 수준에 이르렀다고 말씀하셨죠. 그게 대략 1년 전 일입니다. 그 예측에 얼마나 다가가 있나요?
제프 딘: 네, 제 생각엔 모델들이 에이전트 기반의 장기 코딩 작업에서 훨씬 더 능숙해졌습니다. 이제는 실제로 꽤 유능해졌다는 점이 꽤 명확해 보입니다. 초급 엔지니어의 정의를 어떻게 내리느냐에 따라 다르겠지만, 꽤 정확히 맞아떨어졌다고 말할 수 있겠네요.
다이아나 후: 그 예측에서 과소평가했던 점은 무엇인가요?
제프 딘: 점점 더 복잡한 작업을 처리하는 능력이 제가 생각했던 것보다 더 빠르게 성장하고 있다는 점입니다. 또한 코딩 외에도 이러한 에이전트 기반 시스템들이 다른 도메인에서도 진가를 발휘하기 시작했다고 생각합니다. 그것이 앞으로 중요한 트렌드가 될 것입니다.
다이아나 후: 또 다른 대담한 예측을 하나 들려주세요. 2027년 버전은 어떤 모습일까요?
스스로 발전하는 AI 시스템
제프 딘: 머신러닝 시스템 자체의 자동화가 훨씬 더 많이 이루어질 것으로 봅니다. 기본적으로 머신러닝 시스템이 수많은 실험을 실행하고, 문제를 하위 문제로 쪼개고, 그 하위 문제들을 긴밀한 자동 실험 루프 속에서 돌린 뒤, 그 결과를 종합하여 완벽하게 자동화된 문제 분해와 자동 실험을 통해 더 나은 시스템을 도출해내는 것입니다. 이는 정말 흥미로울 것입니다. 그리고 이는 머신러닝뿐만 아니라 다른 과학 및 엔지니어링 분야에도 적용될 것입니다. 측정 가능한 목표를 세울 수 있는 분야라면 무엇이든 요즘 실제로 엄청난 진전을 이룰 수 있다고 생각합니다.
다이아나 후: 자, 역사를 조금 거슬러 올라가 보죠. 2001년 무렵, 구글 검색은 하드 드라이브 위에서 구동되었습니다.
제프 딘: 맞습니다.
다이아나 후: 당시 당신과 산제이(Sanjay)는 계산을 해보고 어느 시점에는 전체 검색 색인이 구동 중인 모든 컴퓨터의 RAM에 완전히 들어간다는 사실을 깨달았습니다. 그 급진적인 깨달음을 얻은 뒤, 산제이와 함께 며칠 만에 하드 드라이브가 아닌 RAM에서 작동하는 완전히 새로운 검색 버전을 프로덕션에 배포했죠. 그것이 바로 구글 검색을 그토록 빠르게 만든 주역이었습니다. 역사는 반복되듯 변주됩니다. 지금 2026년 시점에서 이 방에 있는 모든 이들이 여전히 고민하고 설계해야 할 '메모리에 완벽히 들어맞는(it fits in memory)' 순간은 과연 무엇일까요?
모든 것을 바꾼 구글 검색의 돌파구
제프 딘: 음, 약간 결은 다르지만, 앞으로 고성능 및 저전력 추론 하드웨어 시스템이 점점 더 중요해지는 것을 보게 될 것입니다. 이제 모든 이들이 추론이야말로 이러한 에이전트 기반 시스템을 더 많은 사람들에게 제공하는 핵심이며, 지연 시간(latency)이 정말 중요하고, 하드웨어의 특화야말로 GPU나 TPU 같은 범용 연산 장치보다 훨씬 더 에너지 효율적이고 지연 시간이 짧은 시스템을 만드는 핵심 방법이라는 점을 깨닫고 있습니다. 여기 계신 분들은 모두 모델의 응답을 기다리는 데 익숙해져 있을 겁니다. 기다리는 것은 정말 즐겁지 않은 일이죠.
다이아나 후: 속도의 마스터군요. 즉, 더 이상 기다릴 필요가 없다면 어떻게 되겠냐는 말씀인가요?
제프 딘: 네. 지연 시간이 50배 더 빨라진다면 무엇을 할 수 있을지 상상해 보세요.
몇 주 동안 실행되는 AI 에이전트
다이아나 후: 흥미로운 생각이네요. 그렇다면 현재 이 방에 있는 6,000명의 사람들이 AI에 대해 갖고 있는 생각 중 이미 틀린 가정은 무엇이 있을까요?
제프 딘: 좋은 질문입니다. 아마도 사람들이 에이전트 기반 시스템을 단 한두 시간 동안만 돌리는 것이 아니라, 특정 문제 도메인과 그 기저에 깔린 고성능 모델을 바탕으로 며칠 혹은 몇 주 동안 계속 실행하여 정말 복잡한 작업을 완수하도록 만드는 것이 얼마나 가능한지 아직 완전히 실감하지 못하고 있다는 점일 겁니다. 일부 사람들은 이런 조짐을 보기 시작했지만, 모든 이가 체화했다고는 생각하지 않습니다. 그것은 꽤 큰 변화가 될 것입니다.
다이아나 후: 당신이 직접 실행해 본 작업 중에 몇 주 동안이나 실행된 구체적인 사례가 있나요? 어떤 작업이었고, 에이전트들에게 무엇을 해결하라고 지시했나요?
제프 딘: 더 나은 안전성이나 성능 속성을 가질 수 있도록 완전히 새로운 버전의 소프트웨어를 완전히 다른 프로그래밍 언어로 구현하라고 에이전트에게 지시할 수 있으며, 그러면 에이전트들이 꽤 진지한 수준으로 그 작업을 독자적으로 수행해 낼 수 있습니다.
TPU를 탄생시킨 냅킨 수학
다이아나 후: 정말 멋지군요. 자, 당신은 냅킨 수학의 대가로 아주 잘 알려져 있습니다. 웃긴 이야기처럼 들리겠지만요. 당신에 관한 일화 중 하나는, 2013년 구글에서 음성 인식이 막 작동하기 시작했을 때 모든 구글 사용자가 휴대폰을 꺼내 음성 인식 시스템을 하루에 딱 3분만 사용하더라도 구글 서버 플릿을 두 배로 늘려야 한다는 결론을 냅킨 계산으로 도출해냈다는 것입니다. 단순한 음성 번역을 위해서만 말이죠비용이 엄청나게 들었을 겁니다.
제프 딘: 네.
제프 딘: 그리고 그 대신 맞춤형 칩을 직접 만들었고, 그것이 TPU의 기원 이야기가 되었죠.
제프 딘: 네. 당시 우리가 훈련하던 딥러닝 기반 음성 모델에서 정말 훌륭한 품질의 결과가 나오기 시작했지만, 기존 음성 시스템에 비해 연산 비용이 많이 들었습니다. 하지만 오류율은 절반으로 줄어들었죠. 그것은 모델을 만지고, 규모를 조금 키우고, 더 나은 데이터를 얻는 과정을 불과 몇 달 만에 거친 것만으로 음성 인식 분야에서 20년 치 발전이 이뤄진 것과 맞먹는 수준이었습니다. 그래서 우리는 음성 인식이 훨씬 더 좋아지면 사람들이 더 많이 사용할 것이라는 걱정을 하기 시작했습니다. 그 백 오브 더 엔벨로프(back-of-the-envelope, 약식) 계산은 바로 그 점에 관한 것이었습니다. 사람들이 이메일을 구술하거나 휴대폰에 대고 말하는 등의 용도로 음성 인식을 더 많이 쓰기 시작하면 어떻게 될까? 결국 당시의 CPU 위에서 구동하는 것보다 더 나은 해법이 필요하다는 것을 깨달았습니다. 그래서 오늘날 우리가 사용하는 거의 모든 현대 머신러닝 알고리즘의 핵심인 '저정밀도 밀집 선형 대수(low-precision dense linear algebra)'에 특화된 TPU를 고안해냈습니다. 저정밀도 밀집 선형 대수를 위해 다른 것은 아무것도 하지 못하는 특화된 칩을 만든다면, 크롬이나 워드 같은 프로그램은 실행할 수 없을지라도 머신러닝 추론에는 정말 유용하다는 사실이 드러났습니다. 그 결과 몇 년 후 당사의 CPU 및 GPU보다 에너지 효율이 30~80배 더 높고, 지연 시간도 20~30배 이상 훨씬 짧은 칩을 탄생시킬 수 있었습니다.
다이아나 후: 오늘날 TPU가 이룬 기반을 생각하면 정말 놀랍습니다. 당신이 TPU를 발명했을 당시보다 훨씬 나중에 발명된 트랜스포머(transformer) 아키텍처와 결합하여 TPU가 이토록 근본적인 존재가 될 것이라고는 상상도 못 하셨겠죠.
제프 딘: 네, 그래서 우리가 범용 선형 대수 시스템을 구축한 것입니다. TPU의 본질이 바로 그것이니까요. 우리는 머신러닝 알고리즘이 여전히 진화하고 있으며 지나치게 특화해서는 안 된다는 점을 알았지만, 동시에 아주 큰 곱셈 유닛을 가짐으로써 얻을 수 있는 엄청난 성능 향상을 누릴 수 있을 만큼은 특화하고자 했습니다. 고속 메모리를 갖추고, 나중에는 수많은 칩을 동일한 문제에 효율적으로 투입할 수 있게 해주는 고속 인터커넥트를 갖출 수 있었습니다. 우리는 여러 세대를 거치며 그 규모를 계속 확장하고 성능을 개선해 왔습니다.
돌파구 아이디어를 찾는 법
다이아나 후: 정말 놀라운 냅킨 수학이네요. 냅킨은 참 유용합니다. 자, 미래의 창업자가 되고자 하는 이 방의 모든 이들이 오늘 밤에 TPU만큼이나 영향력 있는 무언가를 구축하기 위해 해봐야 할 좋은 냅킨 수학은 무엇이 있을까요?
제프 딘: 언제나 말하기는 어렵습니다. 자신이 생각하고 있는 분야에서 어떤 문제가 보이는지, 어떤 병목 현상이 존재하는지 생각해 보고, 그 문제들을 해결하는 기존 방식에 얽매이지 않고 근본 원리(first principles)로부터 출발해 전혀 다른 방식으로 해결한다면 성능이나 역량 등을 한두 자릿수(order of magnitude) 이상 향상시킬 수 있을지 고민해 보세요. 문제의 해결 방식에 꼭 얽매이지 않고 비스듬히 바라보면, 다른 사람들이 생각하지 못한 정말 좋은 아이디어를 떠올릴 수 있기 때문입니다.
AI 엔지니어를 위한 새로운 멘탈 모델
다이아나 후: 좋은 조언입니다. 여기 계신 분들 중 아시는 분도 있겠지만, 오래전에 제프는 '모든 컴퓨터 과학자가 알아야 할 지연 시간 숫자들(Latency Numbers Every Computer Scientist Should Know)'이라는 매우 유명한 목록을 작성했습니다. 이 숫자는 예를 들어 캐시 미스(cache miss)에 걸리는 시간, 디스크 탐색(disk seek), 캘리포니아에서 네덜란드까지 네트워크 패킷이 이동하는 시간 등 분산 시스템 및 시스템 엔지니어링과 관련된 수많은 숫자들을 담고 있습니다. 이는 많은 분산 시스템 엔지니어들의 바이블이 되어 출력해 벽에 붙여두는 품목이 되었죠. 자, 시계를 빨리 감아 이 목록을 업데이트할 때가 왔습니다. 지금 2026년 시점의 AI 버전을 알려주세요.
제프 딘: 요즘 AI 시스템에서 무엇이 중요한지 살펴보면, 가속기의 메인 메모리 시스템에서 온칩 메모리를 거쳐 곱셈 유닛에 이르는 대역폭(bandwidth) 같은 것들을 알고 싶어질 것입니다. 단일 곱셈 연산을 수행하는 데 에너지가 얼마나 드는지도 알아야죠. 칩 간의 인터커넥트 대역폭은 얼마이며, 그 대역폭으로 몇 개의 칩을 연결할 수 있는지도 중요합니다. 그 영역을 넘어서서, 500개가 아니라 1만 개의 칩과 통신해야 할 때 네트워크 대역폭이 얼마나 떨어지는지도 알아야 합니다. 제 생각에 이 모든 것들은 꼭 배워야 할 정말 중요한 숫자들off이며, 특정 종류의 문제를 해결하는 방식을 고민할 때 큰 영향을 미칩니다.
다이아나 후: 제가 들은 흥미로운 이야기 중 하나는 요즘 모든 것을 측정하는 단위가 바로 '에너지'라는 점입니다.
제프 딘: 네.
다이아나 후: 연산이나 수학적 계산을 수행하는 데는 약 1 피코줄(picojoule)의 에너지가 들지만, 데이터를 이동시키고 데이터 입출력(I/O)을 수행하는 데는 그보다 1,000배가 더 든다고 지적하셨죠.
제프 딘: 네. 가속기의 HBM에서 프로세서로 데이터를 불러와 실제로 연산을 수행할 수 있게 만드는 과정 말입니다.
AI가 진정으로 에너지 문제인 이유
다이아나 후: 그렇군요. 데이터 이동과 실제 연산 간의 이 1,000배라는 격차가 조용히 어떤 제품이 가능한지, 그리고 AI의 알고리즘이 어떻게 구축되는지를 결정합니다. 창업자들이 계속해서 모델 문제라고 부르지만, 실제로는 에너지나 데이터 I/O 문제인 것들은 무엇이 있나요?
제프 딘: 데이터를 이동시키는 것과 실제로 연산하는 것 사이의 에너지 소모량이 1,000배 차이가 난다는 점은 제가 앞서 언급한 중요한 예시이며, 이는 머신러닝에서 우리가 하는 일의 많은 측면을 좌우합니다. 만약 그 1,000배의 차이가 없다면 배칭(batching)을 할 필요가 없을 테니까요. 하지만 1,000배 속도 저하를 고스란히 떠안는 대신 '1,000배를 배치 크기로 나눈' 에너지 비용을 지불하기 위해, 데이터 이동을 상각(amortize)하고자 한 번에 많은 예나 여러 토큰들을 묶어서 배치 처리를 해야 합니다. 지연 시간이 정말 낮아야 하는 경우라면 배칭은 그다지 좋지 않습니다. 컴퓨터 하드웨어를 만들 때 내리는 다양한 결정의 이면에 있는 이러한 요인들과 에너지는 상위 수준의 시스템을 구축할 때 우리가 내리는 많은 결정에 큰 영향을 미칩니다.
다이아나 후: 아주 구체적인 예시로 모델을 훈련하는 방식을 들 수 있습니다. 데이터셋을 배치로 묶고 에포크(epoch)를 실행하는 전체 개념이 있지요. 사람들이 이를 모델의 문제로 오인할 수 있지만, 사실은 시스템 데이터 I/O 문제인 것이죠?
제프 딘: 네. 하드웨어에서 더 나은 효율성을 얻으려면 배치를 모아야 합니다. 이상적으로는 배치 크기를 1로 두고 훈련하고 싶겠지만, 효율성 측면에서는 그리 좋지 않습니다. 그래서 요즘 사람들은 꽤 큰 배치를 사용합니다.
다이아나 후: 당신은 긴 주나 주말 동안 떠나 있다가 기발한 해결책을 들고 나타나는 것으로 유명합니다. 제프가 며칠 동안 작업 매달려 배치 크기 1인 훈련을 해낸 것 같은 일도 존재하나요?
제프 딘: 사실 저는 추론에 대해 더 많이 생각하고 있습니다. 추론은 아주 흥미로운 문제입니다. 매우 낮은 지연 시간이 필요하기 때문이죠. 훈련의 경우는 반드시 엄청나게 낮은 지연 시간이 필요하지는 않습니다. 현재 우리가 하는 것보다 추론에 더 특화된 하드웨어를 만들 수 있는 여지가 아주 많다고 생각합니다.
다이아나 후: 추론과 관련하여 깊게 고민하고 계신 흥미로운 점들에는 어떤 것이 있나요?
제프 딘: 데이터 이동을 최소화하고, 엄청나게 낮은 정밀도의 연산을 고민하며, 너무나 다양하고 수많은 종류의 정밀도를 지원하지 않는 방향을 생각하고 있습니다. 어떤 정밀도가 필요한지에 대해 명확한 답이 있다면, 차라리 그것을 하드웨어에 직접 내장하고 나머지는 덜어내는 식이죠.
다이아나 후: 이는 유명한 컴퓨터 과학자로부터 들은 핵심 비유와도 귀결됩니다. 사실 AI의 전체 과정은 커다란 압축 문제라는 점입니다. 데이터가 손실성(lossy)을 갖도록 압축한 뒤 이를 복원하기 위해서는 본질적으로 그 데이터를 이해해야 한다는 것이죠.
제프 딘: 데이터를 진정으로 이해한다면, 그 데이터를 정말 잘 압축할 수 있어야 합니다.
다이아나 후: 그리고 현재 트랜스포머 아키텍처가 바로 아주 잘 작동하는 것으로 판명된 방식 중 하나인 셈이네요.
제프 딘: 네, 지금까지는 꽤 잘 작동하고 있습니다. 제 동료들이 훌륭한 일을 해냈죠.
컨텍스트 엔지니어링이 다음 프론티어다
다이아나 후: 그렇습니다. 자, 시선을 조금 넓혀보죠. 과거에 AI의 발전이란 단순히 더 나은 모델을 의미했습니다. 더 많은 데이터가 있고, 더 큰 파라미터를 가진 모델을 훈련하는 식이었죠. 하지만 지난 1년여 동안 점점 더 모델을 둘러싼 모든 것들이 중요해졌습니다. 모델의 크기, 파라미터 수, 더 많은 데이터뿐만 아니라 검색(retrieval), 도구(tools), 메모리, 에이전트 도구 등 모델 주변의 모든 요소들이 중요해졌고, 이는 사람들이 '컨텍스트 엔지니어링(context engineering)'이라고 부르는 개념으로 통합되고 있습니다.
제프 딘: 네. 모델은 진정으로 흥미로운 문제를 해결할 수 있는 전체 시스템을 구축하기 위한 여러 조각 중 단지 일부분에 불과합니다. 여기에는 다양한 도구를 사용하는 법을 아는 모델이 포함됩니다. 관련 정보를 검색하는 법을 알 수도 있고, 과거 문제에서 검색해 온 다른 정보들의 이력을 갖고 있을 수도 있으며, 그러한 정보를 모델의 컨텍스트 안에 집어넣을 수 있습니다. 이것의 좋은 점은, 모델이 훈련받을 때 수조 개의 토큰이 수백억 내지 수조 개의 파라미터라는 수프 속에 한데 섞여 있던 훈련 데이터와 달리, 이 정보는 모델에게 매우 명확하다는 것입니다. 모델이 특정 문제나 유스케이스를 위해 직접 보는 실제 컨텍스트보다 덜 명확한 것은 없죠.
제프 딘: 그리고 어떤 도구들을 사용할 수 있는지, 어떤 도구가 모델이 이 문제의 다음 단계를 해결하는 데 도움을 줄 것인지 이해하고, 문제를 일련의 도구 호출(tool calls) 시퀀스로 분해하며, 문제를 해결하기 위해 여러 접근 방식을 시도해 보고 어떤 것이 효과가 있는지 평가할 수 있어야 합니다. 이것이 바로 복잡한 에이전트 및 멀티에이전트 시스템의 전체 오케스트레이션이며, 앞으로 점점 더 중요해질 것이라고 생각합니다. 정말 신나는 시기입니다.
다이아나 후: 이 특정 문제 도메인 세트가 주는 재미있는 점은 실제로 이 방에 있는 누구나 할 수 있다는 것입니다. 예전에는 모델을 훈련하기 위해 엄청난 양의 리소스와 GPU 및 데이터에 대한 엄청난 접근 권한이 필요했습니다. 하지만 컨텍스트 엔지니어링은 이 방의 누구나 할 수 있습니다. Gemini 같은 서비스의 API만 있으면 되고, 자신만의 검색 설정, 도구 호출 등을 구축해 나가면 됩니다. 여기에 계신 모든 분들을 위한 팁이 있다면 무엇이 있나요? 어떻게 해야 컨텍스트 엔지니어링에 능숙해지고 탁월해질 수 있을까요?
제프 딘: 이를 위한 아주 좋은 방법은 이러한 모델과 하네스(harnesses), 도구들을 직접 사용해 문제를 해결해 보면서 모델이 실패하는 지점을 눈으로 확인하는 것입니다. 종종 모델 파라미터를 직접 조정하는 것(외부에서 하기는 어렵죠) 대신, 모델에게 더 나은 가이드라인을 만들어 주거나, 이 특정 부류의 문제를 해결하는 데 엄청나게 유용한 다양한 도구를 사용하는 법을 아는 '스킬(skills)'을 모델에 작성해 줌으로써 모델이 더 잘 작동하고 그러한 종류의 문제에서 성공하도록 만들 수 있습니다. 그렇게 하다 보면 문제를 해결하기 위해 활용하려는 일종의 자기 개선(self-improving) 설정으로 이어지게 됩니다. 이는 모델이 더 유능해지기 위해 어떤 추가 정보가 필요한지 이해하는 능력을 키우기에 아주 좋은 방법입니다.
AI를 최적화에 더 능숙하게 만든 기술
다이아나 후: 본인이 직접 수행했던 컨텍스트 엔지니어링의 예시나, 본인의 워크플로우에 엄청난 차이를 만들어낸 작성한 스킬, 혹은 도구에 대해 말씀해 주실 수 있나요?
제프 딘: 산제이와 저는 몇 주 전에 작업을 하고 있었는데, 우리는 종종 매우 저수준의 라이브러리에 대한 성능 개선 작업을 하곤 합니다. 구글에는 우리가 작성한 마이크로벤치마크 라이브러리가 있어서, 다양한 종류의 연산이나 데이터 구조를 채우는 데 얼마나 시간이 걸리는지 마이크로벤치마크를 작성할 수 있습니다. 때로는 이러한 데이터 구조가 구글 전역의 수백만 개 프로세스에서 사용되기 때문에 고성능을 보장하는 것이 실제로 꽤 중요합니다. 마이크로벤치마크를 작성할 수 있지만, 에이전트 기반 시스템이 없다면 평소에 하는 일은 관심 있는 일부 벤치마크에서 현재 성능이 어떤지 측정하고, 성능을 개선하기 위해 몇 가지 수정을 가한 다음, 벤치마을 다시 실행하여 어디가 개선되었는지 확인하고, 더 넓은 범위의 벤치마크를 실행하며, 캐시 풋프린트를 측정하는 것입니다.
제프 딘: 우리는 모델에게 대부분의 이러한 작업을 다양한 순서로 수행하는 법을 가르쳐주는 스킬을 작성했습니다. 덕분에 모델이 자기 개선적인 벤치마크 측정, 코드 변경, 성능 개선 측정, 그리고 그에 대한 반복 작업을 실제로 수행할 수 있게 되었죠. 이는 몇몇 종류의 문제에 꽤 잘 작동하는 것처럼 보였습니다. 그저 우리가 인간으로서 사용할 접근 방식을 모델이 사용할 수 있는 형태로 건네준 것뿐입니다.
다이아나 후: 와, 정말 인상적이네요. 즉, 누군가 그 스킬에 접근할 수 있다면 제프 딘처럼 최적화를 수행할 수 있다는 말씀이군요. 전 세계가 이 기술을 열망할 것 같고, 이에 접근할 수만 있다면 무한대의 가치가 있을 것 같은데요.
제프 딘: 사실 우리는 몇 달 전에 산제이와 제가 작성한 '성능 힌트(Performance Hints)'라는 문서를 공개했습니다. 다양한 종류의 성능 트릭에 관한 30페이지 분량의 문서죠. 일부 사람들은 이 문서를 가져와 요약된 형태로 다양한 모델에 제공했고, 모델이 코드의 성능 이슈를 추론하는 데 더 능숙해진 것을 확인했습니다.
다이아나 후: 여기서 다 들으셨죠. 우리가 출판한 'Performance Hints' 논문을 활용하면 여러분도 제프 딘처럼 자신의 코드를 최적화할 수 있습니다.
제프 딘: 네. 무료로 공개되어 있으니 모두 시도해 보셔야 합니다.
장기 실행 에이전트가 실패하는 이유
다이아나 후: 아주 멋지네요. 자, 에이전트에 대해 이야기해 보죠. 이 방에 있는 모든 분들이 아마 에이전트를 만들고 있거나 언젠가 만들어 보았을 것입니다. 여러분도 아마 30번째나 40번째 단계에서 에이전트가 궤도를 이탈하는 것을 목격한 적이 있을 겁니다. 에이전트는 10단계 정도까지는 훌륭하지만 50단계쯤 되면 흔들리기 시작하죠. 오늘날의 제약은 무엇이라고 생각하시나요? 컨텍스트 평가기(context evaluators)인가요, 아니면 기본적으로 개루프(open-loop) 시스템이기 때문에 누적되는 오류 때문인가요?
제프 딘: 당연히 우리는 에이전트가 아주 오랜 시간 동안 실행되기를 원합니다. 그것이 바로 점점 더 복잡한 문제를 해결하는 방법이기 때문입니다. 하지만 지금 목격하시듯, 에이전트들은 도구와 10번 상호작용하고 나면 작동을 멈추기도 합니다. 때로는 모델이 익숙하지 않은 무언가를 시도하려고 하기 때문입니다. 모델은 전체적인 데이터 세트로 훈련을 받았는데, 자기가 아는 것의 분포를 조금만 벗어나기 시작하면 대부분의 머신러닝 모델처럼 성능이 저하되기 시작합니다. 자신이 아는 안전지대에서 멀어질수록 제대로 작동하지 않을 확률이 높아집니다.
제프 딘: 우리가 할 수 있는 일은 여러 가지가 있습니다. 첫째는 모델에게 자신이 잘 아는 안전하고 밝은 길을 유지하도록 돕는 스킬과 힌트를 제공하는 것입니다. 여러 에이전트가 서로 다른 접근 방식을 시도하게 하고, 또 다른 모델이나 에이전트가 그중 어떤 것이 유망해 보이는지 평가하도록 만드는 멀티에이전트 시스템을 구축하는 것도 가능한 해결책 공간을 탐색하고, 가장 유망해 보이는 것을 고수하며, 효과가 없거나 궤도를 벗어난 것들을 폐기하는 또 다른 방법입니다. 이는 매우 유용한 범용 기술입니다. 바로 추론 시간 컴퓨팅(inference-time compute)을 활용해 타당한 문제 해결 방식을 탐색하는 것으로, 이를 통해 장기 실행 에이전트 플로우에서 훨씬 더 높은 성능과 신뢰성을 얻을 수 있습니다.
다이아나 후: 내부적으로 에이전트를 위해 이러한 특정 워크플로우를 구현한 방법에는 어떤 것이 있나요?
제프 딘: 우리에게는 하네스가 있고, 특히 구글 내부 개발 환경 전반에 걸쳐 다양한 스킬 세트가 있습니다. 에이전트가 코딩, 코드 리뷰, 성능 측정, 로그 파일 가져오기 등과 관련된 수많은 내부 도구를 사용하는 법을 알 수 있도록 스킬을 마련해 두었습니다. 구글 내부 엔지니어들이 사내 시스템에서 로그 파일을 가져오는 정확한 방식을 기본 모델이 직접 훈련받지 않았더라도, 이러한 스킬들을 추가함으로써 기본 모델을 더 유능하게 만들 수 있습니다. 올바른 종류의 스킬 정의가 있다면 실제로 작동하게 만들 수 있으며, 이는 에이전트의 유용성을 크게 높여줍니다.
스타트업이 여전히 구글을 이길 수 있는 곳
다이아나 후: 자, 이제 스타트업이 이길 수 있는 영역에 대해 이야기해 보겠습니다. 미래의 창업자라면 앞으로 무엇을 구축해야 할지 결정해야 하므로 이 세션은 개인적으로 매우 중요하게 생각하는 부분입니다. 구글의 강점은 프로세서부터 제품에 이르기까지 시스템의 모든 것을 공동 설계(codesign)한다는 점입니다. 구글 같은 기업이 계속해서 구축하고 복합적으로 발전시키며 더 잘 해낼 레이어는 무엇이며, 2~3명의 소수 팀이 여전히 승리할 수 있는 영역은 어디일까요?
제프 딘: 분명 구글과 당사의 Gemini 모델 및 하드웨어 인프라는 거의 모든 것을 할 수 있는 매우 범용적인 모델을 구축하기 위해 노력하고 있습니다. 하지만 많은 경우, 이는 우리 모델들이 잘 해내는 범용적인 혼합군에 속하지 않는 특정 도메인, 즉 아주 잘 설계된 사용자 접점이나 모델 및 스킬 세트, 혹은 특화된 모델이 상당한 우위를 점할 수 있는 도메인에는 우리가 충분한 주의를 기울이지 못한다는 것을 의미합니다. 여러분이 진정으로 열정을 가진 도메인에 대해 즐겁고, 정확도가 매우 높으며, 품질이 뛰어난 무언가를 구축할 수 있습니다. 바로 그곳이 방 안의 2~3명이 우위를 점할 수 있는 영역입니다.
제프 딘: 하지만 동시에 경고하고 싶은 점은, 범용 모델들이 더 광범위한 범위의 작업에서 확실히 더 나아지고 있다는 것입니다. 따라서 여러분은 스스로에게 물어야 합니다. 지금 작업 중인 것이 과연 지속 가능할 것인가, 아니면 최전선의 모델들이 향후 6개월 또는 12개월 안에 그 영역을 더 잘하게 될 것인가, 혹은 향후 2~3년 동안은 모델들이 해내지 못할 영역인가? 무엇을 만들지 결정할 때 이 점을 저울질해 보아야 합니다.
다이아나 후: 물론 범용 모델들은 계속해서 작업하고 더 나아지게 만들 것입니다. 그렇다면 청중은 어떤 영역을 선택해 작업해야 할지 어떻게 판단해야 할까요?
제프 딘: 가장 중요한 것은 자신이 엄청나게 열정을 느끼고, 직접 구축하고 싶으며, 세상에 유용할 것이라고 생각하는 무언가를 선택하는 것입니다. 그렇게 한다면 아침에 일어나서 "이 일을 별로 하고 싶지 않네"라고 생각하거나 세상이나 많은 사람들에게 별로 유용하지 않은 것을 만드는 경우에 비해 이미 훨씬 앞서 있는 것입니다. 그것이 바로 다음에 어떤 문제를 해결해야 할지 고를 때 제가 적용하려고 노력하는 제1의 선정 기준입니다.
제프 딘: 둘째로, 현재의 더 범용적인 모델들이 해당 문제 도메인에서 무엇을 할 수 있는지 살펴봐야 합니다. 모델들을 테스트해 보세요. 이 작업을 아주 잘 해낼 수 있는가? 완전히 실패하고 있다면, 아마 좋은 신호일 수 있습니다. 대충 일부는 할 수 있지만 그리 잘하지 못한다면, 아마 그다지 좋은 신호가 아닐 수 있습니다. 이는 모델들이 해당 역량을 갖추기 시작했다는 신호일 수 있으며, 더 많은 훈련 데이터와 대규모 모델 등을 통해 개선될 가능성이 높습니다. 20%가 아니라 0%나 1% 확률로 성공하는 영역을 찾으세요.
다이아나 후: 그런 영역들은 어떻게 찾나요? 그것들은 훈련 세트의 분포를 벗어난(out of distribution) 것들인가요? 거기에 딱 맞는 문제의 형태란 정확히 무엇인가요?
제프 딘: 때로는 범용 모델이 접근할 수 없는 특정 종류의 데이터에 접근할 수 있는 제품을 구축하는 것일 수도 있습니다. 사용자가 자신의 모든 개인 정보를 정리하는 것을 돕는 무언가를 구축하고 있다면, 범용 모델은 반드시 거기에 접근할 수 있는 것은 아닙니다. 그 경우, 여러분의 제품이 중요한 데이터 가시성을 갖게 되므로 큰 우위를 점할 수 있습니다.
제프 딘: 혹은 올바른 훈련 데이터를 확보하고 범용 모델보다 더 특화된 모델을 훈련할 수 있다면 아주 합리적인 비용으로 해결할 수 있는, 믿을 수 없을 정도로 어려운 문제일 수도 있습니다. 이 특정 문제를 위한 니스(niche) 모델을 훈련하는 데 컴퓨팅 파워가 그리 많이 들지 않으면서도 정확도가 매우 높은 결과물을 얻을 수 있습니다. 이는 범용 모델이 잘 다루지 못하는 중요한 문제를 해결하는 데 아주 훌륭한 빌딩 블록이 될 수 있습니다.
다이아나 후: 기본적으로 두 가지 길이 있군요. 첫 번째 길은 약간 우스갯소리 같지만, 구글 같은 대기업들은 세상의 정보를 조직하고 있으며 그 영역은 잘 커버되어 있지만 개인 정보를 조직하는 것은 열려 있다는 점입니다. 두 번째 길은 특정 도메인에서의 더 특화된 모델에 대해 말씀하셨습니다. 이러한 도메인 중 일부가 무엇인지 조금 더 말씀해 주실 수 있나요?
제프 딘: 제 동료들이 작업한 AlphaFold를 보면, 그것은 단백질 접힘을 위한 매우 구체적인 모델이었습니다. 엄청나게 성공적이었고 해당 도메인을 꽤 잘 다룰 수 있어서, 단백질과 그 구조에 관한 질문에 아주 효과적으로 답을 줄 수 있는 놀라운 도구와 모델을 갑자기 갖추게 되었죠. 하지만 그것은 범용 모델이 아니라 매우 특화된 모델입니다. 재료 과학이나 칩 디자인 등 이와 유사한 접근 방식이 매우 잘 통할 수 있는 다른 도메인들이 존재하며, 이를 통해 정확하지만 니스한 모델의 능력을 활용해 오늘날에는 어려운 일들을 해낼 수 있게 될 것입니다.
AI 네이티브 창업자가 되는 법
다이아나 후: 이 방에 계신 분들 중 AlphaFold와 유사한 형태의 문제를 찾으신다면 좋은 도전 과제가 될 수 있겠네요. 자, 이제 풀고 싶은 문제를 찾았다고 가정해 봅시다. 어떻게 AI 네이티브 창업자가 될 수 있는지에 대해 조금 이야기해 보겠습니다. 과거에 당신은 50대 혹은 100대의 에이전트 플릿을 관리하는 것은 아주 훌륭하고 명확한 디자인 문서(design docs)나 스펙을 작성하는 것에 불과하다고 말씀하셨습니다. 사람들은 어떻게 그것을 잘할 수 있게 되나요? 그런 문서들은 어떤 모습인가요?
제프 딘: 원하는 바를 명확하게 명시할 수 있다면 가상 에이전트와 일할 때 훨씬 더 큰 성공을 거둘 수 있습니다. 무엇을 원하는지 명확할수록 에이전트는 자신이 달성해야 할 가이드라인과 개요를 더 많이 갖추게 됩니다. 반면 별로 구체적으로 지정하지 않으면 에이전트가 여러분의 의도를 유추해야 합니다. 많은 경우, 에이전트는 여러분이 상상했던 것과는 다른 방향으로 유추할지도 모릅니다. 우리는 처음부터 컴퓨터 과학자들에게 코드를 작성하러 가기 전에 자신이 작성하려는 소프트웨어가 달성하려 하는 바가 무엇인지 명확히 규정하는 것이 정말 중요하다고 항상 말해왔습니다. 이제 실제로 작성을 수행할 수 있는 에이전트 기반 시스템을 갖추게 되었지만, 무엇을 원하는지 명확히 규정해야 하는 중요성은 오히려 더욱 커졌습니다. 예전에는 맥락을 이해하거나 후속 질문을 던질 수 있는 매우 영리한 인간에게 작업을 넘겨주곤 했지만 말이죠. 에이전트도 가끔 그렇게 할 수 있지만, 명확한 스펙은 정말 좋은 아이디어입니다.
제프 딘: 코딩 에이전트를 아주 성공적으로 활용하는 예시를 들자면, 요즘 모델들에게 한 프로그래밍 언어의 소프트웨어를 다른 언어로 아주 효과적으로 번역해 달라고 요청할 수 있습니다. 이 경우 여러분은 엄청나게 상세한 스펙을 갖고 있는 셈입니다. 시스템이 무엇을 해야 하는지 알려주는 전체 소프트웨어가 존재하니까요. 어떤 것의 파이썬(Python) 구현 버전이 있고 이를 Go 구현 버전으로 바꾸고 싶다면, 요즘 모델들이 엄청나게 능숙하게 해내는 작업이 바로 그것입니다. 파이썬에 있는 모든 테스트를 가져와 Go용으로 번역하고, Go 버전에서 테스트가 통과하는지 확인하고, 구현 간의 행동 차이를 더 이상 차이가 없을 때까지 비교하여 뛰어난 효과를 낼 수 있습니다. 그 스펙이 너무나 명확하기 때문입니다.
다이아나 후: 자, 이제 모든 창업자가 수백 개의 에이전트를 동시에 실행하는 데 능숙해지고 모든 코드가 에이전트에 의해 작성된다고 가정해 봅시다. 그렇다면 희소성이 있는 기술(scarce skill)은 무엇이 될까요?
제프 딘: 에이전트에게 어떤 작업을 시킬지 결정하는 '엄청나게 뛰어난 취향(taste)'입니다. 그것이 제 백그라운드인 연구 문제의 핵심입니다. 연구자는 모든 도구와 기법을 가질 수 있지만, 종종 싸움의 대부분은 '어떤 문제에 시간을 쓸 것인가'에서 판가름 납니다. 문제를 잘 선택하고 해결에 성공한다면, 다소 지루한 문제에 대해 연구 조사를 훌륭하게 실행해 낸 것보다 훨씬 낫습니다. 무엇을 작업해야 할지에 대한 그러한 고차원적인 지혜는 믿을 수 없을 정도로 중요하며, 모델이 반드시 그것을 잘 해내지는 못할 것이라고 생각합니다. 위대한 성과를 더 빨리 달성하기 위해 사람들이 수많은 AI 지원 연산을 조율해 나가는 형태가 될 것입니다. 모델이 무엇을 하기를 원하는지 정하는 그 본질이야말로 여러분이 집중해야 할 핵심입니다.
다이아나 후: 취향에 대해 조금 더 이야기해 보죠. 요즘 에이전트 코딩 시대에 이 취향이라는 단어가 정말 많이 회자되고 있으니까요. 취향은 어떻게 기를 수 있나요? 어떻게 구체화할 수 있습니까?
제프 딘: 어려운 일입니다. 많은 경우 취향을 측정할 수 있는 객관적인 지표가 있는 것은 아니니까요. 일부는 경험에서 옵니다. 과거에 수많은 다양한 문제를 해결해 본 경험은 앞으로 어떤 종류의 문제가 흥미로울지, 혹은 이전의 접근 방식들을 얼기설기 엮는 것만으로 겨우 가능한 것은 무엇인지, 그리고 마법 같거나 매우 유용한 무언가에 도달하기 위해 어떤 미해결 문제를 풀어야 하는지 가르쳐 줍니다.
제프 딘: 자신을 위해 더 많은 경험을 쌓는 또 다른 방법은 향후 12개월 동안 중요할 것이라고 생각하는 여러 가지 일들을 적어두는 것입니다. 그중 하나를 골라 작업해 볼 수도 있겠지만, 12개월 뒤에 돌아와서 그 다른 일들 중 실제로 중요해 보였던 것은 무엇인지, 세상의 다른 사람들이 직접 나가서 만든 것은 무엇인지, 그리고 아직 사람들이 해내지 못한 것은 무엇인지 평가해 보는 것입니다. 그렇게 하면 자신의 취향 형성 능력을 위한 훨씬 더 많은 샘플 데이터를 얻을 수 있습니다. 그것은 갖춰야 할 중요한 기술입니다.
가장 큰 가정에 의문을 품어라
다이아나 후: 우리가 앞서 이야기했던 세 번째 방법은 미친 셈 치고 터무니없는 사고 실험(thought experiments)을 해보는 것이었죠.
제프 딘: 그것도 좋은 방법입니다. 대부분의 사람들이 당연하게 여호기는 것들을 당연하게 받아들이지 않는 것이 좋을 때가 있습니다. 며칠 전에 동료들과 함께 미친 셈 치고 터무니없는 사고 실험을 하나 해보았습니다. 지난 60년 동안 전체 실리콘 칩 설계 및 제조 산업은 오류율이 매우 낮은, 점점 더 작은 규모의 트랜지스터를 만들기 위해 엄청난 노력을 기울여 왔습니다. 우리가 원하는 가정은 동일한 설계를 가진 우리가 제조하는 모든 칩이 다른 모든 칩과 똑같아야 한다는 것입니다. 비트가 뒤집히(flip)는 것을 원하지 않죠. 어떤 비트도 뒤집혀서는 안 됩니다. 온갖 종류의 마진이 설계에 내장되어 있고 요즘 메모리에는 ECC 메모리도 들어가 있습니다.
제프 딘: 거시적인 규모에서 대규모 분산 시스템을 구축할 때는 그런 가정을 하지 않습니다. 우리는 신뢰할 수 없는 부품들로부터 신뢰할 수 있는 대규모 분산 파일 시스템을 구축합니다. 개별 디스크는 고장 날 수 있지만 데이터는 안전해야 합니다. 랙 스위치나 개별 기기, 혹은 디스크가 고장 나더라도 여전히 데이터를 안전하게 유지할 수 있도록 서로 다른 세 대의 기기와 세 개의 서로 다른 랙에 데이터를 세 번 복제해 보관하는 상위 수준의 메커니즘을 갖추고 있습니다. 리드-솔로몬(Reed-Solomon) 인코딩 기법도 있죠. 하지만 우리가 다루고 있는 트랜지스터 수준의 기술 영역에서는 이토록 극단적인 수준으로 그렇게 하지는 않는 것 같습니다.
제프 딘: 흥미로운 사고 실험은 이것입니다. 만약 100만 년에 한 번이 아니라 하루에 20개의 오류가 발생할 수도 있는 트랜지스터들로 시스템을 구축하려고 한다면 무슨 일이 일어날까요? 그것은 매우 다른 설계 지점이 될 것이며 제조 측면에서 정말 흥미로운 일들을 가능하게 해줄지도 모릅니다. 설계 방법론 자체가 완전히 달라질 것입니다. 여기서 저기로 신호를 보내야 하는데 트랜지스터가 이토록 신뢰할 수 없다면, 신호를 보내는 방식이 완전히 달라질 수 있으니까요. 신호 중 하나가 제대로 전달되도록 여러 개의 중복 경로를 통해 신호를 보낼 수도 있겠죠. 제 생각에 이는 꽤 흥미로운 사고 실험 세트가 될 것입니다. 지금 당장 이렇게 하자는 말은 아니지만, 이것이 바로 가끔씩 가정에 의문을 품어봐야 하는 이유입니다. 종종 이러한 사고 실험들은 효과가 없기도 합니다. 지난 50년 동안 이 일을 이런 방식으로 해왔고 저런 방식으로 하지 않은 데에는 아주 타당한 이유들이 존재하기 때문이죠. 하지만 그럼에도 불구하고 가끔씩 그러한 가정들을 재검토해 보는 것은 좋은 일입니다.
다이아나 후: 정말 과감하네요. 신경 자이모픽 컴퓨팅(neuromorphic computing)이나 인간의 두뇌, 그리고 자연이 작동하는 방식과 많이 닮아가는군요.
제프 딘: 우리 뇌 속의 신호들은 한곳에서 다른 곳으로 이동할 때 특별히 신뢰할 수 있지 않습니다. 뇌에서는 한곳에서 다른 곳으로 반드시 전달해야 하는 정말 중요한 정보가 있을 때, 이를 가능하게 해주는 여러 경로가 존재하죠.
다이아나 후: 과거에 당신이 내다 버렸던 터무니없는 가정들 중 실제로 영향력 있는 시스템을 탄생시킨 것은 무엇이 있나요?
제프 딘: TPU가 좋은 예입니다. 그 문제 도메인이 오늘날만큼 중요해 보이기 전에 아주 니스한 문제 도메인을 위해 하드웨어를 특화한 것이죠. MapReduce의 기원도 또 다른 좋은 예입니다. 저와 산제이, 그리고 여러 동료들은 구글에서 크롤링 및 인덱싱 시스템의 다양한 반복 버전을 개발하며 일했습니다. 100대나 1,000대의 컴퓨터에서 실행되다가 일부가 죽더라도 견고하고 신뢰성 있게 작동하도록 보장하기 위해 수많은 체크포인팅(checkpointing) 코드가 들어간, 수동으로 병렬화된 코드를 엄청나게 많이 작성했었죠. 하지만 그 코드는 웹페이지의 모든 콘텐츠를 살펴보고 URL에서 해당 페이지가 어떤 언어인지 매핑하는 것을 측면에서 계산하는 식의, 흔히 하려고 했던 비교적 단순한 작업과 서로 뒤엉키곤 했습니다. 병렬화와 신뢰성을 위한 온갖 다른 코드들 때문에 그 본질이 가려졌던 것입니다.
제프 딘: 우리는 함수형 언어에 대한 우리의 훈련을 떠올렸고, 그 문제들을 비스듬히 바라보며 구현체 위에 MapReduce 추상화를 개발할 수 있다는 것을 깨달았습니다. 구현체 아래에는 모든 체크포인팅 및 신뢰성 메커니즘을 하위 수준의 라이브러리에 집어넣어, 그 위에서 모든 것이 빌드될 수 있도록 할 수 있었습니다. 그것은 구글에서 매우 대규모의 연산을 견고하고 신뢰성 있는 방식으로 처리하는 데 엄청나게 성공적인 방법이 되었습니다. "비스듬히 바라본다면, 이 추상화에 들어맞는 수많은 문제를 찾을 수 있지 않을까?"라는 그 사고 실험으로부터 말이죠.
더 나은 AI를 만드는 AI
제프 딘: 맞춤형 하드웨어 작업에 대한 현재의 관심에 대해 조금 말씀하셨죠. 현재 AlphaChip은 칩을 배치합니다. 또한 솔루션을 제안하고 평가한 뒤 작동하는 것들을 모두 유지하는 AlphaEvolve도 가지고 있습니다. 시스템들이 결합하여 AI를 만드는 AI를 구축하기 시작한 것처럼 보입니다.
제프 딘: 더 넓게 보면, 여기에는 과학적 방법(scientific method)이라는 기반이 존재합니다. 실험을 제안하고, 실험을 실행하는 데 필요한 것을 구현하며, 실험을 평가하고, 그로부터 결과를 얻어내는 것이죠. 이제 단 몇 번의 실험이 아니라 수많은 실험을 실행하는 전체 루프를 구현할 수 있는 문제들이 점점 더 많아지고 있습니다. 그 루프를 자동화할 수 있고 그 루프의 지연 시간을 극도로 낮출 수 있기 때문에 이는 정말 중요합니다. 이는 과학과 엔지니어링, 머신러닝 모델 설계 그 자체, 그리고 칩 설계 같은 엔지니어링 작업에 이르는 수많은 다양한 문제 도메인을 공략할 수 있게 해줄 것입니다.
제프 딘: 만약 이러한 일들을 실제로 자동화된 방식으로 수행할 수 있고, 매우 고차원적인 목표를 받아 하위 문제로 쪼갤 수 있는 오케스트레이션 프레임워크를 갖출 수 있다면, 각 하위 문제는 해당 하위 문제를 해결하는 가장 좋은 방법을 탐색하는 자동화된 루프 중 하나를 실행할 수 있습니다. 그런 다음 오케스트레이션 프레임워크가 하위 문제의 솔루션들을 모아 더 높은 수준의 문제에 대한 전체 솔루션으로 조립할 수 있습니다. 이는 머신러닝의 진전을 가속화하고, 과학을 가속화하며, 엔지니어링을 가속화할 것입니다. 정말 놀라운 일이 될 것입니다.
다이아나 후: 형식적으로 검증(formally verify)할 수 있는 인접 분야처럼, 아주 훌륭한 평가기(evaluators)를 가질 수 있는 많은 분야들이 AI 시스템이 스스로 진화하기에 무르익어 있군요.
제프 딘: 많은 경우 평가기들의 속도를 훨씬 더 빠르게 만들어야 합니다. 일례로 제 동료들이 약 1세대 전에 양자 화학 분야에서 일련의 작업을 수행했습니다. 특정 분자의 특성을 이해하려고 시도하는 작업이었죠. 어떤 분자 구성을 생성하고 그것이 어떤 특성을 가지는지 이해하고자 합니다. 이때 연산 집약적인 '밀도 범함수 이론(density functional theory) 시뮬레이터'를 실행할 수 있는데, 이는 하나의 대상에 대해 답을 내는 데만 하룻밤의 연산이 걸릴 수 있는 작업입니다. 제 동료들은 그러한 시뮬레이션 실행 결과물(입력된 분자 구성과 비용이 많이 드는 시뮬레이터의 출력값들)을 대거 수집하여 시뮬레이터의 신경망 근사치(neural approximation)를 훈련하는 데 사용했습니다. 하룻밤이 걸리던 작업을 전체 규모 시뮬레이터를 실행하는 것과 거의 정확도가 비슷하면서도 30만 배 더 빠른 무언가로 만들어 낸 것입니다.
제프 딘: 그것은 우리가 과학을 하는 방식을 완전히 바꿉니다. 1,000만 가지를 스크리닝해야 한다면, 이 모든 시뮬레이션을 돌릴 충분한 컴퓨팅 자원을 긁어모으느라 6개월 동안 고생하는 대신 점심을 먹으러 가는 사이에 그 작업을 해낼 수 있습니다. 진정한 정답에 대한 근사치를 훨씬 더 빠르게 얻을 수 있는, 학습된 검증 모델을 비롯해 훨씬 더 빠른 검증 모델을 위한 여지가 많은 도메인에 존재합니다. 이는 실험 루프에 대해 생각하는 방식과 그 루프를 얼마나 빠르게 돌릴 수 있는지를 완전히 바꾸어 놓습니다.
다이아나 후: 가속화된 이 과학적 방법이 해결하거나 달성해내기를 진정으로 기대하시는 공간과 문제들은 어떤 것이 있나요?
제프 딘: 머신러닝 그 자체가 그중 하나입니다. 수많은 실험을 실행함으로써 모델이 재귀적으로 스스로를 지속해서 개선(recursively self-improve)할 수 있는 모델을 가질 수 있을까요? 오늘날 대규모 연구팀에서 모델이 개선되는 방식을 생각해보면, 사람들이 몇 가지 아이디어를 생각해 내고, 소규모 실험을 여러 개 돌려보고, 그것이 잘 작동했는지 확인하고, 가장 유망한 것들을 더 큰 규모로 시도해 보고, 이를 평가한 뒤, 그 결과를 새로운 모델 레시피에 통합합니다.
제프 딘: 모델 스스로가 (최상위 레벨의 사람들이 "모델 아키텍처에 이것을 반영하는 새로운 아이디어를 좀 시도해 보지 않겠니?"라고 가볍게 툭 치는 정도의 조언과 함께) 탐색하기로 결정하는 훨씬 더 자동화된 루프로 만드는 데는 실질적인 장애물이 없습니다. 모델은 수많은 실험을 실행하고, 어떤 것이 효과가 있는지 확인한 뒤, 훨씬 더 빠른 속도로 그것들을 통합할 것입니다. 효과적으로 말하자면, 투입된 컴퓨팅 단위당 발견(discoveries)의 양을 최적화하고 싶은 것입니다.
다이아나 후: 이 방에 계신 모든 분들이 창업자가 되거나 커리어를 시작함에 따라 아마 수많은 거절을 겪게 될 것입니다. 제프, 당신에게도 그런 일이 일어났었죠. 2014년에 당신과 제프리 힌턴(Geoffrey Hinton), 오리올 비냘스(Oriol Vinyals)는 증류(distillation)에 관한 논문을 썼습니다. 거대한 교사 모델을 이용해 더 적은 파라미터로 연산 비용이 저렴한 훨씬 더 작고 효율적인 모델을 훈련하는 방법이죠. 이는 오늘날 업계의 모든 이들이 사용하고 있는 트릭이 되었지만, 그 당시 그 논문은 NeurIPS에서 거절당했습니다.
제프 딘: 프로그램 위원회를 탓하지는 않습니다. 논문이 제출되면 세 명의 리뷰어가 붙는 경우가 많은데, 그중 한 명의 리뷰어가 그것을 읽고는 유의미한 영향력을 미칠 가능성이 낮다고 평했습니다. 우리가 그 논문을 썼을 때, 우리는 이것이 정말 중요한 문제임을 알았습니다. 왜냐하면 음성이나 비전 같은 도메인에서 더 많은 사람들에게 모델을 서비스하기 위해 더 대규모의 모델로부터 저렴하고 고성능인 모델을 만드는 것이 우리가 절실히 원하던 일이었기 때문입니다. 하지만 때로는 리뷰어가 그러한 경험을 가지고 있지 않을 수 있습니다. 대규모 AI 서비스를 고민하는 대신 이것이 근본적인 진전인지 여부에 대해 생각하고 있기 때문일지도 모릅니다. 가끔은 거절당하기도 하고, 그것은 괜찮습니다. 우리는 arXiv에 올렸고, 사람들은 그것을 읽고, 사람들은 그것을 사용하며, 모두가 잘되고 있습니다. 실제로 우리는 더 대규모의 Pro 모델로부터 Flash 모델을 만들 때 이 기술을 사용합니다. 그것이 바로 Gemini의 Flash 모델들이 크기와 속도에 비해 그토록 뛰어난 성능을 발휘하는 이유 중 일부이며, 해당 모델 크기 클래스의 벤치마크에서 최고 수준인 이유이기도 합니다.
다이아나 후: 거절당하더라도 계속 전진하세요.
제프 딘: 그것이 바로 그 일에서 제가 추출해 내고 싶은 교훈입니다.
진정으로 중요한 것을 구축하라
다이아나 후: 당신은 1999년, 20명 규모의 스타트업이었던 시절 구글에 합류하셨습니다. 만약 당시의 25세 제프 딘을 데려와 오늘날 당신이 가진 기술을 지닌 채 이 시대로 순간 이동시킨다면, 무엇을 하시겠습니까? 프론티어 랩에 합류하시겠습니까, 아니면 회사를 창업하시겠습니까?
제프 딘: 항상 말하기는 어렵지만, 그것은 시간을 어디에 쓰고 싶은지에 대한 매우 개인적인 선택입니다. 제게 가장 중요한 질문 중 일부는 다음과 같습니다. 당신이 진정으로 신경 쓰는 무언가에 대해 일하게 될 것인가, 그리고 함께 일하기 좋아하는 동료들과 함께 그 분야에서 진전을 이뤄낼 수 있다면 그것이 세상에 어떤 긍정적인 방식으로든 변화를 만들어낼 것인가? 생화학자나 프로그래머, 혹은 인터넷상의 모든 소비자들을 돕기 위해 그 서비스를 제공할 수 있을 것인가? 여러분이 추구해야 할 바는 세상에 긍정적인 영향력을 미치고, 함께 일하는 것을 즐기는 사람들과 일하며, 열심히 일하고 최선을 다하는 것입니다.
제프 딘: 프론티어 랩에 합류하는 것과 친한 친구 두세 명과 함께 회사를 창업하는 것은 서로 다른 경험입니다. 크고 확립된 조직에서는 구조가 있고, 당신이 모르는 것을 아는 놀라운 동료들이 많으며, 작업할 수 있는 흥미로운 문제들이 많고, 당신의 작업이 세상의 수많은 사람들에게 영향을 미치는 기존의 영향력 플랫폼이 존재합니다. 아주 작은 스타트업의 경우, 열정을 가질 수 있는 무언가가 있어야 하며, 성공하고 사업을 성장시킬 수 있는 방식으로 그 문제를 떠안는 데는 상당한 위험이 따릅니다. 하지만 그것은 또한 믿을 수 없을 정도로 보람 있을 수 있습니다. 적어도 어떤 길을 택하든 스스로에게 물어보세요. "내가 이 문제를 해결하기 위해 일하고 최상의 결과가 일어난다면, 세상이 어떤 방식으로든 훨씬 더 좋아질 것인가, 아니면 세상이 '음, 그건 좀 멋지긴 한데 뭐 어쩌라고' 할 것인가?" 후자 같은 일에 시간을 낭비해서는 안 됩니다.
다이아나 후: 당신은 수많은 엔지니어들에게 훌륭한 멘토이자 관리자였으며 거대한 시스템을 구축해 오셨습니다. 영리한 사람들과 일하는 법이나 영리한 사람을 찾는 법에 대해 이 방에 계신 분들에게 해줄 만한 교훈이 있다면 무엇인가요?
제프 딘: 여러분은 회사를 내부에서 꾸리든 창업하든, 팀을 구성할 때 필요한 특정 영역에서 정말 뛰어난 기술을 가진 사람들을 항상 찾기를 원할 것입니다. 하지만 동시에 곁에 있는 것만으로도 즐거운 사람들을 찾아야 합니다. 정말 어려운 문제를 풀며 사람들과 엄청나게 많은 시간을 함께 보내게 될 것이기 때문입니다. 에고가 낮고, 팀플레이어이며, 자신과 상호 보완적인 기술을 가진 사람들이 필요합니다.
제프 딘: 제가 모르는 것을 알고 있고, 반대로 제가 가진 기술 중 다른 사람들이 덜 가진 부분이 있는 소규모 팀에서 일하는 것은 언제나 정말 즐겁다는 것을 깨닫습니다. 여러분은 혼자서는 절대 할 수 없는 무언가를 집단적으로 구축하고 있는 것이며, 그 과정에서 자신도 모르게 새로운 지식과 기술을 엄청나게 습득하게 되고 상대방도 마찬가지입니다. 자신의 엔지니어링 또는 연구 커리어를 기법이 가득한 놀라운 공구 벨트를 차고 있는 것으로 여겨보세요. 이 세 가지 특화된 도구 대신 저 네 가지 특화된 도구가 필요한 문제를 언제 마주치게 될지 모르기 때문에, 여러분은 항상 그 공구 벨트에 새로운 도구를 추가하고 싶어 해야 합니다. 도구를 더 많이 추가할수록 미래에 마주할 문제들을 여러분 스스로 해결할 수 있을 확률이 높아집니다.
다이아나 후: 이 방에 있는 여러 사람들이 언젠가 MapReduce, TPU, 증류 등 당신이 해낸 것만큼이나 영향력 있는 무언가를 구축하게 될 것입니다. 그들이 어떤 문제를 다루고 있기를 바라시나요?
제프 딘: 세상은 아주 넓고 문제들로 가득합니다. 저는 특히 더 효율적인 추론 하드웨어 같은 새로운 하드웨어 접근 방식에 큰 기대를 걸고 있습니다. 또한 오늘날 우리가 사용하는 방식보다 데이터 효율성이 훨씬 더 높을 수 있는, 머신러닝을 위한 근본적으로 다른 종류의 알고리즘들이 존재한다고 생각합니다. 오늘날 우리의 대규모 모델들을 생각해 보면, 그들은 아마 인간이 18세가 될 때까지 보는 데이터의 1,000배에 달하는 데이터를 보았을 것입니다. 하지만 18세의 인간은 많은 면에서 훨씬 더 뛰어나며, 훨씬 더 많은 데이터를 본 최전선의 모델들과 동등한 수준을 보입니다. 자신의 행동으로부터 지속적으로 학습할 수 있는, 훨씬 더 데이터 효율적인 시스템을 만들어낼 수 있을까요? 지속 학습(continual learning)은 정말 흥미롭습니다. 멀티에이전트 상호작용도 흥미로운 주제입니다. 세상 사람들이 더 나은 소통을 나누고, 훨씬 더 품위 있는 대화를 나누며, 관심사를 바탕으로 전 세계의 만나야 마땅한 다른 사람들을 서로 만날 수 있도록 돕는 방법들을 창조하는 것—이 모든 것들이 흥미로운 주제입니다. 세상에는 멋진 것들이 아주 많으며, 우리 모두 나가서 더 멋진 것들이 일어날 수 있도록 분발해야 합니다.
다이아나 후: 멋진 말씀이네요. 제프 딘, 정말 감사합니다. 오늘 준비된 내용은 여기까지입니다.
제프 딘: 감사합니다. 모두 수고하셨습니다.