🏅오픈AI가 수학 올림피아드 짱 먹었습니다
2025. 07. 22 | EP. 22
오늘 레터는 이런 내용이에요 💌:
  • 오픈AI가 수학 올림피아드 짱 먹었습니다🏅
  • 올림피아드 문제, AI에게 왜 더 어려울까?
  • 오픈AI 혼자 금메달리스트가 아니라고?
🧠 오픈AI의 미공개 모델, 금메달리스트가 되다

‘수포자’가 6시간 33분 만에 국제 수학 올림피아드(International Math Olympiad, IMO)에서 금메달을 딸 확률은 얼마나 될까요?


최신 LLM들이 2025 IMO에서 동메달 근처에도 가지 못했단 게시글이 올라온 지 약 6시간 반 만에, 오픈AI의 연구원 알렉산더 웨이(Alexander Wei)는 자사 미공개 AI 모델이 금메달 수준의 성적을 달성했다고 발표했습니다.

몇 시간 만에 상반되는 결과를 보여주는 발표를 비교하는 트윗. 출처: X @DeryaTR_

반나절 만에 무슨 일이 일어난 걸까요?😯

국제 수학 올림피아드에 대해 알아보자

출전만으로도 부모의 자랑이 되는 국제 수학 올림피아드(IMO)는 매년 열리는 세계 최고 권위의 고등학생 수학 경시대회입니다. 대회는 이틀에 걸쳐 진행되며, 각 날 4시간 30분 안에 3문제씩, 총 6문제를 풀어야 합니다. 각 문제당 배점은 7점으로 총점은 42점이며, 일반적으로 5~6문제를 완벽히 해결해야 금메달에 해당하는 점수를 얻을 수 있습니다. 결국 한 문제당 90분이 할당되는데요. 생각보다 널널하다 싶으신가요? 예시 문제를 보여드리겠습니다.

2025 국제 수학 올림피아드 둘째 날 문제 예시. 출처: IMO

올림피아드 문제들은 기존의 수학 경시에 비해 훨씬 깊은 수학적 통찰력에 더해 창의적인 사고력까지 요구합니다. 시간 안에 문제를 해결하지 못하는 참가자도 많습니다. 매년 가장 어려운 문제로 꼽히는 6번 문제는 올해 598명 중 569명이 부분 점수도 없이 0점을 맞았으며, 오직 5명만이 만점을 받았습니다. 오픈AI의 미공개 모델도 6번은 풀지 못했지요.

수학 초보에서 우등생으로!

오픈AI 미공개 모델의 금메달 소식을 전하며 알렉산더가 쓴 이미지. 출처: 오픈AI

딸기로 표현한 미공개 모델은 코드네임이 ‘strawberry’였던 o1 시리즈 중 하나로 추정되는데요. 어떻게 시험을 봤는지 살펴볼까요?


오픈AI의 미공개 모델은 실제 참가자들과 동일한 환경에서 2025 IMO 본선 문제를 풀었습니다. 똑같이 이틀에 나누어 시험을 보았는데요. 이틀간 각 4.5시간짜리 시험 세션을 치르고, 어떠한 도구나 인터넷 도움 없이 공식 문제지를 읽고 자연어로 해답을 작성했습니다. 채점은 IMO 메달리스트 출신 수학자 3명이 각 문제별로 답안을 검토해 만장일치로 동의하는 경우에만 점수를 부여했습니다. 그 결과, 6문제 중 5문제를 해결한 미공개 모델은 총점 42점 중 35점을 획득하며 금메달을 거머쥐었습니다!🏅

(금메달에 해당하는 점수를 받았다는 의미로, 실제 메달을 수상하지는 않았습니다.)


LLM의 수학 경시 능력을 평가하는 플랫폼 MathArena에 의하면, 2025 국제 수학 올림피아드에서 가장 높은 점수를 받은 제미나이 2.5 프로는 총점 13점을 받으며 평균 31.55% 정도의 정확도를 기록했습니다. 이에 비해 오픈AI의 미공개 모델은 거의 3배에 가까운 점수를 끌어올렸지요.

최신 LLM의 2025 IMO 성적표. 출처: MathArena

하지만 이 모델이 오픈AI의 새로운 모델인 GPT-5일까, 묻는다면 그렇지는 않습니다. 알렉산더는 이 모델이 GPT-5와는 별개로, 실험적 연구 모델임을 명확히 합니다. GPT-5가 곧 출시되겠지만, 현재로서는 이번 대회 결과 수준의 고급 수학 능력은 포함시킬 계획이 없다고 전했습니다.

오픈AI의 성과, 무엇이 특별한 걸까?

수학 문제 해결에 특화된 AI 모델들은 꾸준히 발전해오고 있었습니다. 구글 딥마인드에서도 비슷한 성과가 있었는데요. 2024년, 딥마인드는 IMO 본선 문제 6개 중 4문제를 정확히 해결하여, 금메달 기준에서 1점이 모자란 총점 28점을 기록했다고 발표했습니다.

구글의 모델들이 2024 IMO에서 거둔 성적표. 은메달 수준에 달한다. 출처: 구글 딥마인드

딥마인드는 AlphaProof와 AlphaGeometry라는 수학 특화 모델을 사용했는데요. 이 모델들은 문제를 공식화한 후 정형화된 증명 언어를 활용해 해답을 찾아냈습니다. 일부 어려운 문제의 경우, 정답을 찾기 위해 최대 3일까지 계산을 돌렸다고 합니다. 그렇다면 이번 오픈AI 소식은 무엇이 특별한 걸까요?


가장 큰 차이점은 바로 이번 모델이 특수한 수학용 시스템이 아니라, 일반적인 언어 모델의 연장선에서 개발된 범용 추론 AI라는 점입니다. 일반적인 문장을 예측하고 이해하는 모델이 새로운 학습 방법을 통해 이처럼 높은 수학 수준에 도달한 것인데요. 비상한 두뇌를 가진 일반 학생이, 수학과 영재들이 겨루는 시험에서 상위권으로 시험 성적을 거둔 상황이라고 볼 수 있습니다. 화제가 될만 하지요?


덧붙여 알렉산더는 이번 소식이 갖는 의미를 명확하게 정의합니다.📝


기존에 AI가 풀어오던 수학 문제들은 비교적 짧은 시간 안에 해결이 가능했습니다. 예를 들어, 고등학교 수준의 문제들로 구성된 GSM8K에서는 문제 하나를 푸는 데 평균 0.1분 정도면 충분했습니다. 이후 MATH 벤치마크*에서는 약 1분, AIME에서는 약 10분 정도의 추론 시간이 필요했지요. 올림피아드 문제는 한 문제를 푸는 데 약 100분이 걸리는, 지속적이고 치열하게 사고해야 하는 수준입니다. 이번 평가는 AI가 긴 시간 동안 복잡한 논리적 추론을 유지할 수 있다는 걸 증명합니다.

*벤치마크: AI 성능을 측정하기 위해 사용되는 평가용 문제집 또는 데이터셋

AI의 문제 풀이 답변 중 일부. 출처: 오픈AI

또한 IMO 답안은 ‘정답’ 하나로 끝나지 않고, 수 페이지에 걸친 증명 형식이라는 점도 AI에게는 큰 장벽이었습니다. 기존에 AI에 사용하던 강화학습 기법은 보통 명확한 보상 신호가 주어지는 문제, 즉 정답 여부가 명확한 문제에 최적화되어 있었는데요. IMO 문제는 중간중간 ‘정답에 가까워졌는지’를 평가하기도 어렵고, 답안의 옳고 그름을 판별하기가 무척 까다롭습니다. 때문에 기존 방식으로는 이런 증명 문제에서 성능을 내기가 힘들었지요. 그렇다면 오픈AI 팀은 어떤 접근을 했을까요?🧐


이번 모델은 범용 강화학습과 연산을 확장하는 방식을 결합해 개발되었습니다. 수학에 특화된 시스템을 따로 만드는 대신, 일반적인 AI 학습 방식을 유지하면서 모델이 스스로 더 깊게 논리적인 추론을 이어갈 수 있도록 설계했지요. 그 결과로 모델은 인간 수학자처럼 긴 증명을 차근차근 이어가며 ‘섬세하고 빈틈없는’ 수학적 논증을 완성할 수 있게 되었습니다.


한편, 경쟁사인 구글 딥마인드도 이번 수학 올림피아드에서 금메달 수준의 결과를 낸 것으로 보입니다. 실제로 오픈AI의 발표 이후 딥마인드 소속 연구원 아르칫 샤르마(Archit Sharma)는 아래와 같은 트윗을 남겼다가 지웠는데요:

축하해! 발표 선수쳤네 — 6번 문제가 이제 새로운 벤치마크인듯?


딥마인드 또한 6번 문제를 제외하고는 모두 풀었을 가능성을 암시합니다. 하지만 아직 공식적인 발표는 나오지 않았습니다.

알렉산더는 4년 전, 2025년 6월쯤이면 AI가 MATH 벤치마크에서 30% 정도의 정답률을 기록할 것이라 예상했다고 합니다. 당시 예상 평균이 52.5%였던 것을 보고, ‘다들 너무 낙관적이네’ 하고 생각했다고 회상하지요. 그런데 약 한 달이 더 지난 지금, AI는 MATH 벤치마크보다 훨씬 어려운 IMO 본선에서 금메달 수준의 성과를 거두었습니다.

사람들의 예상치 그래프. 출처: 알렉산더 X 계정

일반 추론 모델이 국제 수학 올림피아드에서 상위권을 차지했다는 사실은 분명 놀라운 성과입니다. 하지만 피로와 지루함을 느끼고, 힘들면 포기하고 싶은 순간들을 견뎌 온 인간 학생들의 성취에 비할 바는 아니지요.


올해 상위권에는 대한민국 학생이 6명이나 있습니다. 아니, 출전한 대한민국 학생 전원이 상위권에 안착했다는 표현이 더 정확하겠습니다. 박경준, 함우주, 이현준, 윤혜원, 장현준, 그리고 조형준 학생께 축하의 마음을 전합니다.👏🏼

구독자님, 재밌게 읽으셨나요?
주변에도 공유해 주시면 정말 감사하겠습니다. 😌
먀. ai
hello@mmmya.ai
수신거부 Unsubscribe😭