AI 시스템이 어려운 수학 문제를 풀어낼 때, 우리는 습관적으로 그것을 '지능의 향상'으로 해석한다. 수백만 개의 수학 예제를 학습했거나, 강화학습으로 더 나은 추론 전략을 익혔거나, 인간에 가까운 수학적 직관이 생겨나기 시작했다는 식이다. 이런 설명에 부분적 진실이 없지는 않다. 그러나 이 논의는 훨씬 단순한 가능성을 놓치고 있다. AI는 인간의 뇌보다 압도적으로 큰 '작업기억(working memory)'에 해당하는 자원을 갖고 있다는 사실이다. 더 정확히는, 인간에게서 작업기억이 담당하는 기능의 상당 부분을 대신 수행하는 거대한 외부 기호 작업공간을 확보하고 있다는 점이다.
인간 추론을 옭아매는 병목
작업기억은 정보를 짧은 시간 동안 붙들고 조작하는 정신 시스템이다. 방정식을 풀 때 우리는 각 변수가 무엇을 뜻하는지, 어떤 연산을 이미 했는지, 지금 목표가 무엇인지를 계속 유지해야 한다. 증명 과정에서는 가정과 중간 보조정리, 예외, 여러 경우의 수를 동시에 추적해야 한다. 문제는 인간의 작업기억이 지독하게 제한적이라는 데 있다. 세 자리 수 두 개를 암산으로 곱해 보면 이 한계가 곧바로 드러난다. 개별 연산 자체는 단순하지만, 부분 결과를 유지한 채 다음 계산을 이어가는 일이 어렵기 때문이다. 종이에 숫자를 적는 순간 문제의 성격이 바뀐다. 종이가 사람을 더 똑똑하게 만드는 것이 아니라, 실효 작업기억을 확장해 주는 것이다.
전문가들은 이 한계를 '청킹(chunking)'으로 우회한다. 초심자에게는 긴 기호의 나열로 보이는 것이 전문가에게는 익숙한 구조 하나로 인식되어 단일 개념 덩어리로 처리된다. 덕분에 같은 생물학적 한계 안에 더 많은 정보가 들어간다. 그러나 청킹은 한계를 없애지 못한다. 정보를 압축할 뿐이다. 흥미롭게도 이 병목의 존재는 사람들 사이의 차이에서도 관찰된다. 여러 연구는 작업기억이 일반 지능과 크게 겹치면서도, 그것을 넘어서는 독자적 기여를 한다고 시사한다. 앨러웨이와 파솔룽기(2011)는 아동을 대상으로 작업기억이 언어 능력과 별개로 수학 성취에 뚜렷하게 기여함을 보고했고, 앨러웨이와 앨러웨이(2010)의 6년 종단 연구에서는 다섯 살 때의 작업기억이 IQ를 통제한 뒤에도 이후의 문해력과 수리력을 예측했으며 오히려 IQ보다 강한 예측 변수였다. 블랭큰십 등(2015)과 프리소-반 덴 보스 등(2013)의 메타분석도 유사한 방향을 가리킨다. 다만 작업기억과 지능은 통계적으로 완전히 분리되지 않으며, 작업기억 훈련이 곧바로 큰 수학 향상으로 이어진다는 뜻도 아니다. 좁혀서 말하면, 비슷한 지능을 가진 아이들 사이에서도 정보를 붙들고 갱신하고 조작하는 능력의 차이가 수학 성취의 차이를 예측한다는 것이다.
AI의 맥락창은 거대한 외부 공책이다
여기서 AI를 이해할 결정적 단서가 나온다. 인간의 수학 수행이 작업기억 병목에 부분적으로 갇혀 있다면, 기계에 거대한 기호 작업공간을 쥐여 주는 것은 경기의 성격 자체를 바꾼다. 현대 언어모델은 원 문제, 정의, 예시, 중간 계산, 자신의 이전 추론까지 방대한 토큰 열을 한꺼번에 처리한다. 다만 맥락창은 인간의 작업기억과 같지 않다. 그것은 거대한 외부 공책에, 거기 적힌 내용을 불완전하게 검색해 쓰는 시스템이 결합된 형태에 가깝다. 인간은 숫자를 마음속으로 골라 조용히 변형하고 교체하는 능동적 내부 기억을 갖지만, 표준 언어모델은 이런 사적이고 연속적인 내부 상태 유지에 약하다. 대신 가장 안정적인 기억은 이미 생성해 놓은 토큰 열이다. 즉 모델의 추론은 외재화된다. 텍스트는 완결된 사고의 보고서가 아니라, 추론이 실제로 일어나는 메커니즘의 일부다. 인간이 연습장을 쓰는 것과 같지만, 규모가 다르다. 사람은 낯선 조건 다섯 개를 동시에 유지하기도 벅차지만, AI는 수십에서 수백 개를 명시적 형태로 보존할 수 있다. 물론 긴 맥락의 모든 항목이 완벽히 검색되는 것은 아니며, 광고된 맥락 길이가 곧 완벽하게 쓸 수 있는 기억은 아니다.
왜 하필 수학인가
이 이점은 모든 추론에서 똑같이 유용하지는 않다. 수학이 특별한 이유는 그 추론 환경이 가정을 명시하고 변형을 검증할 수 있도록 인공적으로 설계되어 있기 때문이다. 문제의 거의 모든 요소를 적어 둘 수 있고, 한번 적힌 정보는 안정적으로 유지된다. 증명 초반에 x가 정수로 정의되면 명시적으로 재정의하지 않는 한 계속 정수이며, 엄격한 부등호가 기분이나 해석에 따라 슬며시 완화되는 일은 없다. 사람은 x≠0을 확인하기 전에 x로 나누는 실수를 저지르곤 하는데, 이는 지능 부족이라기보다 장부 관리(bookkeeping)의 실패다. AI는 각 단계마다 'n은 홀수, p는 소수, x≠0을 가정하고 있다'는 식으로 활성 제약을 다시 명시할 수 있고, 맥락은 추론 상태를 기록하는 원장이 된다. 많은 어려운 문제는 초반의 통찰 이후에 전개, 경우 확인, 조건 전달 같은 덜 화려한 작업을 대량으로 요구하는데, 기계는 더 깊은 통찰 없이도 문제의 전체 상태를 보존하며 긴 연산을 완주하는 것만으로 우위를 얻는다. 문제의 난도는 각 단계의 난도만이 아니라 조율해야 할 단계의 수에도 달려 있기 때문이다. '생각 시간'을 늘리면 성능이 좋아지는 현상도, 깊은 사고라기보다 훨씬 큰 공책 안에서 이뤄지는 더 넓은 탐색으로 볼 수 있다.
실무적 함의는 분명하다. 반대로 'Maria가 왜 갑자기 답장을 끊었나' 같은 질문을 생각해 보자. 맥락창이 수년치 대화를 훑어 어조와 어휘 변화를 짚어낼 수는 있어도, 결정적 정보는 애초에 관찰된 적이 없을 수 있다. 화가 났는지, 바쁜지, 아픈지, 휴대폰을 잃었는지 — 아무리 큰 기억도 관측되지 않은 사실은 불러오지 못한다. '공정한' '성공적인' '해로운' 같은 개념은 수학 변수 같은 정확성이 없어, 모델이 대화의 모든 문장을 기억하고도 참가자들의 의도를 오해할 수 있다. 정치 분석, 역사 해석, 사업 전략, 심리 판단이 모두 그렇다. 여기서 핵심 난관은 작업기억 용량이 아니라 불완전하고 모호한 증거 속에서 올바른 인과 모형을 식별하는 일이다. 반면 수학은 답을 검산할 수 있다. 해를 원식에 대입하고, 항등식을 수치로 평가하고, 프로그램으로 수백 경우를 시험하며, 증명 보조기로 각 추론을 검증할 수 있다. 즉 AI가 실질적 강점을 보이는 영역은 '추론 상태를 외재화해 저장할 수 있고, 그 결과를 값싸게 검증할 수 있는' 문제군이라는 뜻이다. 검증 신호가 약하고 전제가 관측 밖에 있는 업무라면, 더 큰 맥락창은 도움은 되어도 문제의 본질을 풀어 주지는 못한다. AI 도구를 어디에 붙일지 결정할 때, '지능이 필요한 일'과 '기록·조율·검증이 병목인 일'을 구분하는 것이 현실적인 판단 기준이 된다.
"비전공 직장인인데 반년 만에 수익 파이프라인을 여러 개 만들었습니다"
실제 수강생 후기- 비전공자도 6개월이면 첫 수익
- 20년 경력 개발자 직강
- 자동화 프로그램 + 소스코드 제공