처리중입니다. 잠시만 기다려주세요.
TTJ 코딩클래스
정규반 단과 자료실 테크 뉴스 코딩 퀴즈
테크 뉴스
Hacker News 2026.09.09 32

확산 방식 LLM '머큐리 2.5', 초당 1,100토큰 속도로 실무 워크로드를 노린다

Hacker News 원문 보기

인셉션 랩스(Inception Labs)가 확산(diffusion) 방식 언어 모델의 최신 버전인 머큐리(Mercury) 2.5를 공개했다. 대부분의 상용 대규모 언어 모델이 토큰을 한 개씩 순차적으로 생성하는 자기회귀(autoregressive) 방식을 쓰는 것과 달리, 머큐리는 이미지 생성에서 익숙한 확산 기법을 텍스트에 적용한 계열이다. 회사 측은 머큐리 2.5가 현재 시장에 나온 확산 방식 LLM 중 가장 성능이 뛰어나며, 자신들이 아는 한 지금까지 훈련된 확산 언어 모델 가운데 가장 큰 규모라고 밝혔다.

숫자로 제시된 핵심 지표는 세 가지다. 속도는 널리 보급된 엔비디아 GPU에서 초당 1,107토큰, 지능(품질)은 이전 버전인 머큐리 2 대비 40% 향상, 가격은 100만 입력 토큰당 0.20달러, 100만 출력 토큰당 0.75달러다. 출시 시점에는 80% 할인을 적용해 입력 0.04달러, 출력 0.15달러로 제공한다. 인셉션 랩스는 이 정도 지능 수준을 GPT-5.6 루나(Low), 제미나이 3.5 플래시-라이트, 클로드 하이쿠 4.5 같은 '비용 최적화 프런티어 모델'과 견줄 만하다고 설명한다. 즉 최상위 성능 경쟁이 아니라, 저지연·저비용 구간에서 쓸 만한 품질을 확보하는 것이 이 모델의 지향점이다.

벤치마크보다 실제 실패 사례로 다듬다

주목할 점은 개선의 방법론이다. 회사는 머큐리 2 출시 이후 수천 명의 개발자와 수십 개 기업이 이를 프로덕션에 투입했고 사용량이 한 자릿수 이상 늘었다고 밝혔다. 그리고 이 과정에서 나온 고객 피드백과 실제 운영 중 발생한 실패 사례를 평가(eval) 기준을 날카롭게 다듬고 훈련 방향을 좁히는 데 활용했다고 한다. 벤치마크 점수만으로는 잡히지 않는 신호를 실제 워크로드에서 얻었다는 것인데, 머큐리 2.5는 그 피드백 루프의 첫 결과물로 소개됐다.

검색·음성·코딩, 지연이 곧 비용인 영역

머큐리가 겨냥하는 영역은 명확하다. 하나의 검색 요청은 검색 계획 수립, 질의 재작성, 결과 재정렬, 사실 구조화, 출처 요약, 답변 검증 등 수십 번의 모델 호출을 촉발한다. 이 호출들이 사용자 한 번의 상호작용 안에 들어올 만큼 빨라야 하며, 이미 여러 검색 인프라 기업이 머큐리를 프로덕션에서 쓰고 있다고 한다. 음성 분야에서는 지연이 곧 발신자가 듣는 침묵의 길이다. AI 전화 상담원을 만드는 오픈콜(OpenCall)은 머큐리 도입 후 중앙값 모델 응답 지연이 약 170밀리초 수준으로 내려왔고, P99 응답 시간이 수 분에서 1초로, P50이 0.4초에서 0.2초 미만으로 떨어졌다고 밝혔다.

코딩 에이전트 사례도 비슷한 맥락이다. 오그먼트 코드(Augment Code)는 컨텍스트 압축, 모델 라우팅, MCP 도구 검색에 머큐리를 쓰는데, 압축 작업을 머큐리로 옮기자 지연이 약 150초에서 27초로 82% 줄고 비용은 90% 감소하면서도 품질은 유지됐다고 한다. 도구 검색 요약은 1초 이내에 돌아온다는 설명이다. 이런 보조적 호출들은 반복적으로 발생하기 때문에 지연과 비용이 빠르게 누적되며, 바로 그 지점을 머큐리가 파고든다.

기능 면에서는 조절 가능한 추론(tunable reasoning), 병렬 도구 호출, 스키마에 맞춘 JSON 출력을 지원한다. 함께 프리뷰로 공개된 머큐리 보이스(Mercury Voice)는 첫 토큰까지의 시간(TTFT)이 170밀리초 미만으로, 가장 빡빡한 지연 예산을 요구하는 음성 에이전트에 최적화된 확산 LLM이다. 머큐리 라우터(Mercury Router)는 들어오는 프롬프트를 확산 모델로 이해한 뒤 품질·속도·비용의 균형이 가장 좋은 오픈·클로즈드 모델로 라우팅한다. 모델은 인셉션 API, 베이스텐, 오픈라우터를 통해 이용할 수 있고, 기업용 배포는 전용 용량, 오토스케일링, 컴플라이언스 제어, 데이터 보존 설정을 지원한다.

실무자가 짚어야 할 한계

한국 실무자 관점에서 이 발표는 '최고 지능'이 아니라 '지연이 병목인 파이프라인'을 다시 볼 계기로 읽는 편이 정확하다. 검색·음성·에이전트처럼 한 요청이 여러 번의 모델 호출로 쪼개지는 구조라면, 보조 단계를 빠르고 값싼 모델로 대체해 전체 지연과 비용을 압축하는 접근이 실질적 효과를 낼 수 있다. 다만 제시된 속도·비용·품질 수치는 인셉션 랩스와 일부 고객사가 자사 워크로드에서 측정한 값이며, 비교 대상으로 든 모델과의 품질 동등성 주장도 자체 평가에 기반한다. 출시 할인가 역시 한시적이라 정가 기준으로 비용을 재계산해야 한다. 회사는 이미 자사 최대 규모의 차기 모델을 훈련 중이며 향후 몇 달 내 출시를 목표로 한다고 밝혔는데, 확산 방식이 속도와 토큰 효율을 유지한 채 어디까지 품질을 끌어올릴 수 있는지가 이 계열의 실용성을 가늠할 관전 포인트다.

이 뉴스가 유용했나요?

이 기술을 직접 배워보세요

AI 도구, 직접 활용해보세요

AI 시대, 코딩으로 수익을 만드는 방법을 배울 수 있습니다.

AI 활용 강의 보기

"비전공 직장인인데 반년 만에 수익 파이프라인을 여러 개 만들었습니다"

실제 수강생 후기
  • 비전공자도 6개월이면 첫 수익
  • 20년 경력 개발자 직강
  • 자동화 프로그램 + 소스코드 제공

매일 AI·개발 뉴스를 받아보세요

주요 테크 뉴스를 매일 아침 이메일로 전해드립니다.

스팸 없이, 언제든 구독 취소 가능합니다.