바이트 LLM 전환 — 1% 미만 추가 학습, AI 개발비는 어디서 줄까
바이트 LLM은 이미 똑똑해진 AI에게 글자부터 다시 읽게 할 수 있을까요? Allen AI·케임브리지대의 벤저민 미닉스호퍼와 LMU 뮌헨·Allen AI의 발렌틴 호프만 연구진은 기존 언어모델을 바이트 수준으로 바꾸는 byteification을 10월 7일 Nature에 발표했습니다. 전형적인 사전학습 예산의 1% 미만에 해당하는 추가 학습으로 전환했다는 결과입니다. 출처: Nature 논문
여기서 궁금한 것은 AI 개발비도 그만큼 싸지는가입니다. 이번 연구는 기존 모델을 재사용할 가능성을 보여줬지만, 기업이 내는 청구서까지 측정한 것은 아닙니다. 글자 이해가 나아진 이유를 따라가면 개발비가 줄어들 수 있는 지점과 검증비가 여전히 필요한 지점이 보입니다.
미닉스호퍼와 호프만, 연구를 이끈 사람들
제1저자이자 교신저자인 미닉스호퍼가 실험을 수행했습니다. 호프만, 임페리얼 칼리지 런던의 에도아르도 폰티, Allen AI의 루카 솔다이니는 미닉스호퍼와 핵심 실험을 구상하고 설계했습니다. 타일러 머리는 실험 환경 구현과 테스트에 기여했습니다. 케임브리지대의 안나 코르호넨 등을 포함한 공동저자들은 연구 방향과 실험 설계를 함께 다듬었습니다. 출처: Nature 논문
이 팀의 Bolmo 모델은 2025년 12월 먼저 공개됐습니다. 이번 소식은 최초 공개가 아니라 Nature 최종 출판과 후속 공개입니다. Ai2는 기존 Olmo뿐 아니라 Qwen3·Llama3 계열로 전환 범위를 넓혔고, 첫 단계만 학습한 중간 모델도 공개했다고 밝혔습니다. 다른 연구실이 모든 과정을 처음부터 반복하지 않아도 되는 출발점입니다. 출처: Ai2 공식 발표
바이트 LLM은 왜 글자를 더 잘 볼까
호프만이 짚는 문제는 단어의 뜻과 단어를 이루는 글자가 서로 다른 정보라는 점입니다. 예를 들어 strawberry에 r이 몇 번 등장하는지 세려면 글자의 위치를 알아야 합니다. 하지만 많은 언어모델은 문장을 단어 또는 단어 조각인 ‘토큰’으로 바꾼 뒤 처리합니다. 토큰 하나에 여러 글자가 묶이면 내부 철자는 모델이 별도로 배워야 할 정보가 됩니다. 출처: LMU 연구진 해설
토큰화가 원문 파일의 글자를 지워 버린다는 뜻은 아닙니다. 일반적인 토큰화는 원래 문자열로 되돌릴 수 있습니다. 문제는 모델이 계산할 때 글자 하나하나의 구조가 직접 드러나지 않는다는 데 있습니다. 따라서 byteification의 가치를 ‘사라진 데이터를 복원한다’고 설명하면 정확하지 않습니다.
바이트는 컴퓨터가 텍스트를 저장하는 작은 단위입니다. 영어 알파벳은 UTF-8에서 보통 한 글자가 한 바이트지만, 한글 한 음절은 여러 바이트를 차지합니다. ‘바이트 하나가 언제나 글자 하나’라고 생각하면 한국어의 속도와 비용을 잘못 계산하게 됩니다.
미닉스호퍼의 모델도 긴 바이트열을 그대로 큰 계산 장치에 밀어 넣지는 않습니다. 작은 입력 모듈이 바이트들을 읽고 가변 길이 묶음인 ‘패치’를 만듭니다. 기존 대형 모델은 패치를 처리하고, 출력 모듈이 이를 다시 바이트 단위 예측으로 풀어냅니다. 원래 모델의 단어 조각 표현도 일부 재사용합니다. 모든 묶음을 없애는 기술이라기보다, 묶음을 만드는 위치와 방법을 모델 안으로 옮기는 접근입니다. 출처: Nature 논문
-
1
UTF-8 바이트
텍스트의 작은 저장 단위
-
2
입력 모듈·패치
바이트를 가변 길이로 묶음
-
3
기존 모델 중심부
패치 사이의 관계를 계산
-
4
바이트 출력
출력 모듈이 다음 바이트 예측
‘1% 미만’이 가리키는 것 — 전환 학습 491억 토큰
미닉스호퍼와 동료들이 설계한 전환은 두 단계입니다. 먼저 기존 모델의 중심부를 고정하고 새 입출력 모듈이 원래 모델의 행동을 따라 하도록 학습합니다. 이렇게 배운 모듈을 붙인 뒤 전체 모델을 추가 학습해 바이트 정보를 활용하게 합니다. 첫 단계는 기존 지식과 새 표현을 연결하고, 다음 단계는 그 연결을 조정하는 과정입니다. 출처: Nature 논문
Nature 최종판의 학습량은 첫 단계 98억 토큰, 두 번째 단계 393억 토큰으로 합계 491억 토큰입니다. 논문은 이를 전형적인 사전학습 예산의 1% 미만이라고 설명합니다. 아래 수치는 단계별 학습량 비교이며, GPU 사용료나 전력 소비의 비율을 뜻하지 않습니다. 출처: Nature 논문
Nature 최종판. 98억+393억=491억. 학습량이며 금액·전력 비중이 아닙니다.
이 숫자를 “AI를 만드는 비용이 99% 줄었다”로 바꾸면 안 됩니다. 이미 만들어진 원 모델의 사전학습 비용이 출발점에 들어 있기 때문입니다. 기업은 여기에 데이터 정리, 전환 실험, 보안 점검, 서비스 연결 비용도 부담합니다. 정확한 의미는 ‘기존 모델이 있을 때 새로운 바이트 모델을 시도하는 추가 부담이 작아질 수 있다’에 가깝습니다.
코드 성능과 추론 속도, 어느 조건에서 좋아졌나
미닉스호퍼가 수행한 평가에서 Bolmo는 비교 가능한 크기의 앞선 바이트 모델을 앞섰습니다. 예를 들어 STEM 평가에서는 Meta의 BLT 7B보다 16.5%p 높았습니다. 다만 기존 서브워드 모델을 모든 항목에서 이긴 것은 아닙니다. 특히 같은 데이터로 추가 학습한 Olmo 대조군을 둔 실험을 함께 봐야 구조 변경의 효과를 과장하지 않을 수 있습니다. 출처: Nature 논문
코드 평가의 pass@1은 한 번 만든 답이 테스트를 통과하는지, pass@16은 여러 후보 가운데 통과하는 답이 있는지를 보는 지표입니다. 같은 데이터로 학습한 Olmo 대조군과 비교하면 Bolmo는 전자에서 크게 낮아지고 후자에서는 개선됐습니다. 사람이 고칠 첫 답이 필요한 서비스와, 자동 테스트로 많은 후보를 걸러내는 서비스의 경제성이 서로 달라질 수 있다는 뜻입니다. 출처: Nature 논문
문자 이해 개선도 구조 변경만의 성과로 읽으면 곤란합니다. 연구진은 철자를 뒤집거나 바꾸는 영어 합성 학습 예제를 넣었습니다. 시험 단어와 겹치지 않도록 했고 다국어 평가에서도 개선을 관찰했지만, 짧은 학습 안에서 이런 자료가 중요한 역할을 했다는 점은 남습니다. 출처: Nature 논문
개선 관찰
철자·문자 조작 평가 개선
문자 이해
코드 후보 · 여러 후보 중 통과 답 존재 확률 개선
그대로 일반화 불가
한 번의 생성 성공률은 하락
코드 첫 답
원인·응용 · 합성 학습 효과 포함, DNA 별도 검증
호프만 팀은 속도도 확인했습니다. 바이트를 더 큰 패치로 묶으면 무거운 중심부를 거치는 횟수를 줄일 수 있습니다. 확장 데이터 그림의 측정은 H100 GPU에서 요청을 하나씩 처리하는 조건입니다. 약 6.6바이트를 한 패치로 묶는 수준에서 Bolmo 7B의 입력 처리 지연이 Olmo 3 7B보다 짧아졌습니다. 입력 처리는 질문을 읽고 첫 출력을 준비하는 구간을 말합니다. 출처: Nature 논문
이를 모든 답변 생성이 더 빠르다는 의미로 확대할 수는 없습니다. 패치를 크게 만들 때 성능과 효율의 상충관계가 있고, 동시 요청 수와 입력 길이에 따라 결과도 달라집니다. 상용 서비스는 같은 GPU에서 같은 품질의 완성된 답을 얼마나 빨리 내는지 비교해야 합니다. 바이트 모델의 초당 토큰 수를 기존 모델의 초당 토큰 수와 그대로 대조하는 것도 단위가 달라 부적절합니다.
돈이 줄어드는 곳과 새로 드는 곳
여기부터는 논문 수치를 바탕으로 한 경제적 추론입니다. 미닉스호퍼 팀의 결과를 산업에 대입해 보면 가장 먼저 바뀔 가능성이 있는 것은 새로운 모델을 실험하는 비용입니다. 이미 보유한 모델을 바이트 모델로 바꿔 볼 수 있다면 작은 연구실이나 기업도 처음부터 사전학습하는 대규모 프로젝트 없이 후보를 시험할 수 있습니다. 공개된 코드와 중간 모델은 재현 작업의 출발 비용을 낮추는 데 도움이 될 수 있습니다.
경쟁도 이미 시작돼 있습니다. Meta FAIR는 2024년 BLT 연구에서 바이트를 동적 패치로 처리하는 방식을 발표했습니다. 따라서 이번 성과를 바이트 모델의 발명으로 볼 수는 없습니다. 호프만과 미닉스호퍼 팀의 특징은 기존 서브워드 모델에 쌓인 학습 성과를 전환 과정에서 활용한다는 데 있습니다. 출처: Meta FAIR BLT
운영비는 별도 계산이 필요합니다. 모델을 싸게 전환했더라도 문자 출력에 드는 연산이나 새 배포 프로그램 개발비가 커지면 이익이 줄어듭니다. Allen AI의 공개 구현은 전용 신경망 구성요소와 최적화 라이브러리를 사용합니다. 기존 서비스를 설정 하나로 바꾸는 일과는 거리가 있습니다. 출처: AllenAI bolmo-core
기업이 비교할 숫자는 성공한 업무 한 건의 총비용입니다. 전환·통합비를 사용량에 나눠 반영하고, 답변 생성비와 테스트·수정비를 더한 뒤 검증을 통과한 결과 수로 나누면 됩니다. 코드 후보를 더 많이 생성해 성공률을 높였다면 그 후보를 만드는 비용과 검사하는 비용도 분자에 들어가야 합니다.
-
1
전환·통합
일회성 비용을 사용량에 배분
-
2
생성·검증·수정
여러 후보의 추가 비용도 합산
-
3
성공 건수로 나눔
동일 품질의 업무 단위로 비교
이 조건을 충족하면 모델 변환, 업무별 평가, 전용 호스팅을 제공하는 서비스가 새 수익원이 될 수 있습니다. 반대로 모든 고객에게 새 모델을 처음부터 학습해 주는 사업은 재사용 가능한 모델과 경쟁해야 할 수 있습니다. 다만 공개 자료에서 확인한 것은 연구와 배포 도구입니다. Bolmo 도입에 따른 기업 매출, 수주 또는 산업 대체 규모가 확인된 것은 아닙니다.
DNA와 한국어에 적용하려면 남은 검증
호프만은 코드와 생물서열처럼 작은 단위의 구조가 중요한 데이터를 활용처로 제시합니다. DNA를 나타내는 문자열에서는 글자 하나의 변화가 의미를 가질 수 있습니다. 그렇다고 글자를 잘 다루는 범용 모델이 곧바로 생물학을 잘 이해하는 것은 아닙니다. 이번 byteification 결과를 신약 후보 발굴 성공률이나 실험비 절감의 입증으로 해석해서는 안 됩니다. 출처: LMU 연구진 해설
별도의 산업 사례로 NVIDIA는 유전체 모델 Evo 2를 NIM이라는 배포 도구로 제공하고, 공식 문서에서 상업적 사용이 가능하다고 설명합니다. 이는 생물서열 AI를 서비스에 연결하는 경로가 이미 있다는 근거입니다. Evo 2의 성과를 Bolmo의 성과로 가져올 수는 없습니다. 두 모델은 학습 대상과 검증 목적이 다릅니다. 출처: NVIDIA Evo 2 NIM
국내 바이오 기업이 미닉스호퍼 팀의 방식을 시험한다면, 실제 서열과 연구 문서를 함께 다룰 때 오류가 줄어드는지부터 비교할 수 있습니다. 서열을 정확히 복사하는 능력, 생물학적 기능을 예측하는 능력, 실험에서 재현되는 능력은 각각 따로 평가해야 합니다. 한국어에서도 바이트 수가 늘어나는 만큼 입력 길이와 응답 지연을 직접 측정해야 합니다.
앞서 다룬 MedGemma의 의료 특화 학습이 업무에 맞는 모델 적응을 보여줬다면, 이번 연구는 모델이 텍스트를 받아들이는 단위를 바꾸는 시도입니다. 가상 세포 STATE와 실험비 문제에서처럼, 계산 결과의 개선이 실제 연구비 절감으로 이어지는지는 별도 검증이 필요합니다.
미닉스호퍼와 호프만이 연 기회는 기존 모델에 투자한 학습을 재사용하면서 다른 표현 방식을 시험하는 데 있습니다. 솔직히 사업의 성패는 ‘1% 미만’이라는 숫자 뒤에서 갈립니다. 자기 회사 데이터에서 정확도가 유지되는지, 같은 품질로 응답이 빨라지는지, 검증을 통과한 결과 한 건에 드는 돈이 실제로 줄어드는지를 봐야 합니다.
모델 전환의 가치는 검증을 통과한 결과 한 건의 비용에서 확인됩니다.
출처와 참고 링크
이 글은 정보 제공 목적이며, 특정 자산의 매수·매도를 권유하지 않습니다.
댓글 0