AI 모델

리플렉션 빔 완전 정리: 코딩을 겨냥한 5010억 파라미터 오픈 가중치 모델

리플렉션 AI가 코딩과 에이전트 작업을 겨냥한 5010억 파라미터 오픈 가중치 모델 빔을 공개했다. 가중치는 이번 달 아파치 2.0으로 풀리지만, 성적표는 아직 회사 자체 측정치다.

김민준김민준
인기 지수: 1,250
빛나는 코어에서 펼쳐지는 추상적인 오픈 가중치 신경망 이미지

리플렉션 AI가 첫 오픈 가중치 모델을 공개했다. 파라미터는 5010억 개지만, 정작 중요한 건 성적표가 아니라 무엇을 아껴 쓰는가다.

리플렉션 빔이 실제로 무엇인지

미국 리서치랩 리플렉션 AI가 10월 5일 빔(Beam)을 공개했다. 빔은 희소 전문가 혼합(MoE) 모델로, 전체 파라미터가 5010억 개고 그중 한 토큰을 만들 때 실제로 켜지는 건 230억 개다. 숫자는 크지만 매 순간 일부만 일하는 구조라, 서류상 크기보다 돌리는 비용이 적게 든다.

학습 초점은 코딩과 추론, 그리고 에이전트 작업이다. 에이전트 작업이란 모델이 한 번의 질문에 답하는 데 그치지 않고, 스스로 계획을 세우고 도구를 호출하며 작업을 끝까지 밀고 나가는 일을 말한다. 텍스트만 다루므로 이미지나 음성은 처리하지 않는다.

지금 당장 내려받을 수는 없다. 리플렉션은 최종 레드팀과 평가를 진행 중이며 얼리 액세스 신청을 받고 있다. 가중치와 기술 보고서, 모델 카드, 개발자용 결과물은 이번 달 안에 아파치 2.0 라이선스로 풀릴 예정이다. 이 라이선스는 기업에 실질적이다. 아파치 2.0은 상업적으로 모델을 돌리고 고쳐 쓸 수 있게 해주며, 일부 오픈 공개에 붙는 사용 조건도 없다.

23조 8000억 토큰과 1억 회 롤아웃

빔은 웹과 라이선스 계약 데이터에서 뽑은 23조 8000억 토큰으로 사전 학습했다. 비슷한 크기의 오픈 베이스 모델과 비슷한 수준이다. 여기까지는 일반적인 읽기 식단이다.

색다른 건 강화학습(RL) 단계다. 리플렉션은 엔비디아 GB300 1만 500장으로 4주 동안 RL을 돌려 1억 회가 넘는 롤아웃을 생성했다. 최대 문맥 길이는 25만 6000토큰이다. 회사는 오픈랩이 지금까지 수행한 RL 가운데 가장 큰 규모 중 하나라고 밝혔다. RL은 모델이 문제를 풀고 채점받으며 스스로를 고쳐 나가는 단계라, 규모가 크면 여러 단계를 거치는 추론이 보통 좋아진다.

이게 독자에게 왜 중요할까. 무거운 RL은 코드를 디버깅하거나 버그를 여러 파일에 걸쳐 추적하는 작업에서 드러난다. 리플렉션은 RL 연산이 늘어날수록 점수가 계속 올랐다고 전한다.

리플렉션이 밝힌 빔의 코딩 성적표

여기 점수는 전부 리플렉션 자체 측정치이지, 독립 검증을 거친 값이 아니다. 실제 깃허브 이슈를 고치는 능력을 재는 SWE-bench Verified에서 빔은 80.9를 기록했다. 명령줄과 여러 단계 터미널 작업을 시험하는 Terminal Bench v2.1에서는 80.1이었다.

강한 점수다. 다만 중국 오픈 모델 몇 개보다는 낮다. 키미 K3는 Terminal Bench에서 88.3, 딥시크 V4.1 플래시 90.6, 큐웬 3.8-Max 86.6, GLM 5.3 88.2를 보고했다. GLM 5.2와는 가깝다. 빔 80.1 대 GLM 5.2의 81.0이다.

리플렉션은 이 격차를 숨기지 않는다. 빔이 GLM 5.2와 경쟁력이 있고 코딩·에이전트 작업에서 큐웬 3.8-Max에 근접한다고 말하면서, 키미 K3 같은 모델은 원시 성능에서 여전히 앞선다고 밝힌다.

모델

Terminal Bench v2.1

SWE-bench Verified

리플렉션 빔

80.1

80.9

GLM 5.2

81.0

미공개

GLM 5.3

88.2

미공개

키미 K3

88.3

미공개

큐웬 3.8-Max

86.6

미공개

빔의 승부수는 선두 등극이 아니다. 선두에 가까이 가면서 돌리는 값은 덜 내는 것이다.

진짜 무기: 추론 효율

그럼 빔은 어디서 이길까. 바로 추론 시점, 즉 모델이 요청에 답하는 순간의 효율이다. 리플렉션은 빔이 GLM 5.2와 비슷한 추론 점수를 내면서 추론 연산을 3~4배 적게 쓴다고 밝혔다. 큐웬 3.8-Max처럼 2조 파라미터 이상 계열과 비교하면 격차는 더 벌어진다.

이 주장은 조심해서 봐야 한다. 실측 비용이 아니다. 리플렉션은 활성 파라미터 수와 생성 토큰을 바탕으로, 인공지능 분석과 데이터커브 자료를 참고해 순전파 연산을 추정했다. 프롬프트 처리와 어텐션, 서빙 오버헤드는 제외했다. 회사도 이게 실측 비용 벤치마크가 아니라 근사 비교라고 인정한다.

그래도 밑바탕 논리는 맞다. 토큰당 230억 파라미터만 켜는 희소 모델은 비슷한 능력의 밀집 모델보다 연산을 덜 쓴다. 토큰마다 값을 내는 팀이라면, 코딩과 에이전트 작업량이 많은 곳에서 청구서가 줄어들 수 있다.

가중치가 풀리기 전에 볼 것

가장 큰 물음표는 검증이다. 지금까지 모든 점수는 리플렉션 자체 평가에서 나왔고, 바깥에서는 아직 아무도 빔을 돌려보지 못했다. 가중치가 풀린 뒤 독립 테스트가 효율 주장이 실제로 버티는지 판가름할 것이다.

약속이지 증거는 아니다.

가용성도 변수다. 몇 주 안에 허용적 라이선스로 가중치가 풀린다고 하니, 오픈 모델과 API 전용 옵션을 저울질하던 팀이라면 장기 계약을 미루고 직접 시험해볼 명분이 생긴다. 효율 수치가 검증을 통과한다면, 작은 모델처럼 도는 5010억 모델은 기업 코딩 작업에서 쓸모 있는 선택지가 된다.

이 소식 공유하기

출처

관련 AI 뉴스

채팅 말풍선이 펼쳐져 상호작용 차트와 버튼으로 변하는 유리 패널 일러스트
AI 모델

오픈AI, GPT-6와 인텔리전트 UI 전면 배포

오픈AI가 챗GPT 전체 사용자에게 GPT-6와 인텔리전트 UI를 풀었다. 답변이 차트와 버튼, 폼으로 나오는 새 형식이고, 무료 이용자는 10월 8일부터 쓸 수 있다.

인기 지수: 1,700
작은 깃털 모양 칩과 거대한 냉각탑을 나란히 그린 차분한 편집 일러스트
AI 모델

앤트로픽 클로드 하이쿠 5.5 공개, 소형 모델 값 75% 내렸다

앤트로픽이 경량 모델 클로드 하이쿠 5.5를 공개했다. 돌리는 값이 하이쿠 4.5보다 평균 75% 줄었고, 같은 날 소넷 5.5의 캐시 읽기 요금도 절반으로 내렸다.

인기 지수: 1,500
유럽 데이터센터 프레임 안에 놓인 거대한 신경망 코어, 푸른빛과 보랏빛 톤
AI 모델

미스트랄, 1조 매개변수 오픈웨이트 '라지 4' 공개

프랑스 미스트랄AI가 전체 매개변수 1조 개 규모의 오픈웨이트 모델 '라지 4'(별칭 르 촌크)를 미리보기로 공개했다. 가중치는 이달 말 풀리고, 유럽 자체 데이터센터의 그레이스 블랙웰 GPU 3800장으로 학습됐다.

인기 지수: 1,600
미니멀 캔버스 위 사진을 편집하는 바나나 모양 커서, 부드러운 노랑과 민트 톤
AI 모델

구글 나노 바나나 2.1 출시, 이미지값 반값인데 입력값은 3배

구글이 이미지 생성 모델 나노 바나나 2.1을 정식 출시했다. 1K 이미지 한 장이 0.0336달러로 절반이 됐지만 입력 토큰 값은 세 배 올랐다. 나노 바나나 2는 10월 29일 종료된다.

인기 지수: 1,300