업스테이지의 Agent 최적화 오픈 웨이트 파운데이션 모델, Solar Open 2를 공개합니다.
Solar Open 2는 실제 업무 환경에서 Agent 의 기반 모델로 활용되는 것을 목표로 설계하고 학습했습니다. 도구 호출과 코딩, 오피스 업무를 포함한 다양한 Agent 시나리오를 학습 했으며, Agent, 한국어, 지식, 코딩 벤치마크에서 글로벌 수준의 성능을 달성했습니다.
총 250B 파라미터 중 토큰당 15B 만 활성화하는 MoE 구조를 채택해 모델의 성능과 추론 효율을 함께 높였습니다. 양자화 적용 시 NVIDIA H200 2장에서 구동할 수 있어 기업이 자체 인프라에 배포하고 운영 하기에도 적합합니다. 또한 여러 단계에 걸쳐 이어지는 Agent 작업을 고려해 최대 1M 토큰의 컨텍스트를 지원하며, 한국어, 영어, 일본어를 공식 언어로 지원합니다.
모델 가중치는 HuggingFace 에 상업적으로 사용할 수 있는 라이선스로 공개합니다. 이와 동시에 상세 아키텍처부터 학습 방법론, 주요 실험과 평가 조건까지 Solar Open 2의 기술과 개발 경험을 담은 Solar Open 2 Technical Report 를 공개합니다.
핵심 요약
- Agentic Use를 목표로 설계하고 학습하여 실제 업무 환경에 활용 가능한 모델
- Agent, 한국어, 지식, 코딩 벤치마크에서 글로벌 수준의 성능 달성
- 250B total / 15B active MoE 구조로 효율적 추론 가능
- 1M 토큰 컨텍스트 지원
- 양자화 적용 시 H200 2장에서 구동 가능
- 한국어, 영어, 일본어 공식 지원
- 상업적 활용이 가능한 오픈 웨이트로 공개
.png)
Chat에서 Agent로
LLM 의 역할이 달라지고 있습니다.
지금까지 LLM 은 주로 사용자의 질문에 한 번의 답을 생성했습니다. 이제는 필요한 정보를 검색하고, 여러 문서를 읽고, 코드를 작성하고, 외부 도구를 호출해 실제 업무를 끝까지 수행하는 Agent 로 확장되고 있습니다. Agent가 처리하는 업무는 일반적인 Chat 과 성격이 다릅니다. 짧은 질문에 답하는 대신 수십 번의 추론과 도구 호출을 반복합니다. 여러 파일과 문서에 흩어진 정보를 함께 다뤄야 하고, 앞에서 수행한 작업을 기억하면서 다음 행동을 결정해야 합니다. 한 단계의 실수는 이후 작업 전체의 실패로 이어질 수 있습니다.
이러한 Agentic Use 에는 세 가지 능력이 필요합니다.
- 첫째, 여러 단계에 걸친 작업을 끝까지 수행하는 long-horizon task 처리 능력입니다.
- 둘째, 긴 문서와 작업 이력을 유지할 수 있는 long-context 처리 능력입니다.
- 셋째, 사용자의 지시를 정확히 따르고 적절한 도구를 안정적으로 호출하는 능력입니다.
이 능력은 일반적인 질의응답 데이터만으로 충분히 학습하기 어렵습니다. 학습 과정에서부터 검색, 도구 호출, 코딩, 문서 작업 등 다양한 Agent 시나리오를 학습해야 합니다. 시나리오 역시 단순히 그럴듯하게 만들어서는 안 됩니다. 실제 업무 환경을 반영해야 하고, 모델이 작업을 제대로 수행했는지 결과를 검증할 수 있어야 합니다.
비용도 중요합니다. Agent 는 모델을 한 번 호출하는 데서 끝나지 않고, 계획과 실행, 검증과 수정을 반복하기 때문에 일반적으로 Chat 보다 훨씬 많은 토큰을 사용합니다. 따라서 기업이 모델을 자체 인프라에 배포 하려면 모델이 지나치게 크거나 느려서는 안 됩니다.
Solar Open 2 는 벤치마크 점수만 높은 모델이 아니라, 실제 업무 환경에서 Agent 에 연결해 사용할 수 있는 성능과 비용 구조를 갖춘 모델을 목표로 만들었습니다.
Agent 중심의 학습 데이터
업스테이지는 사전학습과 사후학습 전 과정에서 Agentic Use 를 주요 목표로 두고 Solar Open 2 를 개발했습니다. 학습 시나리오에는 검색과 도구 호출(MCP), 코딩, 오피스 업무를 포함했습니다. 모델이 설명만 생성하는 것이 아니라 실제 환경에서 행동하고, 그 결과를 확인한 뒤 필요한 경우 스스로 수정하도록 학습했습니다.
현실적인 Agent 학습 데이터를 만들기 위해 자체 데이터 합성, 검증 파이프라인을 개발했습니다. 실제 업무 환경에서 사용될 수 있는 다양한 기반 데이터를 바탕으로 정답을 명확하게 판별할 수 있는 환경을 만든 다음, 검증을 통과한 데이터만 선별하는 과정을 반복했습니다. 이렇게 확보된 고품질 Agent 데이터만 학습에 사용했습니다.
검색
검색 Agent 데이터는 모델이 이미 알고 있는 정보로 답할 수 있는 질문과, 실제 검색이 필요한 질문을 구분합니다. 생성된 질문은 구조, 자명성, 검색 가능성, 해결 가능성, 근거 및 출처를 확인하는 여러 단계의 검증을 거칩니다. 이를 통해 모델은 모르는 지식에 대해서는 적절하게 검색을 활용할 수 있는 능력을 배우게 됩니다.
도구 호출
모델이 적절한 도구를 선택 했는지만 판단하는 기존 방식과 다르게 모델이 실제 환경에 변경을 실행한 뒤, 변경된 상태를 다시 읽어 결과를 검증합니다. 그럴듯한 답을 생성하는 것과 실제로 작업을 완료하는 것을 구분하기 위해서 입니다. 이를 통해 모델은 그럴듯한 응답만이 아닌 실제로 신뢰할 수 있는 액션을 수행할 수 있게 됩니다.
코딩
코딩 Agent는 터미널에서 작업한 뒤 스스로 테스트를 만들고 실행합니다. 테스트가 실패하면 코드를 수정하고 다시 검증하는 과정을 학습 데이터에 포함했습니다. Long-horizon task 에서 실수를 수정하고 결국에는 목적을 달성하는 루트를 모델이 학습하게 됩니다.
오피스 업무
오피스 업무는 실제 업무 환경을 반영한 시나리오를 바탕으로 합니다. 여러 문서와 스프레드시트에 흩어진 정보를 함께 확인하고, 수식이 포함된 스프레드시트의 입력을 변경한 뒤 결과를 다시 계산하는 등 실제 업무에 가까운 작업을 포함했습니다. 특히 한국 업무 환경에서 자주 발생하는 문서 처리와 도구 사용 시나리오를 학습에 반영했습니다. 한국어를 잘 생성하는 데 그치지 않고, 한국어로 주어진 업무를 실제로 수행할 수 있도록 하기 위한 선택입니다.
긴 작업을 위한 1M 토큰 컨텍스트
Agent 는 작업이 길어질수록 더 많은 정보를 유지해야 합니다. 대규모 코드베이스를 탐색하거나 여러 문서를 비교하고, 이전의 도구 호출 결과를 바탕으로 다음 행동을 결정하기 위해서는 모델이 긴 컨텍스트를 입력으로 받아서 처리할 수 있어야합니다.

Solar Open 2는 1M 토큰 컨텍스트를 지원합니다. Long Context 지원을 위해 Solar Open2 는 full softmax attention인 GQA와 linear attention을 를 결합한 Hybrid Attention 구조를 사용했습니다. GQA 1개 층과 linear attention 3개 층으로 구성된 블록을 반복하며, 전체 48개 층 가운데 75%에 linear attention을 적용했습니다.
linear attention 층은 시퀀스 정보를 고정된 크기의 state로 관리합니다. 컨텍스트가 길어질수록 모든 층의 KV-cache가 같은 비율로 증가하는 구조를 피하고, 긴 입력에서 발생하는 메모리 부담을 줄이기 위한 설계입니다.
Softmax attention 층에는 positional encoding을 적용하지 않는 NoPE 구조를 채택했습니다. 학습에서 주로 본 길이를 넘어 더 긴 입력을 처리할 때의 확장성을 고려한 선택입니다.
이 구조의 효과는 학습 효율로도 확인됩니다. 같은 조건의 비교 실험에서, Solar Open 2 아키텍처는 Solar Open 100B 의 all-softmax 구조가 671B 토큰으로 도달하는 성능(MMLU 기준)에 210B 토큰으로 도달했습니다. 상세한 비교와 설계 근거는 Technical Report에 공개합니다.
반복 호출을 위한 추론 효율화
Agent가 반복적으로 모델을 호출하는 환경에서는 추론 비용이 곧 제품의 비용이 됩니다.
Solar Open 2는 총 250B 파라미터 중 토큰당 15B만 활성화하는 MoE 구조를 사용합니다. 큰 모델의 지식과 표현 용량은 유지하면서, 각 토큰을 처리할 때 필요한 활성 연산량은 낮추기 위한 설계입니다.
Solar Open 2 의 Feedforward Network (FFN) 은 320개의 routed expert와 1개의 shared expert로 구성되며, 토큰마다 8개의 expert가 선택됩니다. 모든 파라미터를 매번 활성화하는 dense 모델과 달리, 입력에 필요한 일부 expert만 사용합니다.
추론 효율적인 구조 덕분에 Solar Open 2 는 높은 성능을 유지하면서도 상대적으로 작은 인프라에서도 서빙이 가능합니다. BF16 모델 의 경우 NVIDIA H200 4장, 양자화 모델의 경우 H200 2장에서 구동될 수 있습니다.
이는 연구 목적의 평가에 그치지 않고, 기업이 자체 인프라에 모델을 배포해 Agent 서비스에 연결하는 것까지 고려한 조건입니다. 모델의 시간당 처리량, 지연 시간등의 상세한 정보는 모델 카드에서 제공합니다.
한국어에 효율적인 다국어 모델
Solar Open 2는 한국어 처리 시 토큰 효율을 높이기 위해 최적화 된 tokenizer 를 사용했습니다. 그 결과 같은 한국어 텍스트 처리시, 글로벌 모델 대비 약 50~80% 수준의 토큰만을 사용하여 처리가 가능합니다. 한국어 오피스 업무 텍스트 기준으로 Solar Open 2의 tokenizer 는 비교한 12개 가운데 가장 효율적이며, 최고 성능의 글로벌 모델보다 약 24% 앞섭니다. 같은 내용을 더 적은 토큰으로 표현한다는 것은 곧 더 낮은 추론 비용과 더 긴 유효 컨텍스트를 뜻합니다.

효율적인 학습을 위한 Selective Weight Transfer

250B 규모의 모델을 더 효율적으로 학습하기 위해 업스테이지는 Selective Weight Transfer 방법론을 개발했습니다. 모든 가중치를 무작위로 초기화하는 대신, 자사 전작 모델인 Solar Open 100B 의 학습 결과 가운데 새로운 아키텍처에서도 활용할 수 있는 가중치만 선별해 Solar Open 2의 초기화에 사용했습니다.
그림은 아키텍처와 학습 데이터, optimizer를 동일하게 유지하고 초기화 방식만 달리한 200B-A15B proxy 실험 결과입니다. Selective Weight Transfer 방식을 적용한 모델은 training loss 12B 내외 토큰으로 도달한 반면, random initialization 모델은 약 22B 토큰이 필요했습니다. 즉 Selective Weight Transfer를 적용한 모델은 약 58%의 토큰만으로 같은 loss에 도달했으며, random initialization은 약 1.7배 많은 토큰을 사용했습니다. 이는 아키텍쳐가 서로 다른 상황에서도 핵심 표현을 재활용하는 것만으로, 더 적은 학습 토큰으로 빠르게 목표 성능 수준에 도달할 수 있음을 보여줍니다.
Selective Weight Transfer 방법론은 학습 시간과 연산 자원의 사용을 줄이기 위한 업스테이지의 독자적인 접근입니다. 이번 업데이트에서 모델 성능뿐 아니라 모델을 만드는 과정의 효율도 함께 개선했습니다.
Benchmarks
MMLU-Pro, LiveCodeBench, 한국어 벤치마크에서 동급 모델 중 1위
Solar Open 2는 Agentic Use와 한국어, 추론 효율뿐 아니라 기본적인 지식과 코딩 능력에서도 경쟁력을 확보했습니다.
벤치마크 결과에서 Solar Open 2는 지식 평가인 MMLU-Pro에서 86.2, 코딩 평가인 LiveCodeBench 에서 92.4를 기록해 동급 비교 모델 가운데 가장 높은 점수를 달성했습니다.

한국어 벤치마크 평균은 85.4 로, DeepSeek-V4-Flash의 84.9 을 앞섰습니다. Fast-tier closed API인 GPT-5.4 mini의 80.8, Claude Haiku 4.5의 69.6 과 비교해서도 높은 성능을 보였습니다.

Agent 서비스의 안정성과 직접 연결되는 지시 이행 및 도구 호출 평가에서도 경쟁력을 확인했습니다. IFBench에서는 80, MCP-Atlas에서는 58.2 를 기록해 DeepSeek-V4-Flash 와 함께 최상위권에 올랐습니다. 실제 업무형 Agent 능력을 평가하는 APEX-Agents에서는 16.6 으로 비교 대상 가운데 가장 높은 점수를 기록했습니다.

6배 큰 모델과 견주는 한국어 실무 성능
Ko-GDPval 은 실제 업무 환경에서 Agent 의 업무 수행 능력을 평가하는 벤치마크입니다. 변호사, 회계사, 감염관리 전문가 등 58개 직군의 실제 업무 시나리오 170개로 구성되어 있고, 모델이 보고서, 계획서, 발표자료와 같은 문서 산출물을 직접 만들어 평가받습니다.
이 벤치마크에서 Solar Open 2는 86.75 점을 기록했습니다. 6배 이상 큰 1.6T 모델 DeepSeek-V4-Pro(86.91) 와 0.16점 차이로 대등하고, 1T 규모 MiMo-V2.5-Pro(84.62)를 포함한 나머지 모든 비교 모델을 앞서는 성능입니다.
이 격차의 의미는 실제 추론에 쓰이는 활성 파라미터로 보면 더 분명해집니다. Agent가 모델을 호출할 때 토큰마다 계산에 참여하는 파라미터 기준으로, Solar Open 2는 DeepSeek-V4-Pro의 약 3분의 1인 15B 을 사용합니다. 같은 업무를 3분의 1의 연산으로 처리한다는 뜻이고, 반복 호출이 쌓이는 Agent 서비스에서는 이 차이가 곧 운영 비용의 차이가 됩니다.
.png)
아래는 Solar Open 2가 실제로 제출한 산출물의 일부입니다.
.jpg)
상호 정합성을 갖춘 두 가지 형식으로 산출한 FATF 상호평가 사전 대응 자료입니다. 왼쪽은 거래를 위험 등급과 국가별 익스포저로 요약한 규제기관 제출용 대응 보고서(PDF)이고, 오른쪽은 룰에 적발된(R1~R4) 거래 55건 전체를 정리한 모니터링 워크북(xlsx)입니다.
.jpg)
두 건의 규제 문서 태스크에서 원문 충실도와 인용 근거를 확인한 사례입니다. 왼쪽은 제품 식별 정보와 이상사례 중증도 집계를 포함한 의료기기 PMS(시판 후 조사) 정기 보고서이며, 오른쪽은 인용 판례표와 법령 색인을 갖춘 법무법인 광고 자체 점검 결과입니다.
전작 대비 큰 폭의 성능 향상
Solar Open 2 는 자사 전작 모델인 Solar Open 100B 과 비교해 지식, 수학, 코딩 및 지시 이행 전반에서 큰 폭으로 개선됐습니다.
이는 Solar Open 100B 에서 축적한 가중치와 학습 경험을 바탕으로 새로운 아키텍쳐 및 데이터 구성, Agentic Use 중심의 학습 방법론을 적용한 결과입니다.

누구나 검증하고, 그 위에서 만들 수 있도록
Solar Open 2의 모델 가중치는 Hugging Face에 공개합니다. Upstage Solar License 에 따라 상업적으로 사용할 수 있으며, fine-tuning과 distillation을 통한 파생 모델 개발도 허용합니다. 누구나 모델을 자체 인프라에 배포하고 내부 데이터로 직접 평가할 수 있습니다. 특정 도메인이나 업무에 맞게 모델을 조정하거나, 소형 파생 모델을 개발해 새로운 Agent와 상용 서비스의 기반으로 활용하는 것도 가능합니다.
아키텍처를 선택한 근거와 학습 방법론, 주요 ablation, 평가 조건은 Technical Report 에 담았습니다. 최종 성능만 제시하는 데 그치지 않고, 모델 개발 과정에서 마주한 문제와 이를 해결하며 축적한 기술적 노하우를 상세히 공유합니다. 이를 통해 외부에서도 벤치마크 결과를 재현하고 Solar Open 2의 기술과 성능을 직접 검증할 수 있습니다.
Sovereign AI 는 모델이 특정 국가에서 만들어졌다는 사실만으로 완성되지 않습니다. 사용자가 모델을 직접 배포하고 검증할 수 있어야 하며, 데이터와 운영 환경에 대한 통제권도 가져야 합니다. 조직 내부의 데이터가 외부로 나가지 않는 환경을 구축하고, 필요에 따라 모델을 수정해 새로운 서비스로 확장할 수 있어야 합니다.
Solar Open 2를 오픈 웨이트로 공개하는 이유도 여기에 있습니다. 업스테이지가 모델 개발에 투입한 기술과 학습 경험을 함께 나눔으로써, 한국을 포함한 글로벌 LLM 연구·산업 생태계가 새로운 모델과 Agent 서비스를 만드는 기반을 제공하고자 합니다.
직접 사용하기
Solar Open 2는 공개 시점부터 다음 경로로 사용할 수 있습니다.
- 모델 가중치: HuggingFace model card
- Technical Report: Solar Open Technical Report
- 라이선스: Upstage Solar License
- 서빙 가이드: vLLM 및 Transformers 예제
- 최소 권장 구성: NVIDIA H200 4장 (BF16). 양자화 적용 시 H200 2장
Claude Code에서 사용하기
curl -fsSL <https://console.upstage.ai/claude-upstage.sh> | bashHermes Agent에서 사용하기
Solar Open 2 는 Hermes Official 모델입니다. Hermes 모델에서 선택해서 바로 사용해보실 수 있습니다.
플레이그라운드에서 체험하기
별도 설정 없이 Upstage Playground에서 Solar Open 2를 바로 사용해볼 수 있습니다. 플레이그라운드 체험은 7월 31일까지 제공됩니다.
Solar Open 2를 사용해 보고 느낀 피드백과 의견은 Hugging Face 디스커션에서 나눠 주세요. 여러분이 발견한 잘 작동하는 지점과 부족한 지점이 다음 Solar를 만드는 재료가 됩니다. 도입 상담을 비롯한 문의는 문의 페이지로 남겨주시기 바랍니다.


.gif)



