OpenAI의 GPT-6 Sol과 Luna는 왜 Astra와 따로 나오고, 실제로 무엇이 달라졌을까?
요약 듣기
요약 보기 
이 글의 중심 메시지는 단순히 "새 모델이 나왔다"가 아니에요. OpenAI는 가장 까다롭고 중요한 일에는 여전히 GPT-6 Astra가 맞지만, 실제 업무는 늘 같은 규모와 속도와 예산으로 돌아가지 않는다고 봐요. 그래서 Astra급 발전을 더 빠르고 더 저렴한 층으로 내려보내기 위해 GPT-6 Sol과 GPT-6 Luna를 추가했다는 설명이에요. 즉, 최고 성능 하나만 밀기보다, 일상적인 업무와 대규모 운영까지 감당할 수 있게 모델 계층을 넓히려는 이야기라고 보면 돼요.
세 모델의 관계는, 가상의 비유로 말하면 같은 계열 엔진을 얹었지만 용도가 다른 차종처럼 이해하면 쉬워요. Astra는 결과를 가장 중시할 때 고르는 상위 모델이고, Sol은 어려운 일을 반복해서 시도해 볼 여유를 주는 중간 축, Luna는 더 가벼운 비용으로 넓게 쓰기 위한 축에 가까워 보여요. 여기서 OpenAI가 말하는 "cost-intelligence curve"는 성능과 비용의 균형을 뜻해요. Sol과 Luna는 Astra와 비슷한 학습 방법으로 만들었고, 그 덕분에 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬 같은 발전을 더 싼 가격대에 가져왔다고 주장해요. 가격도 API 기준으로 GPT-5.6 프로모션 가격 대비 절반으로 낮췄다고 밝혀요. 100만 토큰당 Sol은 입력 4달러에서 2달러, 출력 20달러에서 10달러로, Luna는 입력 0.20달러에서 0.10달러, 출력 1.20달러에서 0.50달러로 내려갔다는 식이에요.
왜 이게 중요하다고 말하느냐면, OpenAI는 실제 업무형 벤치마크에서 "값은 덜 들지만 일은 꽤 잘하는 모델"이라는 그림을 보여주려 하기 때문이에요. 예를 들어 AutomationBench는 판매, 마케팅, 운영, 지원, 재무, 인사 같은 영역에서 47개 도구를 써가며 끝까지 업무 흐름을 수행하는 시험이라고 설명돼요. 여기서 GPT-6 Sol은 높은 추론 설정에서 Claude Opus 5보다 더 높은 점수를 내면서도 작업당 비용은 훨씬 낮았다고 해요. Luna도 전작보다 점수는 오르고 작업당 비용은 더 내려갔다고 하고요. 또 Agents’ Last Exam은 컴퓨터로 하는 전문 업무 전반을 길게 수행하는 평가인데, Sol이 여기서도 높은 점수와 더 낮은 비용을 같이 보여줬다는 게 글의 주장입니다. 숫자 자체보다 핵심은, 복잡한 워크플로를 한 번만 맞히는 게 아니라 여러 번 돌려 보고 수정해야 하는 상황에서 비용 차이가 곧 실용성 차이로 이어진다는 논리예요.
사실성 부분에서는 더 조심해서 읽을 필요가 있어요. OpenAI는 사용자가 오류를 신고했던 실제 대화들을 비식별화해 내부 평가를 만들었고, 그 기준에서 Sol은 전작보다 사실 오류를 대략 절반 수준으로 줄였다고 말해요. Luna도 많이 좋아졌고, 높은 추론 설정에서는 GPT-5.6 Sol에 가까운 수준을 훨씬 낮은 비용으로 낸다고 설명해요. 다만 이 평가는 원래 오류가 나기 쉬운 대화만 따로 모은 셈이라서, 보통 사용 환경 전체를 그대로 대표하지는 않는다고 본문이 직접 밝혀요. 답변 길이를 통제하지 않았다는 단서도 붙어 있어요. 그러니 이 부분은 "항상 절반만큼 덜 틀린다"는 보장이라기보다, OpenAI가 특정한 어려운 오류 유발 사례에서 개선을 관찰했다는 뜻으로 받아들이는 게 맞아요.
코딩과 컴퓨터 사용 쪽은, 비용 절감이 왜 중요한지 특히 잘 드러나요. 글에 따르면 코딩 에이전트가 맡는 작업이 더 길고 복잡해지면서, 내부에서도 토큰 사용량이 크게 늘었고 그래서 지속 사용 비용이 핵심 문제가 됐어요. FrontierCode는 코드가 단지 정답인지뿐 아니라 실제 저장소에 병합할 만한지까지 본다고 해요. 여기서 병합 가능성이라는 말은 테스트 품질, 범위 조절, 코드 스타일, 코드베이스 규칙 준수 같은 현실적인 조건까지 포함한다는 뜻이에요. DeepSWE는 실제 코드베이스의 장기 과제를 푸는 시험이고, OSWorld는 여러 컴퓨터 작업을 길게 수행하는 시험이에요. OpenAI는 Sol이 이런 평가들에서 전작보다 좋아졌고, 어떤 경우에는 경쟁 모델과 비슷한 성능을 훨씬 낮은 작업당 비용으로 냈다고 강조해요. Luna 역시 최고 점수 경쟁보다는, 꽤 괜찮은 성능을 매우 낮은 비용으로 제공하는 위치에 놓여 있어요. 결국 이 대목은 "최고 성능을 조금 양보하더라도 더 자주, 더 오래, 더 많이 돌릴 수 있느냐"가 개발 현장에선 중요하다는 설명으로 이어져요.
응답 스타일 변화도 이 글이 꽤 강조하는 부분이에요. OpenAI는 Astra에서 좋아졌다고 본 커뮤니케이션 방식을 Sol과 Luna에도 가져왔다고 말해요. 더 명확하고, 전문용어가 덜하고, 이상한 표현이 줄고, 쓸모 없는 디테일을 덜 말하면서도 답이 지나치게 가벼워지지 않게 했다는 거예요. 예시로 웹사이트를 벤토 박스 스타일로 바꾸는 요청을 비교하는데, OpenAI는 GPT-6 Sol의 답을 더 선호한다고 밝혀요. 이유는 성급하게 결론부터 단정하지 않고, 무엇을 확인했고 무엇은 확인하지 않았는지 더 분명히 말하며, 질문자가 이미 아는 듯한 정보를 덜 반복하고, 필요 없는 구현 세부사항까지 굳이 늘어놓지 않기 때문이라는 설명이에요. 다만 본문도 이건 스타일의 문제라 주관적일 수 있다고 인정해요. 그래서 이 부분은 객관식 점수라기보다, 사람들이 실제로 대화를 하며 느끼는 사용감에 대한 OpenAI의 판단에 가까워요.
개발자 관점에서는 프롬프트 캐싱 이야기도 중요해요. 이것도 가상의 비유로 보면, 긴 업무 지시서의 앞부분을 매번 처음부터 다시 읽는 대신, 공통으로 쓰는 부분에 책갈피를 꽂아 두고 다음 작업에서 재활용하는 느낌에 가까워요. OpenAI는 GPT-6에서 캐시 적중률을 높여 에이전트가 같은 문맥을 더 많이 재사용하게 했고, 캐시된 입력 토큰 읽기에는 90% 할인도 준다고 말해요. 또 대시보드와 진단 도구로 어디서 캐시를 놓치는지 보게 하고, 추론 강도나 도구 사용 여부를 바꿔도 앞의 문맥은 캐시 재사용이 가능하게 했다고 설명해요. 캐시 접점을 개발자가 직접 정하는 기능도 넣었고요. GitHub는 이런 개선 덕분에 수개월 동안 수십억 건 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 절반 넘게 줄었다고 보고했다고 인용돼요. 같은 문단 뒤에는 정렬 이야기로 이어지는데, Sol과 Luna가 GPT-5.6 계열보다 코딩 작업에 대해 오해를 부르는 주장을 덜 한다고 해요. 다만 그 정렬 평가는 일부러 까다로운 상황을 골라 시험한 것이어서, 평소 사용에서의 실패율을 곧바로 뜻하지는 않는다고 적혀 있어요.
마지막으로, 어디서 쓸 수 있는지와 숫자를 해석할 때의 주의점도 챙겨야 해요. Sol과 Luna는 ChatGPT Work와 Codex에서 해당 유료 플랜 사용자에게 제공되고, 무료와 Go 사용자는 데스크톱 앱에서 Luna를 쓸 수 있다고 해요. 반면 일반 Chat에는 아직 없고, 안정성을 위해 순차적으로 풀겠다고 적혀 있어요. 또 본문의 평가들은 연구 환경이나 API에서 수행됐기 때문에, 시스템 프롬프트나 사용 가능한 도구 차이로 실제 제품 화면의 체감과 약간 다를 수 있다고 밝혀요. 경쟁 모델 점수는 공개 보고서에서 가져왔고, 어떤 경우에는 Claude Fable 5.1 수치가 없어 Claude Fable 5 점수를 대신 썼다고도 해요. 그러니까 이 글은 분명히 OpenAI가 자기 모델군의 위치를 설명하며 강점을 보여주는 자료이고, 숫자를 볼 때도 같은 제품 화면에서 완전히 같은 조건으로 재현된 결과라고 단정하면 안 돼요.