Black Forest Labs의 FLUX 3 Action은 왜 로봇 제어에서 ‘월드 액션 모델은 느리다’는 선택을 바꾸려 할까?
요약 듣기
요약 보기 
이 페이지의 핵심 질문은 이거예요. 로봇이 카메라로 본 장면을 바탕으로 다음 동작만 고르는 데서 끝나지 않고, 그 동작을 했을 때 화면이 어떻게 바뀔지도 함께 예측하면 더 잘 움직일 수 있지 않겠느냐는 거예요. 여기서 페이지가 말하는 ‘비주얼 인텔리전스’는 단순히 이미지를 분류하는 능력이 아니라, 눈으로 본 세계를 이해하고 추론하고 그 안에서 행동하는 능력을 묶어 부르는 말이에요. 그중 ‘액션 예측’은 여러 관측을 보고 다음 행동과 그 결과 상태를 예측하는 능력을 뜻하고요. 가상의 비교로 말하면, 그냥 “지금 팔을 왼쪽으로 3센티 움직여”라고 찍는 시스템보다, “그렇게 움직이면 2초 뒤 물체와 팔의 위치가 이렇게 바뀔 것”까지 같이 내다보는 시스템에 더 가까워요.
왜 이런 설명을 길게 하느냐면, 로봇 제어 모델들 사이에 이미 뚜렷한 갈림길이 있다고 저자들이 보기 때문이에요. 페이지는 공개형 액션 정책이 대체로 두 부류 사이에서 선택을 강요한다고 말해요. 하나는 미래 영상과 행동을 함께 예측하는 월드 액션 모델이고, 다른 하나는 비전-언어-액션 모델이에요. 월드 액션 모델은 세상이 어떻게 바뀌는지까지 같이 예측하니 성능이 좋은 편이지만, 계산이 무거워지기 쉽다고 해요. 반대로 비전-언어-액션 모델은 더 가볍고 빠른 쪽에 가깝지만, 벤치마크 성공률에서는 손해를 보기도 한다는 거예요. 페이지가 든 예에서는 RoboLab에서 Cosmos 3 Nano가 36.8%, π0.5가 28.0%였어요. 즉, ‘세상을 더 깊게 예측하는 방식’과 ‘실제로 빨리 돌릴 수 있는 방식’이 따로 노는 문제가 있었다는 게 출발점이에요.
월드 액션 모델이 왜 무거워지는지도 같이 설명해요. 영상과 행동을 함께 다루면 큰 장점이 있어요. 대규모 비디오 사전학습에서 얻은 세계 이해를 행동 예측으로 옮겨올 수 있거든요. 그런데 같은 이유로 계산량도 커져요. 영상까지 같이 예측하니 시퀀스가 길어지고, 일부 방식은 가이던스 때문에 한 번 더 계산해야 해서 추론 비용이 불어나고, 모델 백본 자체도 커지는 경우가 많다고 해요. 비유로 보면, 단순히 다음 한 수만 고르는 체스 프로그램이 아니라, 여러 수 뒤 판의 모양까지 계속 그려 보며 결정하는 프로그램에 가까운 셈이에요. 더 멀리 보고 더 많이 상상하니 강해질 수는 있지만, 그만큼 계산이 비싸지는 구조라는 뜻이에요.
FLUX 3 Action에 대한 저자들의 핵심 주장은, 이 불편한 선택을 조금 덜 가혹하게 만들었다는 거예요. 이 모델은 FLUX 3 백본에서 파생된 오픈 웨이트 7B 월드 액션 모델이라고 소개돼요. 저자들에 따르면 RoboLab-120 리더보드에서 이전 최고의 공개 모델보다 파라미터 수는 절반도 안 되면서 더 높은 성공률을 냈고, 단일 스텝 7B 체크포인트는 RoboLab에서 38.3% ± 0.38로 Cosmos 3 Nano의 36.8%를 넘었어요. 동시에 여전히 영상과 행동을 함께 예측하는데도, π0.5와 비교한 ‘로봇 움직임 1초당 속도’ 기준으로는 workstation과 datacenter GPU에서 1.34배에서 2.28배 개선됐다고 말해요. 이 대목이 중요한데, 페이지는 이 속도 이점이 호출 한 번의 지연시간 자체를 뜻하는 건 아니라고 따로 밝혀요. FLUX 3 Action은 한 번에 2.13초 길이의 움직임을 예측하고, π0.5는 1.0초를 예측하니, 비교 기준이 ‘얼마나 긴 구간을 얼마나 효율적으로 커버하느냐’에 더 가깝다는 뜻이에요. 또 지연시간이 덜 중요할 때는 guidance-distilled 체크포인트가 42.2% ± 0.36까지 올라간다고 구분해요.
그럼 저자들은 왜 이런 결과가 나왔다고 설명하느냐가 중요해요. 페이지는 두 가지 변화를 직접 꼽아요. 첫째는 더 작은 백본을 가능하게 한 멀티모달 Self-Flow 사전학습이에요. 이미지, 비디오, 오디오는 현실의 서로 다른 면을 담고 있으니, 행동 시연만 모아 학습하는 것보다 더 넓은 데이터 기반을 만들 수 있고, 그게 일반화에 도움이 된다는 논리예요. 둘째는 증류예요. 가이던스 패스를 없애고 샘플링 스텝 수도 하나로 줄였다고 해요. 여기서 포인트는, 계산을 줄이려고 영상과 행동을 떼어낸 게 아니라 둘의 공동 예측은 유지했다는 점이에요. 쉽게 말해, 무거운 짐을 버리면서 목적지 지도 자체를 포기한 게 아니라, 같은 지도를 더 적은 연산으로 읽게 만들었다는 식의 주장이라고 이해하면 돼요.
이 페이지는 ‘좋은 가중치만 공개하면 끝’이라고 말하지도 않아요. 오히려 로보틱스에서는 파인튜닝 레시피가 가중치만큼 중요하다고 못 박아요. 사전학습으로 넓은 세계 이해를 얻더라도, 실제 로봇의 몸체와 그 로봇이 낼 수 있는 행동 공간에 맞게 공동 비디오-액션 학습과 파인튜닝을 해야 한다는 거예요. 이건 같은 두뇌를 다른 몸에 얹는 문제라고 생각하면 쉬워요. 사람용 계단 오르기 요령을 배운 뒤에 바로 자전거 균형 잡기로 옮겨 가는 게 아닌 것처럼, 모델도 ‘무엇을 볼 줄 아는가’와 ‘이 몸으로 무엇을 어떻게 움직일 수 있는가’를 다시 맞춰야 해요. 그래서 저자들이 가중치뿐 아니라 사전학습, 중간학습, 파인튜닝, 추론 최적화 과정을 보고서로 함께 공개한다고 말하는 거고요.
작동 방식은 폐루프 제어에 가깝게 설명돼요. 예를 들어 ‘빨간 큐브를 왼쪽 통에 넣어라’ 같은 지시가 들어오면, 모델은 카메라 이미지와 관절 위치를 받아 모터 명령과 그에 따른 시각적 결과를 함께 예측해요. 그리고 로봇은 그중 정해진 수의 행동을 실행한 다음, 다시 관측하고 새 관측을 바탕으로 다시 계획해요. 한 번 긴 계획을 세워 끝까지 밀어붙이는 게 아니라, 보고 움직이고 다시 보는 순환을 반복하는 셈이죠. 페이지에 있는 시연은 이 제어 루프를 설명하기 위한 그림이고, 사용자가 몇 번 움직인 뒤 다시 볼지 바꿔 볼 수 있다고 말해요. 다만 여기서는 그 변화가 정확히 어떤 효과를 내는지까지 본문이 일반화해서 설명하지는 않아요.
저자들이 특히 강조하는 실용 포인트는 효율이에요. 로봇에서 추론이 느리면, 똑똑한 모델이라도 현장에서 쓰기 어렵다는 문제의식이 깔려 있어요. 그래서 이 페이지는 단순히 벤치마크 성공률만 내세우지 않고, 로컬 배포에 필요한 효율을 여러 번 강조해요. FP8 기준으로는 FLUX 3 Action의 기본 버전과 guidance-distilled 버전이 Cosmos 3 Nano보다 소비자용, 워크스테이션, 데이터센터 GPU 전반에서 1.52배에서 3.95배 빠르다고 말해요. 동시에 테이블에서는 FLUX 3 Action을 7B, Cosmos3-Nano-Policy를 16B로 제시해요. 즉, 저자들의 메시지는 ‘작고 빠른데도 월드 액션 모델의 장점을 버리지 않았다’에 가까워요.
또 하나 흥미로운 대목은 빠른 정책과 강한 추론 모델을 섞는 하이브리드 구성이에요. 페이지는 GPT 6 Astra 같은 최전선 추론 모델이 복잡한 과제를 풀 수는 있지만, 그걸 매 순간 직접 조종사로 쓰면 너무 느리고 비싸다고 말해요. 저자들이 인용한 설정에서는 최대 추론 effort의 GPT 6 Astra가 모든 과제를 풀 수 있었지만, 로봇 움직임 1초당 약 35.77초의 추론 시간이 추가되고, 성공 하나당 평균 13.47달러와 16분이 든다고 해요. 반면 FLUX 3 Action 단독은 H200 GPU 기준으로 로봇 움직임 1초당 21.08밀리초가 걸리고, 성공 하나당 평균 0.09달러, 2분 미만이라고 설명해요. 다만 저자들 스스로, FLUX 3 Action만으로는 모든 개별 과제를 해결하지 못한다고 인정해요. 그래서 제안하는 방식이 ‘평소엔 빠른 정책이 달리고, 필요할 때만 강한 추론 모델이 개입하는 위임 구조’예요.
이 하이브리드의 요점은, 빠른 정책의 품질이 좋아질수록 비싼 추론을 덜 자주 불러도 된다는 데 있어요. 페이지에 따르면 π0.5를 빠른 정책으로 붙였을 때는 개선이 크지 않았어요. 반면 FLUX 3 Action을 붙이면 하이브리드 정책이 전체 에피소드의 90%를 해결했고, 순수 액션 정책만으로는 풀지 못하는 복잡한 과제도 포함했다고 해요. 비용은 성공당 8.77달러, 시간은 8분으로 줄어서, 저자들은 이것이 가장 좋은 대안 구성보다 29% 더 싸고 40% 더 빠르다고 적어요. 또 100달러당 기대 성공 수와 10분당 기대 성공 수 비교에서도 FLUX 3 Action과 Astra를 결합한 저노력 설정이 가장 좋았다고 주장해요. 다만 여기서도 저자들은 순수한 최대-effort 추론이 정확도 자체는 여전히 가장 높다고 분명히 말해요. 그러니 이 결과는 ‘하이브리드가 무조건 최고’라는 선언이 아니라, 신뢰성과 비용 사이의 절충선을 어디에 둘지를 다시 조정했다는 주장으로 읽는 게 맞아요.
마지막으로, 이 페이지를 읽을 때 놓치면 안 되는 조건과 한계가 있어요. 첫째, 많은 수치는 RoboLab과 특정 GPU, 정밀도, 서빙 설정 위에서 제시돼요. 같은 비율의 이득이 다른 로봇, 다른 센서, 다른 배포 환경에서도 그대로 난다고 이 발췌문만으로 단정할 수는 없어요. 둘째, 저자들 스스로도 모든 과제를 순수 액션 정책만으로 풀지 못한다고 말해요. 셋째, 사전학습 체크포인트를 비교한 일부 결과는 작은 배치와 학습률을 쓴 예비 설정이라서, 절대적 최대 성능이라기보다 상대 비교용으로 읽어야 한다고 본문이 직접 밝혀요. 넷째, 디지털 환경이나 게임으로의 확장 가능성도 언급되지만, 이 발췌문만으로 그 영역의 성능을 자세히 판단할 정도의 근거는 충분히 실려 있지 않아요. 그래서 가장 안전한 이해는 이거예요. Black Forest Labs는 FLUX 3 Action을 ‘영상까지 함께 예측하는 월드 액션 모델의 장점을 유지하면서도, 크기와 속도 문제를 줄이려는 공개형 로봇 정책’으로 제시하고 있고, 그 주장의 설득력은 벤치마크 조건과 실제 배포 조건을 함께 봐야 해요.