๐Cosmos Policy ๋ฆฌ๋ทฐ
Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu
NVIDIA ยท Stanford University, arXiv preprint (2026-01-22 ์ ์ถ, v1)
- ๐ก ์ฌ์ ํ์ต๋ ๋น๋์ค ์์ฑ ๋ชจ๋ธ(Cosmos-Predict2-2B)์ ๊ตฌ์กฐ ๋ณ๊ฒฝ ์์ด ๋จ ํ ๋ฒ์ post-training๋ง์ผ๋ก ๋ก๋ด ์ ์ฑ ์ผ๋ก ๋ฐ๊พผ๋ค โ ์ก์ ยท๋ฏธ๋ ์ํยท๊ฐ์น๋ฅผ ์ ๋ถ ๋น๋์ค ๋ชจ๋ธ์ latent diffusion ์ํ์ค ์ โlatent frameโ์ผ๋ก ๋ฐ์ด ๋ฃ๋ ๊ฒ์ด ์ ๋ถ๋ค.
- โ๏ธ latent injection์ผ๋ก (s, a, s', V(s'))๋ฅผ ํ๋์ latent ์ํ์ค๋ก ๋ฐฐ์ดํ๊ณ , ๋ฐฐ์น๋ฅผ 50/25/25๋ก ์ชผ๊ฐ ๊ฐ์ ๊ฐ์ค์น๊ฐ ์ ์ฑ ยท์๋๋ชจ๋ธยท๊ฐ์นํจ์ ์ ์ ๋์์ ํ์ตํ๊ฒ ํ๋ค. ํ ์คํธ ์์ world model์ด ์์ํ ๋ฏธ๋ ์ํ์ ๊ฐ์น๋ก best-of-N ํ์์ ๋๋ฆฐ๋ค.
- ๐ฏ LIBERO 98.5%, RoboCasa 67.1%(ํ์คํฌ๋น 50 ๋ฐ๋ชจ๋ง ์ฌ์ฉ)๋ก SOTA, ์ค์ธ๊ณ ALOHA 4๊ฐ bimanual ํ์คํฌ ํ๊ท ์ ์ 93.6์ผ๋ก \pi_{0.5}(88.6)ยทOpenVLA-OFT+(62.0)๋ฅผ ์์ฐ๊ณ , ์ด๋ ค์ด ๋ ํ์คํฌ์ model-based planning์ ๋ถ์ด๋ฉด 59.5 โ 72.0์ผ๋ก +12.5์ .
๐ Ping Review
๐ Ping โ A light tap on the surface. Get the gist in seconds.
VLA(vision-language-action) ๋ชจ๋ธ์ ๋๋ถ๋ถ ์ ์ ์ด๋ฏธ์ง-ํ ์คํธ ์์ผ๋ก ํ์ต๋ VLM์ ๋ฐฑ๋ณธ์ผ๋ก ์ด๋ค. ๋ฐ๋ฉด ๋น๋์ค ์์ฑ ๋ชจ๋ธ์ ์๋ฐฑ๋ง ๊ฐ์ ์์์์ ์๊ฐ์ ์ธ๊ณผ์ฑยท์๋ฌต์ ๋ฌผ๋ฆฌยท์ด๋ ํจํด์ ๋ฐฐ์ด๋ค โ ๋ก๋ด ์ ์ด์ ๋ ์ด์ธ๋ฆฌ๋ prior์ฒ๋ผ ๋ณด์ธ๋ค. ๋ฌธ์ ๋ ์ง๊ธ๊น์ง ๋น๋์ค ๋ชจ๋ธ์ ์ ์ฑ ์ผ๋ก ์ฐ๋ ค๋ ์๋๋ค์ด ํ๋๊ฐ์ด ๋ณต์กํ๋ค๋ ์ ์ด๋ค: ๋น๋์ค fine-tuning ํ ๋ณ๋ action module์ ํ์ตํ๋ 2๋จ๊ณ ํ์ดํ๋ผ์ธ์ด๊ฑฐ๋(Video Prediction Policy, VidAR ๊ณ์ด), ๋ณ๋์ action diffuserยทinverse dynamics model ๊ฐ์ ์ ๊ตฌ์กฐ๋ฅผ ๋ถ์ฌ์ผ ํ๋ค. ๋ฐ๋๋ก ํตํฉ video-action ๋ชจ๋ธ(UVA, UWM)์ ์ปค์คํ ์ค๊ณ ํ์ ์ฌ์ ํ์ต๋ ๋น๋์ค ๋ชจ๋ธ์ prior๋ฅผ ์์ ๋ชป ์ด๋ค.
Cosmos Policy์ ์ฃผ์ฅ์ ๋จ์ํ๋ค. ์๋ฌด๊ฒ๋ ๋ถ์ด์ง ๋ง๋ผ. ๋น๋์ค ๋ชจ๋ธ์ ์ด๋ฏธ ๊ณ ์ฐจ์ยท๋ฉํฐ๋ชจ๋ฌ ๋ถํฌ๋ฅผ ๋ชจ๋ธ๋งํ๋ ๊ฐ๋ ฅํ ํ์ต ์๊ณ ๋ฆฌ์ฆ(latent diffusion)์ ๊ฐ๊ณ ์์ผ๋, ์ก์ ๋ ๊ทธ ์๊ณ ๋ฆฌ์ฆ์ด ๋ค๋ฃจ๋ latent frame ์ค ํ๋๋ก ๋ง๋ค์ด ๋ฒ๋ฆฌ๋ฉด ๋๋ค. ๋ก๋ด proprioceptionยทaction chunkยทstate value๋ฅผ ๊ฐ๊ฐ [-1,+1]๋ก ์ ๊ทํํ ๋ค latent volume ํฌ๊ธฐ์ ๋ง๊ฒ ๋ณต์ (duplicate) ํด์ ์ฑ์ ๋ฃ๊ณ , ๊ทธ latent frame๋ค์ ์ด๋ฏธ์ง latent frame ์ฌ์ด์ ๋ผ์ ๋ฃ๋๋ค. ๊ทธ๋ฌ๋ฉด โ์ก์ ์์ฑโ์ ๊ทธ๋ฅ โ๋ช๋ช latent frame์ denoiseํ๋ ์ผโ์ด ๋๋ค.

๊ฐ์(Fig. 1) โ Cosmos-Predict2-2B์์ fine-tune๋ Cosmos Policy. ๋ฉํฐ๋ทฐ ์นด๋ฉ๋ผยท์ธ์ดยทproprioception์ ์ ๋ ฅ๋ฐ์ (1) action chunk, (2) ๋ฏธ๋ ์ํ(proprio + ์ด๋ฏธ์ง), (3) value(๋ฏธ๋ ์ํ์ rewards-to-go)๋ฅผ ์์ธกํ๋ค. ๋ฒ ์ด์ค ๋น๋์ค ๋ชจ๋ธ์ ๊ตฌ์กฐ ๋ณ๊ฒฝ์ ์ ํ ์๋ค.
ํ๋ก์ ํธ ํ์ด์ง ๊ณต๊ฐ ์์ โ ALOHAยทLIBEROยทRoboCasa ๋กค์์ ๋ฐ๋ชจ.
ํต์ฌ ๋ฐฉ๋ฒ๋ก :
๋ฒ ์ด์ค ๋ชจ๋ธ Cosmos-Predict2-2B-Video2World๋ Wan2.1 ์๊ณต๊ฐ VAE ํ ํฌ๋์ด์ ์์์ ๋์ํ๋ latent video diffusion model์ด๊ณ , EDM denoising score matching์ผ๋ก ํ์ต๋๋ค. ๋ ธ์ด์ฆ ๋ ๋ฒจ \sigma์์ denoiser D_\theta์ ํ์ต ๋ชฉ์ ์
\mathcal{L}(D_{\theta},\sigma)=\mathbb{E}_{\mathbf{x}_{0},\mathbf{c},\mathbf{n}}\left[\left\|D_{\theta}(\mathbf{x}_{0}+\mathbf{n};\sigma,\mathbf{c})-\mathbf{x}_{0}\right\|_{2}^{2}\right]
๋ก, \mathbf{x}_0๋ VAE๋ก ์ธ์ฝ๋ฉ๋ ๊นจ๋ํ ์ด๋ฏธ์ง ์ํ์ค, \mathbf{c}๋ T5-XXL๋ก ์ธ์ฝ๋ฉ๋ ํ ์คํธ, \mathbf{n}\sim\mathcal{N}(\mathbf{0},\sigma^2\mathbf{I})๋ค. ํ ํฌ๋์ด์ ๋ (1+T)\times H\times W\times 3 ๋น๋์ค๋ฅผ (1+T')\times H'\times W'\times 16 latent๋ก ์์ถํ๋ค(T'=T/4, H'=H/8, W'=W/8). Cosmos Policy๋ ์ด ์์ ํ ๊ธ์๋ ๋ฐ๊พธ์ง ์๋๋ค. ๋ฐ๊พธ๋ ๊ฒ์ \mathbf{x}_0๊ฐ ๋ฌด์์ ๋ด๋๋๋ฟ์ด๋ค.
3์ธ์นญ ์นด๋ฉ๋ผ 2๋ + ์๋ชฉ ์นด๋ฉ๋ผ 1๋ ๊ตฌ์ฑ์ด๋ฉด latent ์ํ์ค๋ 11๊ฐ ํ๋ ์์ด ๋๋ค: (1) blank placeholder, (2) ํ์ฌ proprio, (3~5) ํ์ฌ ์๋ชฉยท3์ธ์นญ1ยท3์ธ์นญ2 ์ด๋ฏธ์ง, (6) action chunk, (7) ๋ฏธ๋ proprio, (8~10) ๋ฏธ๋ ์ด๋ฏธ์ง 3์ฅ, (11) ๋ฏธ๋ ์ํ value. ์ด ์์ ์์ฒด๊ฐ (s, a, s', V(s'))๋ฅผ ํํํ๊ณ , ์ผ์ชฝโ์ค๋ฅธ์ชฝ autoregressive ๋์ฝ๋ฉ์ ๊ฐ๋ฅํ๊ฒ ํ๋ค.
ํ์ต์ ๋ฐฐ์น๋ฅผ ์ชผ๊ฐ ์ธ ํจ์๋ฅผ ๋์์ ์ต์ ํํ๋ค(์กฐ๊ฑด๋ถ์ ํ๊น์ ์ด๋์ ๋๋๋๊ฐ ๊ณง ์ด๋ค ํจ์๋ฅผ ํ์ตํ๋๋๋ค):
\underbrace{p(a,s',V(s')\mid s)}_{\text{policy, 50\%}}\quad \underbrace{p(s',V(s')\mid s,a)}_{\text{world model, 25\%}}\quad \underbrace{p(V(s')\mid s,a,s')}_{\text{value, 25\%}}
sparse reward ์ค์ ์ด๋ฏ๋ก R(s_t,a_t)=0 for t<H, ์ข ๋จ ๋ณด์ R(s_H,a_H)\in[0,1]์ด๊ณ , ๊ฐ์น ๋ผ๋ฒจ์ Monte Carlo return \gamma^{H-t}R(s_H,a_H)๋ฅผ ๊ทธ๋๋ก ์ด๋ค.
์ฃผ์ ๊ฒฐ๊ณผ:
- LIBERO 4๊ฐ suite ํ๊ท 98.5% (suite๋น 500 trial ร 3 seed = 6000 trial). CogVLA 97.4%, OpenVLA-OFT 97.1%, \pi_{0.5} 96.9%๋ฅผ ์ํ. LIBERO-Object๋ 100.0%.
- RoboCasa 24๊ฐ ์ฃผ๋ฐฉ ํ์คํฌ ํ๊ท 67.1% (3600 trial). ๊ทธ๋ฐ๋ฐ ํ์ต ๋ฐ์ดํฐ๋ ํ์คํฌ๋น ์ธ๊ฐ ๋ฐ๋ชจ 50๊ฐ๋ฟ โ ๋น๊ต ๋์ ๋๋ถ๋ถ์ 300~3000๊ฐ๋ฅผ ์ผ๋ค(FLARE 66.4%@300, GR00T-N1.5 64.1%@300, DP-VLA 57.3%@3000).
- ์ค์ธ๊ณ ALOHA 4๊ฐ bimanual ํ์คํฌ, ๋ฐฉ๋ฒ๋น 101 trial. ํ๊ท score 93.6 vs \pi_{0.5} 88.6, \pi_0 77.9, OpenVLA-OFT+ 62.0, Diffusion Policy 33.6.
- Planning: ์ด๋ ค์ด ๋ ํ์คํฌ(candies in bowl / candy in ziploc bag)์์ base 59.5 โ model-based(V(s')) 72.0 (+12.5). model-free(Q(s,a))๋ 61.3์ ๊ทธ์นจ.
- Ablation(LIBERO): auxiliary loss ์ ๊ฑฐ โ1.5์ (98.5โ97.0), ์ฌ์ ํ์ต ๊ฐ์ค์น ์์ด scratch ํ์ต โ3.9์ (โ94.6).
๊ฒฐ๋ก :
โ๋น๋์ค ๋ชจ๋ธ์ ์ ์ฑ ์ผ๋ก ์ด๋คโ๋ ์์ด๋์ด ์์ฒด๋ ์๋กญ์ง ์๋ค. ์๋ก์ด ๊ฒ์ ๊ทธ ์ผ์ ํ๊ธฐ ์ํด ์๋ฌด ๋ชจ๋๋ ๋ง๋ค์ง ์์๋ ๋๋ค๋ ์ค์ฆ์ด๋ค. ์ก์ ์ latent frame์ผ๋ก ์ทจ๊ธํ๋ ํ ์ค์ง๋ฆฌ ๊ฒฐ์ ๋ง์ผ๋ก, ๋๊ท๋ชจ action-labeled ๋ก๋ด ๋ฐ์ดํฐ๋ก ์ฌ์ ํ์ต๋ VLA๋ค์ ๊ฐ์ ๋ฐ๋ชจ ์์์ ์ด๊ธด๋ค. ๋ค์ผ๋ก ๊ฐ์ ๋ชจ๋ธ์ด world model์ด์ value function์ด ๋์ด test-time search๊น์ง ๊ณต์ง๋ก ์นํ๋ค.
๐ Ring Review
๐ Ring โ An idea that echoes. Grasp the core and its value.
ํ ์ค๋ก ์์ํ๋ฉด
์ด ๋ ผ๋ฌธ์ ํต์ฐฐ์ โ์ก์ ์ ํน๋ณํ ์ถ๋ ฅ์ด ์๋๋คโ ๋ผ๋ ๊ฒ์ด๋ค. ์ง๋ 2๋ ๊ฐ์ ๋ก๋ด ์ ์ฑ ์ฐ๊ตฌ๋ ๋์ฒด๋ก ๋ฐ๋ ๋ฐฉํฅ์ด์๋ค โ ์ฌ์ ํ์ต ๋ฐฑ๋ณธ(VLM์ด๋ ๋น๋์ค ๋ชจ๋ธ์ด๋ )์ ์ง๊ฐ์ ๋ด๋นํ๊ณ , ์ก์ ์ ๋ณ๋์ action expert / action diffuser / discrete token head๊ฐ ๋ฝ๋๋ค๋ ๋ถ์ ๊ตฌ์กฐ. Cosmos Policy๋ ์ด ๋ถ์ ์ ํด์ฒดํ๋ค. ๋น๋์ค diffusion ๋ชจ๋ธ์ด ์ด๋ฏธ โ๊ณ ์ฐจ์ยท๋ฉํฐ๋ชจ๋ฌยท์๊ฐ์ ์ผ๋ก ์ผ๊ด๋ ์ฐ์๊ฐ ์ํ์คโ๋ฅผ ์์ฑํ๋ ๊ธฐ๊ณ๋ผ๋ฉด, 14์ฐจ์ ๊ด์ ๊ฐ 50์คํ ์ง๋ฆฌ action chunk๋ ๊ทธ ๊ธฐ๊ณ์๊ฒ ๊ทธ๋ฅ ์กฐ๊ธ ์์ ํ๋ ์ ํ๋๋ค. ๊ทธ๋์ ๋ ผ๋ฌธ์ ์ก์ ์ [-1,+1]๋ก ์ ๊ทํํ๊ณ latent volume์ด ๊ฝ ์ฐฐ ๋๊น์ง ๋ณต์ ํด ๋ฃ๋, ๊ฑฐ์ ๋ฌด๋กํ ๋งํผ ๋จ์ํ ์ธ์ฝ๋ฉ์ ์ด๋ค. ๋๋ผ์ด ๊ฒ์ ์ด๊ฒ ์๋ํ๋ค๋ ์ฌ์ค์ด ์๋๋ผ, ์ ์๋ํ๋ค๋ ๊ฒ์ด๋ค โ ๊ทธ๊ฒ๋ ๋ฐฑ๋ณธ์ ๋ฐ๊พธ์ง ์๊ณ , ํ์ต ๋จ๊ณ๋ฅผ ํ๋๋ง ์ฐ๊ณ , ๊ฐ์ ๋ชจ๋ธ์ด world modelยทvalue function ์ญํ ๊น์ง ๊ฒธํ๋ฉด์.
๋ฐฐ๊ฒฝ: ๋น๋์ค ๋ชจ๋ธ์ ์ ์ฑ ์ผ๋ก ๋ง๋ค ๋ ์๊ธฐ๋ ๊ตฌ์กฐ์ ๋ถ์ฑ
๋น๋์ค ์์ฑ ๋ชจ๋ธ์ ๋ก๋ด ์ ์ฑ ์ ๋ฐฑ๋ณธ์ผ๋ก ๋งค๋ ฅ์ ์ด๋ค. VLM์ด ์ ์ ์ด๋ฏธ์ง-ํ ์คํธ์์ ์๋ฏธ ๊ฐ๋ ์ ๋ฐฐ์ฐ๋ ๋ฐ๋ฉด, ๋น๋์ค ๋ชจ๋ธ์ ํ๋ ์ ์์ธก์ ํตํด ์๊ฐ์ ์ธ๊ณผ์ฑ๊ณผ ์๋ฌต์ ๋ฌผ๋ฆฌ๋ฅผ ๋ฐฐ์ด๋ค. ๋ฌธ์ ๋ ์ธํฐํ์ด์ค๋ค. ๋น๋์ค ๋ชจ๋ธ์ ์ด๋ฏธ์ง๋ฅผ ๋ฐ์ ์ด๋ฏธ์ง๋ฅผ ๋ฑ๋๋ค. ๋ก๋ด์ proprioception์ ๋ฐ์ action์ ๋ฑ์ด์ผ ํ๊ณ , ์นด๋ฉ๋ผ๋ ์ฌ๋ฌ ๋๋ค. ์ด ๊ฐ๊ทน์ ๋ฉ์ฐ๋ ๊ธฐ์กด ๋ฐฉ์์ ๋ ๋ถ๋ฅ์ธ๋ฐ, ๋ ผ๋ฌธ์ ๋ ๋ค์ ๋ช ํํ ๋น์ฉ์ ๋งค๊ธด๋ค.
| ์ ๊ทผ | ๋ํ ์ฐ๊ตฌ | ๋น์ฉ |
|---|---|---|
| 2๋จ๊ณ: ๋น๋์ค fine-tune โ ๋ณ๋ action module | Video Prediction Policy (Hu et al. 2024), Video Policy (Liang et al. 2025), FlowVLA (Zhong et al. 2025), VidAR (Feng et al. 2025) ๋ฑ | ํ์ต ๋จ๊ณ๊ฐ ๋๊ณ , action diffuserยทinverse dynamics ๊ฐ์ ์ ๊ตฌ์กฐ๊ฐ ํ์ |
| ํตํฉ video-action ๋ชจ๋ธ | UVA (Li et al. 2025a), UWM (Zhu et al. 2025) | ์ปค์คํ ์ค๊ณ๋ผ ์ฌ์ ํ์ต๋ ๋น๋์ค ๋ชจ๋ธ์ ๋ชป ์ด๋ค โ spatiotemporal prior ์์ค |
์ธ ๋ฒ์งธ ๊ธธ์ด ์์๋ ์ด์ ๋ ๊ฐ๋จํ๋ค. ๋น๋์ค ๋ชจ๋ธ์ latent ์ํ์ค๋ โํ๋ ์โ์ด๋ผ๋ ๋จ์ผ ํ์ ๋ง ๋ฐ์๋ค์ด๋๋ก ์ค๊ณ๋ผ ์์ด์, ์ด์ง์ ์ธ ๋ชจ๋ฌ๋ฆฌํฐ๋ฅผ ๋ฃ์ ์๋ฆฌ๊ฐ ์์ด ๋ณด์๊ธฐ ๋๋ฌธ์ด๋ค. Cosmos Policy๋ ๊ทธ ์ ์ ๋ฅผ ์์ฌํ๋ค โ latent frame์ ๊ฒฐ๊ตญ H'\times W'\times C' ํ ์์ผ ๋ฟ์ด๊ณ , ๊ฑฐ๊ธฐ์ ๋ฌด์์ ์ฑ์ฐ๋ diffusion transformer๋ ์๊ดํ์ง ์๋๋ค.
๋ฐฉ๋ฒ 1: Latent Frame Injection

Latent diffusion ์ํ์ค(Fig. 2) โ ์์ค: ์๋ณธ ์ด๋ฏธ์ง๊ฐ latent frame์ผ๋ก ํ ํฌ๋์ด์ฆ๋๋ค. ๊ฐ์ด๋์ค: ์ถ๊ฐ ๋ชจ๋ฌ๋ฆฌํฐ(ํ์ฌ proprioยทaction chunkยท๋ฏธ๋ proprioยทvalue, ๋ถ์ ํ ๋๋ฆฌ)๊ฐ latent ์ํ์ค์ ์ง์ ์ฝ์ ๋๋ค. ์๋ซ์ค: ๊นจ๋ํ conditioning ๋ถ๋ถ(์ด๋ก, s)์ ์กฐ๊ฑด์ผ๋ก ๋ ธ์ด์ฆ๊ฐ ์์์ง target ๋ถ๋ถ(๋ถํ, a, s', V(s'))์ denoiseํ๋ค.
ํต์ฌ ๋ฉ์ปค๋์ฆ์ ์ธ ์ค๋ก ์์ฝ๋๋ค.
- ์๋ฆฌ ๋ง๋ค๊ธฐ. ์ ๋ชจ๋ฌ๋ฆฌํฐ๊ฐ ๋ค์ด๊ฐ ์๋ฆฌ์ blank(์ ๋ถ 0์ธ) ์ด๋ฏธ์ง๋ฅผ ๋ผ์ ๋ฃ๊ณ VAE๋ก ํ ํฌ๋์ด์ฆํ๋ค.
- ๋ฎ์ด์ฐ๊ธฐ. ๊ทธ๋ ๊ฒ ๋ง๋ค์ด์ง placeholder latent frame์ ์ ๊ทํยท๋ณต์ ๋ proprio/action/value๋ก ์์ ํ overwrite ํ๋ค.
- ๊ทธ๋ฅ ํ์ต. ์ดํ๋ ์๋ ๋น๋์ค diffusion ํ์ต๊ณผ ๋์ผ โ ๊นจ๋ํ ๋ถ๋ถ์ ์กฐ๊ฑด์ผ๋ก ๋ ธ์ด์ฆ ์์ด ๋ถ๋ถ์ ๋ณต์.
๋ณต์ ์ ๊ตฌ์ฒด์ ์ฐ์์ด ํฅ๋ฏธ๋กญ๋ค. K\times d_{act} ํํ์ action chunk๋ฅผ ์ ๊ทํ ํ flattenํ๋ฉด ๊ธธ์ด K\cdot d_{act} ๋ฒกํฐ๊ฐ ๋๋๋ฐ, ์ด๋ฅผ \frac{H'\times W'\times C'}{K\times d_{act}} ๋ฒ ๋ณต์ ํด latent volume ํ๋๋ฅผ ์ฑ์ด๋ค. ์ถ๋ก ์์ ์ญ์ผ๋ก ๋ชจ๋ ๋ณต์ ๋ณธ์ ํ๊ท ์ ์ทจํด action chunk๋ฅผ ๋ณต์ํ๋ค. value๋ ์ค์นผ๋ผ๋ผ ๋ ๊ฐ๋จํ latent volume ์ ์ฒด ํ๊ท ์ ์ทจํด [0,+1]๋ก ์ญ์ ๊ทํํ๋ค. ์ค์ํ ๋ถ์ ํจ๊ณผ: ์ด ๋ชจ๋ฌ๋ฆฌํฐ๋ค์ VAE ๋์ฝ๋ฉ์ด ์ ํ ํ์ ์๋ค โ ์ ์ด์ latent ๊ณต๊ฐ์ ์ง์ ์ฃผ์ ๋๊ธฐ ๋๋ฌธ์ด๋ค.

๊ตฌํ ์์ธ(Fig. 8) โ Fig. 2์ ์ ๋ฐํ. ๋งจ ์ blank placeholder ํ๋ ์์ VAE์ (1+T/4) ์๊ฐ ์์ถ ๋๋ฌธ์ ํ์ํ๋ค(์ฒซ ์ด๋ฏธ์ง๋ ๋จ๋ ์ธ์ฝ๋ฉ, ๋๋จธ์ง๋ 4์ฅ์ฉ ๋ฌถ์ฌ ์์ถ). ๊ทธ๋์ ๊ฐ ์ด๋ฏธ์ง๋ฅผ 4์ฅ์ฉ ๋์ผ ๋ณต์ ํด ํ timestep์ด latent frame ํ๋์ ๋์ํ๋๋ก ๋ง๋ ๋ค.
์ด blank placeholder๋ ์ฌ์ํด ๋ณด์ด์ง๋ง ์ฌํํ ๋ ๋ฐ๋์ ๊ฑธ๋ ค ๋์ด์ง ๋ถ๋ถ์ด๋ค. Wan2.1/Cosmos-Predict2 ๊ณ์ด ํ ํฌ๋์ด์ ๋ ์ฒซ ํ๋ ์๋ง ์๊ฐ ์์ถ ์์ด ์ธ์ฝ๋ฉํ๊ณ ๋๋จธ์ง๋ 4์ฅ ๋จ์๋ก ๋ฌถ๋๋ค. ๊ทธ๋์ ๋ ผ๋ฌธ์ โ ์ํ์ค ๋งจ ์์ blank ํ๋ ์ ํ๋๋ฅผ ๋ฒ๋ฆฌ๋ ์๋ฆฌ๋ก ๋๊ณ , โก ์ค์ ๋ก ์ฐ๊ณ ์ถ์ ์ด๋ฏธ์ง๋ ๋์ผํ ์ด๋ฏธ์ง 4์ฅ์ ๋ณต์ ํด ๋ฃ์ด latent frame 1๊ฐ๋ก ์์ถ๋๊ฒ ๋ง๋ ๋ค. ์ฆ Fig. 8 ์์ค์ โ4์ฅ์ฉ ๊ฒน์ณ ๋ณด์ด๋ ์ด๋ฏธ์งโ๋ 4๊ฐ timestep์ด ์๋๋ผ ํ timestep์ 4์ค ๋ณต์ฌ๋ค.
์ค๊ณ์ ๋์ฌ๊ฒจ๋ณผ ์ ์ฝ๋ ๋ช ์๋ผ ์๋ค. s์ s'๋ ๊ฐ๊ฐ ์์ t์ t+K์ ๊ด์ธก๋ง ๋ด๋๋ค โ ์ ๋ ฅ ํ์คํ ๋ฆฌ๋ฅผ ์ฐ์ง ์๊ณ , ์ฌ๋ฌ ๋ฏธ๋ ์์ ์ ์ฐ์ ์์ธกํ์ง๋ ์๋๋ค. ๋น๋์ค ๋ชจ๋ธ์ ๋ฐฑ๋ณธ์ผ๋ก ์ฐ๋ฉด์ ์ ์ ๊ธด ์๊ฐ ์ถ์ ์ฐ์ง ์๋๋ค๋ ์ ์ ์์ด๋ฌ๋ํ๋ฐ, ๊ทธ๋งํผ โ์ฌ์ ํ์ต prior๊ฐ ๋จ๋ฐ ์์ธก์๋ ๋์์ด ๋๋คโ๋ ์ฃผ์ฅ์ด๊ธฐ๋ ํ๋ค.
๋ฐฉ๋ฒ 2: ์ ์ฑ ยท์๋๋ชจ๋ธยท๊ฐ์นํจ์์ ๋์ ํ์ต

Balanced batches(Fig. 12) โ latent ์ํ์ค๋ ๊ณ ์ ๋ ์ฑ, ์ด๋๊น์ง๋ฅผ ์กฐ๊ฑด์ผ๋ก ์ฃผ๊ณ ์ด๋๋ถํฐ๋ฅผ ํ๊น์ผ๋ก ์์ฑํ๊ฒ ํ๋๋๋ง ๋ฐ๊ฟ ์ ์ฑ (50%)ยท์๋๋ชจ๋ธ(25%)ยท๊ฐ์นํจ์(25%)๋ฅผ ๊ฐ์ ๊ฐ์ค์น๋ก ํ์ตํ๋ค. rollout์ผ๋ก refineํ ๋๋ ์ ๋ ฅ ๋ง์คํน์ผ๋ก V(s') ๋๋ Q(s,a) ํํ๋ฅผ ์ ํํ ์ ์๋ค.
ํ ์ํคํ ์ฒ๊ฐ ์ธ ์ญํ ์ ํ๋ ํธ๋ฆญ์ conditioning scheme์ ์๋ค. latent ์ํ์ค [s \mid a \mid s' \mid V(s')]๋ ๊ทธ๋๋ก ๋๊ณ , ์์ชฝ ์ด๋๊น์ง๋ฅผ ๊นจ๋ํ๊ฒ(์กฐ๊ฑด) ๋๋๋๋ง ๋ฐฐ์น ์ํ๋ง๋ค ๋ฐ๊พผ๋ค. s๊น์ง๋ง ๊นจ๋ํ๋ฉด ์ ์ฑ ํ์ต, (s,a)๊น์ง ๊นจ๋ํ๋ฉด world model, (s,a,s')๊น์ง๋ฉด value function์ด๋ค. ๊ตฌ์กฐ๋ ์์คํจ์๋ ๋์ผํ๊ณ ๋ง์คํฌ๋ง ๋ค๋ฅด๋ค.
๋ฐ์ดํฐ ์ถ์ฒ๋ ๊ฐ๋ฆฐ๋ค: ๋ฐฐ์น์ 50%๋ demonstrations ๋ฐ์ดํฐ์ (์ ์ฑ ์ฉ), ๋๋จธ์ง 50%๋ rollouts ๋ฐ์ดํฐ์ (์๋๋ชจ๋ธยท๊ฐ์นํจ์์ฉ, ์ ๋ฐ์ฉ)์์ ์จ๋ค. ์ด๊ธฐ์ rollouts ๋ฐ์ดํฐ์ ์ด demonstrations์ ์์์งํฉ โ ์ฌ์ ์ ์คํจํ๋ ๋ฐ๋ชจ๊น์ง ํฌํจํ๋ค. LIBEROยทRoboCasa์์ ์ฌ๋ ์ค์๋ก ๋๋ต 10~20%์ ๋ฐ๋ชจ๊ฐ ์ฌ์ ์ ์คํจํ๋๋ฐ, ์ ์ฑ ํ์ต์์ ์ด๋ฅผ ํํฐ๋งํ์ง๋ง ์๋๋ชจ๋ธยท๊ฐ์นํจ์ ํ์ต์๋ ํํฐ ์์ด ์ ๋ถ ์ด๋ค. ์คํจ ๊ถค์ ์ด์ผ๋ง๋ก ๊ฐ์นํจ์๊ฐ ํ์๋ก ํ๋ ์ ํธ์ด๊ธฐ ๋๋ฌธ์ด๋ค. (์ค์ธ๊ณ ALOHA ๋ฐ์ดํฐ๋ ์๊ฒฉ์กฐ์์ ์กฐ์ฌํ ์์งํด ์คํจ ๋ฐ๋ชจ๊ฐ ์๊ณ , ๋ฐ๋ผ์ ๋ ๋ฐ์ดํฐ์ ์ด ๋์ผํ๋ค.)
auxiliary supervision๋ ๋ช ์์ ์ค๊ณ๋ค. ์ ์ฑ ์ p(a\mid s)๊ฐ ์๋๋ผ p(a,s',V(s')\mid s)๋ฅผ, world model์ p(s'\mid s,a)๊ฐ ์๋๋ผ p(s',V(s')\mid s,a)๋ฅผ ํ์ตํ๋ค. ์ด๊ฒ ๋จ์ ์ฅ์์ด ์๋๋ผ๋ ๊ฑด RoboCasa ablation(Table 5)์์ ๊ทน์ ์ผ๋ก ๋๋ฌ๋๋ค โ ๋ค ์คํ ์ ์ฐธ์กฐ. (๋ค๋ง โauxiliaryโ๋ผ๋ ์ด๋ฆ์ ๊ตฌํ์ ๋ณด๋ฉด ์คํด๋ฅผ ๋ถ๋ฅธ๋ค. ๊ณต๊ฐ ์ฝ๋์๋ ์ถ๊ฐ๋ ์์ค ํญ์ด ์๊ณ ์์ค ๋ง์คํฌ์์ ๊ทธ ์นธ์ ๋นผ์ง ์์์ ๋ฟ์ด๋ค โ ๋ค์ ์ฝ๋ ๋์กฐ ์ โ .)
๋ ธ์ด์ฆ ์ค์ผ์ค์ ๋ก๋ด์ฉ์ผ๋ก ๋ฐ๊พผ๋ค

๋ ธ์ด์ฆ ๋ถํฌ ๋ณ๊ฒฝ(Fig. 9) โ ์ผ์ชฝ: ๋ฒ ์ด์ค Cosmos-Predict2์ log-normal ๋ถํฌ(P_\text{mean}=1.39, P_\text{std}=1.2). ์ค๋ฅธ์ชฝ: Cosmos Policy์ hybrid log-normal-uniform ๋ถํฌ โ ํ๋ฅ 0.7๋ก ์๋ log-normal, 0.3์ผ๋ก [1.0, 85.0] ๊ท ๋ฑ ๋ถํฌ์์ ์ํํด ๊ณ -\sigma ๊ผฌ๋ฆฌ๋ฅผ ๋๋ ธ๋ค.
๋ ผ๋ฌธ์์ ๊ฐ์ฅ โ๋ก๋ด์ค๋ฌ์ดโ ๋ถ๋ถ์ด๋ค. ๋น๋์ค ์์ฑ์์ ํฝ์ ์ด ์กฐ๊ธ ํ๋ ค๋ ๋์ง๋ง, ์ก์ ์ ์์ ๋ถ์ ํ์ด ๊ณง ํ๊ตญ์ ์คํจ๋ค. ๋ฒ ์ด์ค ๋ชจ๋ธ์ log-normal ๋ ธ์ด์ฆ ๋ถํฌ๋ ๋ฎ์ \sigma์ ํ์ต ๊ฐ์ค์น๋ฅผ ๋ชฐ์์ฃผ๋๋ฐ, diffusion ์ํ๋ง์ \sigma_\text{max}=80์ ์์ ๋ ธ์ด์ฆ์์ ์์ํ๋ฏ๋ก ์ ์ ์์ฑ์ด ์์๋๋ ๊ณ -\sigma ์์ญ์ ํ์ต ์ ํธ๊ฐ ๋ถ์กฑํด ์ด๊ธฐ denoising์ด ์์ฑํด์ง๊ณ ์ค์ฐจ๊ฐ ๋์ ๋๋ค. ๊ทธ๋์ ํ์ต ์์ ๊ณ -\sigma ๊ผฌ๋ฆฌ๋ฅผ ๋๋ฆฐ ํผํฉ ๋ถํฌ๋ฅผ ์ด๋ค(์ ์๋ค์ 0.7/0.3 ๋น์จ์ ํ๋ํ์ง ์์๋ค๊ณ ๋ฐํ๋ค).
์ถ๋ก ์์ ์ ๋ฐ๋ ๋ฐฉํฅ์ ์กฐ์ ์ ํ๋ค. \sigma\approx 0 ๊ทผ์ฒ ๋ง์ง๋ง denoising ์คํ ๋ค์ด SNR์ด ๋๋ฌด ๋ฎ์ ์คํ๋ ค ๋ถ์ ํํ๋ค๋ ๊ด์ฐฐ์์, \sigma_\text{min}์ EDM ๊ธฐ๋ณธ๊ฐ 0.002๊ฐ ์๋๋ผ 4๋ก ์ฌ๋ฆฐ๋ค(\sigma_\text{max}=80์ ์ ์ง). ํ๋จ ๊ทผ๊ฑฐ๋ ํ์ตยท๊ฒ์ฆ ์ํ์์์ L1 loss ๊ฐ์๋ค. ์ฌํํ๋ ์ ์ฅ์์ ์ด ๋ ๊ฐ์ด โ๊ธฐ๋ณธ๊ฐ์ ๊ทธ๋๋ก ์ฐ๋ฉด ์ ๋๋โ ๋ํ์ ํจ์ ์ด๋ค.
๋ฐฉ๋ฒ 3: World model๋ก ์์ํ๊ณ value๋ก ๊ณ ๋ฅด๊ธฐ

์๋๋ชจ๋ธ ์์ธก ๋น๊ต(Fig. 6) โ ์: ๋ฐ๋ชจ๋ง์ผ๋ก ํ์ต๋ base Cosmos Policy์ ์๋๋ชจ๋ธ์ โ์งํผ๋ฐฑ ์ฌ๋ผ์ด๋๋ฅผ ๋์น๋โ ์คํจ๋ฅผ ์์ธกํ์ง ๋ชปํ๋ค. ์๋: policy rollout ๋ฐ์ดํฐ๋ก fine-tuneํ ๋ค์๋ ๊ฒฐ๊ณผ ์ํ๋ฅผ ๋ ์ ํํ ์์ธกํด planning์ด ์ค์ ๋ก ์๋ํ๋ค.
planning ํํธ์ ํต์ฌ ๋ ผ์ง๋ โ๋ฐ๋ชจ๋ง์ผ๋ก๋ world model์ ๋ง๋ค ์ ์๋คโ ์ด๋ค. ๋ฐ๋ชจ ๋ฐ์ดํฐ๋ ์ฑ๊ณต ๊ถค์ ๋ง ๋ด๊ณ ์์ด์, world model๊ณผ value function์ด ๋ณด๋ state-action ๋ถํฌ๊ฐ ์ง๋์น๊ฒ ์ข๋ค. ๊ทธ๋์ ์ ์ฑ ์ ์ค์ ๋ก ๊ตด๋ ค rollout์ ๋ชจ์ผ๊ณ (์ฑ๊ณต/์คํจ ๋๋ ๋ถ๋ถ ์ ์๊น์ง ๊ธฐ๋ก), ๊ทธ ๋ฐ์ดํฐ๋ก ์ฒดํฌํฌ์ธํธ๋ฅผ ์๋๋ชจ๋ธยท๊ฐ์นํจ์ ์ชฝ์ 90% ๊ฐ์ค์น๋ฅผ ๋๊ณ (์ ์ฑ ์ 10%) ์ถ๊ฐ fine-tuneํ๋ค.
์ฌ๊ธฐ์ ๋์ค๋ ์ค๊ณ๊ฐ dual deployment๋ค: ์๋ ์ฒดํฌํฌ์ธํธ๊ฐ โpolicy modelโ๋ก ์ก์ ์ ์ ์ํ๊ณ , refine๋ ์ฒดํฌํฌ์ธํธ๊ฐ โplanning modelโ๋ก ๋ฏธ๋์ ๊ฐ์น๋ฅผ ์์ธกํ๋ค. ์ด์ ๋ on-policy ์ ํฉ์ฑ โ refine๋ ์๋๋ชจ๋ธ์ ์๋ ์ ์ฑ ์ด ๋ง๋ ๋ฐ์ดํฐ๋ก ํ์ต๋์ผ๋, ๊ทธ ์ ์ฑ ์ ์ ์์ ํ๊ฐํ ๋ ๊ฐ์ฅ ์ ํํ๋ค.
ํ์ ์์ฒด๋ best-of-N์ด๋ค: โ ์ ์ฑ ์์ N๊ฐ action ํ๋ณด ์ํ๋ง โ โก planning model๋ก ๊ฐ ํ๋ณด์ ๋ฏธ๋ ์ํ์ ๊ฐ์น ์์ธก โ โข ์ต๊ณ ๊ฐ์น ํ๋ณด ์คํ. ์์ธก ๋ ธ์ด์ฆ์ ๋ํ ๋ฐฉ์ด๋ก ์ก์ ๋น world model 3ํ ร ๋ฏธ๋ ์ํ๋น value 5ํ = ํ๋ณด๋น 15๊ฐ ๊ฐ์น ์์ธก์ ์์๋ธํ๊ณ , ๋จ์ ํ๊ท ๋์ โmajority meanโ ์ผ๋ก ์ง๊ณํ๋ค โ ๊ณ ์ ์๊ณ๋ก ์ฑ๊ณต/์คํจ ๋ค์ํ๋ฅผ ๊ฐ๋ฅธ ๋ค ๊ทธ ๋ค์ํ ์์์๋ง ํ๊ท . ๊ฐ์น ์์ธก์ด bimodalํ๊ฑฐ๋ ๋ถ์ฐ์ด ํด ๋ naive average๋ณด๋ค ์ด์์น์ ๊ฐํ๋ค๋ ๋ ผ๋ฆฌ๋ค.
๊ทธ๋ฆฌ๊ณ ์ฌ๊ธฐ์ ๊ฐ์นํจ์์ ํํ๋ฅผ ๋ง์คํน์ผ๋ก ๊ณ ๋ฅผ ์ ์๋ค๋ ๊ฒ latent injection ์ค๊ณ์ ์์ ๊ท๊ฒฐ์ด๋ค. (s,a)๋ฅผ ๋ง์คํฌ์์ํ๋ฉด V(s')(์๋๋ชจ๋ธ ํ์, model-based), s'๋ฅผ ๋ง์คํฌ์์ํ๋ฉด Q(s,a)(์๋๋ชจ๋ธ ๋ถํ์, model-free). ๊ฐ์ ์ฒดํฌํฌ์ธํธยท๊ฐ์ ํ์ต ์ฝ๋์์ ๋ ํจ๋ฌ๋ค์์ ๋น๊ตํ ์ ์๋ค.
์ง๊ด: ์ โ๋ณต์ ํด์ ์ฑ์ฐ๊ธฐโ๊ฐ ํตํ๋๊ฐ
์ก์ 14ร50 = 700๊ฐ ์ซ์๋ฅผ H'\times W'\times 16์ง๋ฆฌ ํ ์์ ์์ญ ๋ฒ ๋ณต์ ํด ๋ฃ๋๋ค๋ ๊ฒ์, ์ ๋ณด์ด๋ก ์ ์ผ๋ก๋ ๊ทน๋จ์ ์ธ ์ค๋ณต ๋ถํธํ(repetition code) ๋ค. ์ด๊ฒ ์ ์ ๋ฆฌํ๊ฐ.
- ์ถ๋ก ์ ํ๊ท ์ด ๋ ธ์ด์ฆ๋ฅผ ์ค์ธ๋ค. diffusion ์ํ๋ง ๊ฒฐ๊ณผ๋ ํ๋ฅ ์ ์ธ๋ฐ, ๊ฐ์ ๊ฐ์ R๋ฒ ๋ณต์ ํด ๋๋ฉด ๋ณต์ ์ R๊ฐ ์ถ์ ์น์ ํ๊ท ์ ์ฐ๊ฒ ๋์ด ๋ถ์ฐ์ด ์ค์ด๋ ๋ค. ์ก์ ์ ๋ฐ๋๊ฐ ๊ณง ์ฑ๊ณต๋ฅ ์ธ ๋๋ฉ์ธ์์ ์ด๊ฑด ๊ณต์ง ์ด๋์ด๋ค.
- ์ฌ์ ํ์ต๋ ๊ฐ์ค์น๊ฐ โ๋ฏ์ ์ ๋ ฅโ์ ๋ง๋์ง ์๋๋ค. ๋ง์ฝ ์ก์ ์ latent frame์ ํ ๊ทํ์ด์๋ง ๋ฃ๊ณ ๋๋จธ์ง๋ฅผ 0์ผ๋ก ๋๋ฉด, DiT ์ ์ฅ์์ ํต๊ณ์ ์ผ๋ก ์ ํ ๋ณธ ์ ์๋ sparseํ ํ ์๊ฐ ๋๋ค. ๋ณต์ ๋ก ๊ฝ ์ฑ์ด ํ ์๋ (Fig. 2์์ ๋ณด์ด๋ฏ) ๊ท์น์ ์ค๋ฌด๋ฌ ํจํด โ ํ ์ค์ฒ๋ฅผ ๋ฎ์, ๋น๋์ค ๋ชจ๋ธ์ด ๋ค๋ฃฐ ์ค ์๋ ์ข ๋ฅ์ ์ ํธ๋ค.
- ๋ชจ๋ฌ๋ฆฌํฐ ๊ฐ ์ธํฐํ์ด์ค๊ฐ ๊ท ์ผํด์ง๋ค. ์ด๋ฏธ์ง๋ ์ก์ ์ด๋ value๋ ์ ๋ถ โlatent frame 1๊ฐโ๋ผ์, ์ํ์ค ์์๋ฅผ ๋ฐ๊พธ๋ ๊ฒ๋ง์ผ๋ก ์กฐ๊ฑด๋ถ ๊ตฌ์กฐ๋ฅผ ์ฌ๊ตฌ์ฑํ ์ ์๋ค. Fig. 12์ ๋ง์คํน ํธ๋ฆญ๋, V/Q ์ ํ๋ ์ฌ๊ธฐ์ ๋์จ๋ค.
1๋ฒ์ ๋จ์ํ ํด์์ด ์๋๋ผ ์ฝ๋์ ๊ทธ๋๋ก ๋ฐํ ์๋ค. ๊ณต๊ฐ ๊ตฌํ์ ์ก์
๋ณต์์ ๋ณต์ ๋ณธ ์ฐจ์์ ๋ฐ๋ผ ํ๊ท ์ ์ทจํ๋ ํ ์ค์ด๋ค(cosmos_policy/experiments/robot/cosmos_utils.py, final_action_chunk = torch.mean(all_action_chunks, dim=1), 2026-09-27 ๋ ํฌ ์ง๋
). ์ฆ ํ ๋ฒ์ ๋๋
ธ์ด์ง์ผ๋ก ์ฌ์ค์ ์์ญ ๋ฒ์ ์์๋ธ์ ๊ณต์ง๋ก ์ป๋ ๊ตฌ์กฐ๋ค โ ๋
ผ๋ฌธ ๋ณธ๋ฌธ์ด โํ๊ท ์ ์ทจํด ์ถ์ถํ๋คโ๊ณ ๋ง ์ ๊ณ ๊ทธ ํต๊ณ์ ์ด๋์ ์ฃผ์ฅํ์ง ์๋๋ฐ, ์ ๋ฐ๋๊ฐ ์ฑ๊ณต๋ฅ ์ ์ข์ฐํ๋ ํ์คํฌ(์งํผ๋ฐฑ 86.0์ )์์ ์ค์ ๋ก ๊ธฐ์ฌํ์ ๊ฐ๋ฅ์ฑ์ด ๋๋ค.
๋ฐ๋๋ก ๋น์ฉ๋ ๋ถ๋ช ํ๋ค. latent volume ํ๋๋ฅผ ์ค์นผ๋ผ value ํ๋์ ํต์งธ๋ก ์ฐ๋ ๊ฒ์ ๊ณ์ฐ์ ๋ญ๋น๋ค. ๋ค๋ง ์๋ ์ชฝ์๋ ์ญ์ผ๋ก ์ด๋์ด ์๋ค: ์ก์ ยทproprioยทvalue๋ ์ ์ด์ latent ๊ณต๊ฐ์ ์ฃผ์ ๋์ผ๋ฏ๋ก ์ถ์ถ์ VAE ๋์ฝ๋ฉ์ด ์ ํ ํ์ ์๋ค. ์ง์ ์ ์ฑ ์ผ๋ก ์ธ ๋๋ ๋ฏธ๋ ์ด๋ฏธ์ง ์์ธก์ ๊ทธ๋ฅ ๋ฒ๋ฆฌ๋ฉด ๋๋ฏ๋ก, 2B ๋น๋์ค ๋ชจ๋ธ์ ์ฐ๋ฉด์๋ 1-step denoising์์ 0.16์ด๊ฐ ๋์ค๋ ๊ทผ๊ฑฐ๊ฐ ์ฌ๊ธฐ์ ์๋ค.
์คํ
์ ์

์ค์ธ๊ณ ALOHA ํ์คํฌ(Fig. 3) โ ์ฅ๊ธฐ horizonยท๊ณ ์ ๋ฐยท๋์ action multimodality๋ฅผ ์๊ตฌํ๋ 4๊ฐ bimanual ํ์คํฌ์ ์ฑ๊ณต ๋กค์์.
| ๋๋ฉ์ธ | ๋ก๋ด/ํ๊ฒฝ | ํ์ต ๋ฐ์ดํฐ | ํ๊ฐ ๊ท๋ชจ |
|---|---|---|---|
| LIBERO | Franka Panda, 4๊ฐ suite | suite๋น 500 ๋ฐ๋ชจ (10 ํ์คํฌ ร 50) | suite๋น 500 trial ร 3 seed = 6000 trial |
| RoboCasa | Franka Panda, 24๊ฐ ์ฃผ๋ฐฉ ํ์คํฌ | ํ์คํฌ๋น ์ธ๊ฐ ๋ฐ๋ชจ 50๊ฐ๋ง (MimicGen 1000๊ฐ ๋ฏธ์ฌ์ฉ) | ํ์คํฌ๋น 50 trial ร 3 seed = 3600 trial |
| ALOHA (์ค์ธ๊ณ) | ViperX 300 S ร2, ์นด๋ฉ๋ผ 3๋(์๋จ 1 + ์๋ชฉ 2), 25 Hz | 4๊ฐ ํ์คํฌ ํฉ์ณ 185 ๋ฐ๋ชจ (80/15/45/45) | ๋ฐฉ๋ฒ๋น 101 trial (30/20/25/26) |
ALOHA ์ชฝ ์ ์ ์์ ๋์ ๋๋ ์ ํ๋ค: ์ ์ด ์ฃผํ์๋ฅผ 50 Hz โ 25 Hz๋ก ๋ฎ์ท๊ณ (๊ณ์ฐ ํจ์จ), ๋ชจ๋ ์ ์ฑ ์ด 50 ์คํ (2์ด) action chunk๋ฅผ ์์ธกํด ์ ๋ ์คํ ํ ์ฌ์ง์ํ๋ค(receding horizon ์๋). Diffusion Policy๋ง ๊ตฌํ ์ ์ฝ์ผ๋ก 48์คํ . ๊ทธ๋ฆฌ๊ณ ํ์คํฌ๋ณ ๊ฐ๋ณ ์ ์ฑ ์ด ์๋๋ผ 4๊ฐ ํ์คํฌ ํตํฉ ๋จ์ผ ์ ์ฑ ์ ํ์ตํ๋ค.
ํ์ต ์กฐ๊ฑด๋ ๋ถ๋ก์ ๊ผผ๊ผผํ ์ ํ ์๋ค(Appendix A.2). ์ธ ๋๋ฉ์ธ ๋ชจ๋ ๋ฒ ์ด์ค ๋ชจ๋ธ์ full fine-tuning(์ ๊ฐ์ค์น)ํ๋ค.
| ๋๋ฉ์ธ | GPU | Global batch | Gradient steps | ์๊ฐ | Action chunk (์คํ) | ์ต์ข action L1 |
|---|---|---|---|---|---|---|
| LIBERO | 64ร H100 | 1920 | 40K | 48h | 16 (์ ๋) | 0.012 |
| RoboCasa | 32ร H100 | 800 | 45K | 48h | 32 (16์คํ ๋ง ์คํ) | 0.016 |
| ALOHA | 8ร H100 | 200 | 50K | 48h | 50 (์ ๋) | 0.010 |
ALOHA ๋น๊ต๊ตฐ์๋ ๋์ผ wall-clock ์์ฐ(8รH100 48์๊ฐ)์ ์คฌ๋๋ฐ, ํ๋ ์์ํฌ ์๋ ์ฐจ์ด ํ์ ์ค์ gradient step ์๋ ํฌ๊ฒ ๊ฐ๋ ธ๋ค: \pi_{0.5}ยท\pi_0 400K(batch 256), OpenVLA-OFT+ 32K(batch 96, grad accum 4). Diffusion Policy๋ ์ฝ 150M ํ๋ผ๋ฏธํฐ๋ก ํจ์ฌ ์์ H100 1์ฅ์์ 48์๊ฐ(190 epoch โ 72K step, batch 350) ํ์ตํ๋ค.
ํ๊ฐ ์งํ๋ ์ฑ๊ณต๋ฅ ์ด ์๋๋ผ score(0~100, ํ์คํฌ ์๋ฃ ๋น์จ) ๋ค. ์์ปจ๋ โfold shirtโ๋ 10๋จ๊ณ ๊ฐ 10์ ์ ์ ํ์ด ์์ ธ๋์ค๋ฉด โ10์ , โput candies in bowlโ์ ์ฌํ 5๊ฐ ๊ฐ 20์ . ์ด์ง ์ฑ๊ณต๋ฅ ์ด ๋์น๋ ๋ถ๋ถ ์ง์ฒ์ ์ก์ผ๋ ค๋ ๊ฒ์ธ๋ฐ, ๋ ผ๋ฌธ ์๋ก ์ด ์ด 93.6์ โhighest average success rate (93.6%)โ๋ผ ๋ถ๋ฅด๋ ๊ฒ์ Fig. 4ยทTable 3์ โAverage Scoreโ์ ์ฉ์ด๊ฐ ์ด๊ธ๋๋ค โ ์ฌ์ํ์ง๋ง ์ธ์ฉํ ๋ ์ฃผ์ํ ์ง์ ์ด๋ค.
Q1: ์ง์ ์ ์ฑ ์ผ๋ก์์ ์ฑ๋ฅ
LIBERO (Table 1) โ Cosmos Policy๋ LIBERO-Long์์ ํนํ ๋ฒ์ด์ง๋ค(97.6 vs CogVLA 95.4, OpenVLA-OFT 94.5).
| Method | Spatial | Object | Goal | Long | Average |
|---|---|---|---|---|---|
| Diffusion Policy | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| Dita | 97.4 | 94.8 | 93.2 | 83.6 | 92.3 |
| \pi_0 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| UVA | โ | โ | โ | 90.0 | โ |
| UniVLA | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
| \pi_{0.5} | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| Video Policy | โ | โ | โ | 94.0 | โ |
| OpenVLA-OFT | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 |
| CogVLA | 98.6 | 98.8 | 96.6 | 95.4 | 97.4 |
| Cosmos Policy (ours) | 98.1 | 100.0 | 98.2 | 97.6 | 98.5 |
RoboCasa (Table 2) โ ์ฌ๊ธฐ์ ์ง์ง ์ฃผ์ฅ์ ์ ๋ ์์น๊ฐ ์๋๋ผ ๋ฐ์ดํฐ ํจ์จ์ด๋ค. 50 ๋ฐ๋ชจ๋ก 300~3000 ๋ฐ๋ชจ ๊ธฐ๋ฐ ๋ฐฉ๋ฒ๋ค์ ๋๋๋ค.
| Method | ํ์คํฌ๋น ํ์ต ๋ฐ๋ชจ | Average SR (%) |
|---|---|---|
| GR00T-N1 | 300 | 49.6 |
| UVA | 50 | 50.0 |
| DP-VLA | 3000 | 57.3 |
| GR00T-N1 + DreamGen | 300 (+10000 ํฉ์ฑ) | 57.6 |
| GR00T-N1 + DUST | 300 | 58.5 |
| UWM | 1000 | 60.8 |
| \pi_0 | 300 | 62.5 |
| GR00T-N1.5 | 300 | 64.1 |
| Video Policy | 300 | 66.0 |
| FLARE | 300 | 66.4 |
| GR00T-N1.5 + HAMLET | 300 | 66.4 |
| Cosmos Policy (ours) | 50 | 67.1 |
์ค์ธ๊ณ ALOHA (Fig. 4 / Table 3) โ in-distribution๊ณผ OOD๋ฅผ ๋๋ ๋ณด๋ฉด ๊ทธ๋ฆผ์ด ํจ์ฌ ํฅ๋ฏธ๋ก์์ง๋ค.

ALOHA ํ๊ฐ ๊ฒฐ๊ณผ(Fig. 4) โ ํ์คํฌ๋ณ score์ ํ๊ท . Cosmos Policy๊ฐ ์ ์ฒด ํ๊ท 93.6์ผ๋ก ์ต๊ณ ์ด์ง๋ง, 4๊ฐ ์ค 3๊ฐ ํ์คํฌ์์๋ง 1์๋ค(โput candies in bowlโ์ \pi_{0.5} 95.2๊ฐ ์์ ๋ค).
| Method | put X on plate | fold shirt | candies in bowl | candy in ziploc | Average |
|---|---|---|---|---|---|
| In-distribution | |||||
| Diffusion Policy | 85.0 | 23.3 | 37.3 | 11.0 | 39.2 |
| OpenVLA-OFT+ | 87.5 | 99.2 | 22.7 | 59.0 | 67.1 |
| \pi_0 | 97.5 | 98.3 | 73.3 | 56.0 | 81.3 |
| \pi_{0.5} | 97.5 | 99.2 | 98.7 | 56.0 | 87.8 |
| Cosmos Policy | 100.0 | 99.2 | 100.0 | 86.0 | 96.3 |
| OOD | |||||
| Diffusion Policy | 20.0 | 23.8 | 26.0 | 26.7 | 24.1 |
| OpenVLA-OFT+ | 30.0 | 100.0 | 20.0 | 56.7 | 51.7 |
| \pi_0 | 60.0 | 98.8 | 68.0 | 60.0 | 71.7 |
| \pi_{0.5} | 100.0 | 100.0 | 90.0 | 80.0 | 92.5 |
| Cosmos Policy | 100.0 | 100.0 | 74.0 | 83.3 | 89.3 |
| Full (ID + OOD) | |||||
| Diffusion Policy | 63.3 | 23.5 | 32.8 | 14.6 | 33.6 |
| OpenVLA-OFT+ | 68.3 | 99.5 | 21.6 | 58.5 | 62.0 |
| \pi_0 | 85.0 | 98.5 | 71.2 | 56.9 | 77.9 |
| \pi_{0.5} | 98.3 | 99.5 | 95.2 | 61.5 | 88.6 |
| Cosmos Policy | 100.0 | 99.5 | 89.6 | 85.4 | 93.6 |
์ฌ๊ธฐ์ ๋ ผ๋ฌธ ์ค์ค๋ก ์ธ์ ํ๋ ๋ฐ์ ์ด ์๋ค: OOD ์กฐ๊ฑด๋ง ๋ณด๋ฉด \pi_{0.5}(92.5)๊ฐ Cosmos Policy(89.3)๋ณด๋ค ๋ซ๋ค. ๋๊ท๋ชจ ๋ก๋ด ๋ฐ์ดํฐ + ์น ๋ฐ์ดํฐ๋ก ์ฌ์ ํ์ตํ VLA์ ์ผ๋ฐํ ์ฐ์๊ฐ ๋จ์ ์๋ค๋ ๋ป์ด๊ณ , Cosmos Policy์ ์ฐ์๋ ์ฃผ๋ก in-distribution ์ ๋ฐ๋(96.3 vs 87.8)์์ ์จ๋ค. ๋ฆฌ๋ทฐ์ด ์ ์ฅ์์ ์ด ๊ตฌ๋ถ์ด ์ด๋ก์ โhighest average scoreโ๋ณด๋ค ํจ์ฌ ์ ์ฉํ ์ ๋ณด๋ค.

๋ฒ ์ด์ค๋ผ์ธ ์คํจ ๋ชจ๋(Fig. 5) โ ์ผ์ชฝ: \pi_{0.5}๋ ์งํผ๋ฐฑ ์ฌ๋ผ์ด๋์ ๊ณ ์ ๋ฐ ํ์ง์ ์คํจํด ๋์น๋ค. ์ค๋ฅธ์ชฝ: OpenVLA-OFT+๋ ์ฌํ ํ๋๋ฅผ ํฅํ์ง ์๊ณ ๋ ์ฌํ ์ฌ์ด๋ก ์์ ๋ป๋๋ค โ L1 ํ๊ท๊ฐ ๋ฉํฐ๋ชจ๋ฌ action ๋ถํฌ๋ฅผ ํ๊ท ๋ด๋ฒ๋ฆฐ ์ ํ์ ์ฆ์.
Fig. 5์ ์ค๋ฅธ์ชฝ์ ์ด ๋ ผ๋ฌธ์ด โ์ diffusion ๊ธฐ๋ฐ ์์ฑ์ด์ด์ผ ํ๋๊ฐโ๋ฅผ ๋ณด์ฌ์ฃผ๋ ๊ฐ์ฅ ์ค๋๋ ฅ ์๋ ๊ทธ๋ฆผ์ด๋ค. OpenVLA-OFT+๋ ์ก์ ์ L1 ํ๊ท๋ก ์์ธกํ๋๋ฐ(๊ด๋ จ ๋ฆฌ๋ทฐ: OpenVLA-OFT), ์ผ์ชฝ ์ฌํ๊ณผ ์ค๋ฅธ์ชฝ ์ฌํ์ด ๋ชจ๋ ์ ํจํ ์ ํ์ธ ์ํฉ์์ ํ๊ท๋ ๋ ๋ชจ๋์ ํ๊ท , ์ฆ ์ฌํ ์ฌ์ด ๋น ๊ณต๊ฐ์ผ๋ก ์๋ ดํ๋ค. โput candies in bowlโ์์ OpenVLA-OFT+๊ฐ 21.6์ ์ ๊ทธ์น ๊ฒ์ด ์ด ํ ์ฅ์ ์ค๋ช ๋๋ค.
Q2: ๋ฌด์์ด ์ฑ๋ฅ์ ๋ง๋๋๊ฐ (ablation)
LIBERO (Table 4)
| Variant | Spatial | Object | Goal | Long | Average |
|---|---|---|---|---|---|
| Cosmos Policy (ours) | 98.1 | 100.0 | 98.2 | 97.6 | 98.5 |
| (1) w/o auxiliary losses | 97.6 | 99.8 | 96.7 | 94.0 | 97.0 (โ1.5) |
| (2) w/o pretrained model (scratch) | 94.7 | 98.9 | 96.3 | 88.6 | 94.6 (โ3.9) |
์ค์ธ๊ณ์์์ scratch ๊ฒ์ฆ์ ๋ ๊ฐํนํ๋ค โ scratch ๋ฒ์ ์ โfold shirtโ์์ 80.8์ (full ๋๋น โ18.7์ )์ ๊ทธ์ณค๊ณ , ์์ง์์ด ๊ฑฐ์น ์ด ์ฅ๊ธฐ ๋ฐฐํฌ ์ ๋ก๋ด์ ์์์ํฌ ์ ์๋ค๊ณ ํ๋จํด ์ถ๊ฐ ํ๊ฐ๋ฅผ ์ค๋จํ๋ค. ์ฌ์ ํ์ต prior์ ๊ฐ์น๊ฐ ์ฑ๊ณต๋ฅ ๋ฟ ์๋๋ผ ๋์์ ๋ถ๋๋ฌ์์์ ๋์จ๋ค๋ ๊ด์ฐฐ์ธ๋ฐ, ์ ๋ํ๋์ง ์์๋ค.
RoboCasa (Table 5) โ ์ด์ชฝ์ด ํจ์ฌ ๊ฒฐ์ ์ ์ด๋ค. ๊ตฌ์ฑ์์๋ฅผ ํ๋์ฉ ๋ผ์ด๋ด๋ฉฐ โ์ก์ ๋ง ์์ธกํ๋ ์์ํ ์ ์ฑ โ๊น์ง ๊ฐ๋ค.
| Variant | Average SR (%) |
|---|---|
| Cosmos Policy (5 denoising steps) | 67.1 |
| (1) w/o ๊ฐ์นํจ์ ํ์ต ์ํ (๋ฐฐ์น 50/50 policyยทWM) | 66.6 |
| (2) w/o ์๋๋ชจ๋ธยท๊ฐ์นํจ์ ํ์ต ์ํ (๋ฐฐ์น 100% policy) | 64.0 |
| (3) (2) + ์ ์ฑ ์ value ๋ณด์กฐ ํ๊น ์ ๊ฑฐ โ \pi(a,s'\mid s) | 62.5 |
| (4) (3) + ๋ฏธ๋ ์ํ ํ๊น๊น์ง ์ ๊ฑฐ โ \pi(a\mid s) (barebones) | 44.4 |
| Cosmos Policy w/ 1 denoising step | 66.4 |
- โ (4)์ โ18.1์ ๋์ฐจ๊ฐ ์ด ๋ ผ๋ฌธ์ ์จ์ ์ฃผ์ธ๊ณต์ด๋ค. ๋ฐฐ์น ๋ถํ ยท๊ฐ์นํจ์ยท์์๋ธ ๊ฐ์ ์ฅ์น๋ ๊ฐ๊ฐ 0.5~2.5์ ์ฉ ๊ธฐ์ฌํ ๋ฟ์ธ๋ฐ, ์ ์ฑ ์ด ๋ฏธ๋ ์ํ๋ฅผ ํจ๊ป ์์ธกํ๋๋ก ๊ฐ์ ํ๋ ๊ฒ๋ง์ผ๋ก 62.5 โ 44.4์ ๋ถ๊ดด๋ฅผ ๋ง๋๋ค. ๋ฐ๊ฟ ๋งํด Cosmos Policy์ ์ฑ๋ฅ์ โ๋น๋์ค ๋ชจ๋ธ์ ๋ฐฑ๋ณธ์ผ๋ก ์ผ๋คโ๋ณด๋ค โ๋ฐฑ๋ณธ์๊ฒ ๊ณ์ ๋น๋์ค๋ฅผ ์์ธก์ํค๋ฉด์ ์ก์ ๋ ์์ผฐ๋คโ ์์ ๋์จ๋ค. ์ฌ์ ํ์ต prior๋ฅผ fine-tuning ์ค์ ์์ง ์๊ฒ ๋ถ์ก์๋๋ ์ ๊ทํ๋ก ์ฝ๋ ํธ์ด ์์ฐ์ค๋ฝ๋ค. ๊ณต๊ฐ ์ฝ๋๋ฅผ ๋ณด๋ฉด ์ด ํด์์ด ๋ ๋ถ๋ช ํด์ง๋ค โ (4)๋ ๋ฌด์ธ๊ฐ๋ฅผ ๋บ ๊ฒ์ด ์๋๋ผ ์์ค ๋ง์คํฌ๋ก ๋ฏธ๋ ํ๋ ์ ์นธ์ ๊บผ์ โ๋น๋์ค ์์ธก์ ๊ทธ๋ง๋๊ฒ ํโ ์ค์ ์ด๋ค(์ฝ๋ ๋์กฐ ์ โ ).
๋ง์ง๋ง ์ค๋ ์ค์ฉ์ ์ผ๋ก ์ค์ํ๋ค. denoising step์ 5 โ 1๋ก ์ค์ฌ๋ 66.4%(โ0.5%) ์ด๊ณ , ์ง์ฐ์ 0.61์ด โ 0.16์ด๋ก ์ฝ 4๋ฐฐ ๋นจ๋ผ์ง๋ค.
Q3ยทQ4: Planning

Planning ๊ฒฐ๊ณผ(Fig. 7) โ ์ด๋ ค์ด ์ด๊ธฐ ์กฐ๊ฑด์์์ score. base 59.5 โ model-free Q(s,a) 61.3 โ model-based V(s') 72.0. โput candy in ziploc bagโ์์ 70.0 โ 84.0์ผ๋ก ๊ฐ์ฅ ํฌ๊ฒ ์ค๋ฅธ๋ค.
rollout ๋ฐ์ดํฐ๋ ๋๋๋๋ก ์ ๋ค. ์์ ์ง์ ์ ์ฑ ํ๊ฐ๋ฅผ ๋๋ฆฌ๋ฉด์ ์ ๋ฐฉ๋ฒ์ ๊ฑธ์ณ 505๊ฐ ๋กค์์์ด ์ด๋ฏธ ์์๊ณ , ์ฌ๊ธฐ์ โput candy in ziploc bagโ์ฉ์ผ๋ก 143๊ฐ๋ฅผ ์ถ๊ฐํด ์ด 648๊ฐ๋ก planning model์ fine-tuneํ๋ค. ์งํผ๋ฐฑ ํ์คํฌ์๋ง ์ถ๊ฐ ์์ง์ ํ ์ด์ ๋ ๊ตฌ์ฒด์ ์ด๋ค โ ๋ก๋ด ์๊ธฐ ๊ฐ๋ฆผ(self-occlusion)์ผ๋ก ์นด๋ฉ๋ผ ๊ด์ธก์ฑ์ด ๋ฎ๊ณ , ๋ฐ๋ฆฌ๋ฏธํฐ ์ฐจ์ด๊ฐ ์ฑ๊ณต/์คํจ๋ฅผ ๊ฐ๋ฅด๋ ํ๋ฅ ์ ๋์ญํ์ด๋ผ ์๋๋ชจ๋ธ ํ์ต์ด ํนํ ์ด๋ ต๋ค.
Q4์ ๋ต(model-based V(s') > model-free Q(s,a))์ ๋ํด ์ ์๋ค์ด ๋ด๋๋ ์ค๋ช ์ ํ์ต๋ ๋์ญํ์ ํ์ฉํ๋ ์ชฝ์ด ์ํ ํจ์จ์ ์ด๋ผ๋ ๊ฒ, ๊ทธ๋ฆฌ๊ณ Q๋ ์ ๋ ฅ ์ฐจ์์ด ๋์(s,a ๋ชจ๋ ์กฐ๊ฑด) ์๋ ๋ฐ์ดํฐ์์ ๊ณผ์ ํฉํ๊ธฐ ์ฝ๋ค๋ ๊ฒ์ด๋ค. ๋ค๋ง ์ด๋ โ648๊ฐ ๋กค์์โ์ด๋ผ๋ ํน์ ๋ฐ์ดํฐ ๊ท๋ชจ์์์ ๊ด์ฐฐ์ด๊ณ , ๋ ผ๋ฌธ๋ ์ถ์ธกํ(โsuspectโ)์ผ๋ก ์ ๋๋ค.
์ถ๋ก ๋น์ฉ์ ์ ์งํ๊ฒ ๋ณด๊ณ ๋ผ ์๋ค. best-of-N(N=8)์ 8๊ฐ H100์ ๋ธ๋์น๋น 1๊ฐ์ฉ ๋ณ๋ ฌ ๋ฐฐ์นํด๋ ํ ๋ฒ์ ํ์์ 4.9์ด๊ฐ ๊ฑธ๋ฆฐ๋ค(์ก์ 10์คํ ร 8ํ๋ณด โ ๋ฏธ๋์ํ 5์คํ ร 3์์๋ธ โ value 5์คํ ร 5์์๋ธ). ํ์ ๋น์ฉ์ ๋ ํค์ฐ์ง ์์ผ๋ ค๊ณ receding horizon ์์ด chunk ์ ๋ ์คํ์ ํํ ๊ฒ๋ ์ด ๋๋ฌธ์ด๋ค.
๊ณต๊ฐ ์ฝ๋์ ๋์กฐํด ๋ณด๋ฉด
๋ ผ๋ฌธ๋ง ์ฝ๊ณ ๋์ด๊ฐ๋ฉด ๋์น๋ ๊ฒ๋ค์ด ์์ด, ๊ณต๊ฐ ๋ ํฌ(NVlabs/cosmos-policy, Apache-2.0)๋ฅผ ์ค์ ๋ก ๋ฐ์ ๋์กฐํ๋ค(ํ์ธ ์์ 2026-09-28, main ๋ธ๋์น, ์ธ์ฉํ ๊ฐ์ ๋ชจ๋ ๋ ํฌ ํ์ผ์์ ์ง์ ํ์ธ). ๋จผ์ ๋ถ๋ช ํ ํด ๋๋ฉด, ์๊ณ ๋ฆฌ์ฆ ์์ฒด๋ ๋ ผ๋ฌธ๊ณผ ์ผ์นํ๋ค โ latent frame ๊ตฌ์ฑ, ์ก์ ํ์ผ๋ง, blank placeholder + 4๋ฐฐ ์ด๋ฏธ์ง ๋ณต์ , \sigma_\text{min}=4, 0.7/0.3 ํผํฉ ๋ ธ์ด์ฆ ๋ชจ๋ ํ์ผ ์์ค์์ ํ์ธ๋๋ค. ์ด๊ธ๋๋ ๊ฒ์ ๋ฉ์ปค๋์ฆ์ด ์๋๋ผ ์์ ๋ฐฉ์(์๋ โ )๊ณผ ๋ ผ๋ฌธ์ ์ ํ์ง ์์ ๊ธฐ๋ณธ๊ฐ๋ค(โก~โฃ)์ด๋ค. ๊ทธ๋ฆฌ๊ณ ๊ทธ์ค ํ๋๋ ๋ ผ๋ฌธ ์ฝ๊ธฐ ์์ฒด๋ฅผ ๋ฐ๊พผ๋ค.
โ โ๋ณด์กฐ ์์ค์ ๋ํ๋คโ๋ ์์ ์, ์ฝ๋์์๋ โ์์ค ๋ง์คํฌ์์ ๊ทธ ์นธ์ ๋นผ์ง ์์๋คโ์ด๋ค. ์ด๊ฒ ์ด๋ฒ ๋์กฐ์์ ๊ฐ์ฅ ๊ฐ์ง ๋ฐ๊ฒฌ์ด๋ค. policy_text2world_model.py์์ ์ค์ ๋ก ์ญ์ ํ๋๋ ์์ค์ EDM ์์ค ํ๋(kendall_loss = edm_loss_B_C_T_H_W)์ด๊ณ , ๊ทธ ๋ค์ ํ๋ ์ ๋จ์ ๋ง์คํฌ final_mask_B_T๋ฅผ ๊ณฑํ๋ ๊ฒ์ด ์ ๋ถ๋ค. ๊ฐ์ ํ์ผ์ future imageยทproprioยทvalue๋ณ *_mse_loss/*_l1_loss๊ฐ ์๋ฉ ๊ณ์ฐ๋์ง๋ง ์ ๋ถ ์ถ๋ ฅ ๋์
๋๋ฆฌ๋ก๋ง ํ๋ฌ๊ฐ๋ ๋ก๊น
์งํ์ด๊ณ ํ์ต์ ์ฐ์ด์ง ์๋๋ค. โ๋ณด์กฐ ์์ค ๊ฐ์ค์นโ ๊ฐ์ ํ์ดํผํ๋ผ๋ฏธํฐ๋ ์๋ค(์๋ ๊ฒ์ action_loss_multiplier ํ๋์ด๊ณ ๊ณต๊ฐ ์ค์ ๊ฐ์ 1).
๋น์ฐํ ์ด์ผ๊ธฐ๋ค โ ๋ฏธ๋ ์ด๋ฏธ์งยทproprioยทvalue ์นธ์ ์ด๋ฏธ \mathbf{x}_0์ ์ผ๋ถ๋ผ, ์๋ฌด๊ฒ๋ ๋ํ์ง ์์๋ ์๋์ผ๋ก EDM ์์ค์ ๋ค์ด๊ฐ๋ค. ๋ฐ๋ผ์ ยง4.2์ auxiliary supervision์ ์ถ๊ฐํ ๊ฒ์ด ์๋๋ผ ๋นผ์ง ์์ ๊ฒ์ด๊ณ , ablation์ ๋ง์คํฌ๋ก ๊ทธ ์นธ์ ๊บผ์ ์์ค์์ ์ ์ธํ ๊ฒ์ด๋ค(mask_loss_for_action_future_state_prediction, mask_value_prediction_loss_for_policy_prediction โ ๋ ๋ค ๊ธฐ๋ณธ False์ด๊ณ ๊ณต๊ฐ LIBERO/RoboCasa ์ค์ ์ด๋์๋ ์ผ๋ ์ค์ด ์๋ค. ์ฆ ๋ฆด๋ฆฌ์ค ์ฒดํฌํฌ์ธํธ๋ ๋ณด์กฐ ๊ฐ๋
์ด ์ต๋๋ก ์ผ์ง ์ํ๋ค).
์ด๋ ๊ฒ ์ฝ์ผ๋ฉด Table 5์ โ18.1pp๊ฐ ๋น๋ก์ ๋ฉ๋๋๋ค. โ๋ณด์กฐ ํญ์ ํ๋ ๋ํ๋๋ 18์ ์ด ์ฌ๋๋คโ๊ฐ ์๋๋ผ, โ๋น๋์ค ๋ชจ๋ธ์๊ฒ ํ๋ ์ผ(๋ฏธ๋ ํ๋ ์ ์์ธก)์ ๊ณ์ ์์ผฐ๋๋ ๊ป๋๋โ์ ์ฐจ์ด๊ฐ 18์ ์ด๋ผ๋ ๋ป์ด๊ธฐ ๋๋ฌธ์ด๋ค. Cosmos Policy์ ๋ณธ์ง์ ์์ค ์ค๊ณ๊ฐ ์๋๋ผ fine-tuning ์ค์๋ ๋ฐฑ๋ณธ์ด ์๋ ํ๋ ์ผ์ ๋์ง ์๊ฒ ๋๋ ๊ฒ์ ๊ฐ๊น๋ค.
โก ๊ณต๊ฐ ์ค์ ์ ๊ฐ์นํจ์๋ V(s')๋ Q(s,a)๋ ์๋๋ค. ์
๋ ฅ ๋ง์คํน ํ๋๊ทธ mask_current_state_action_for_value_prediction๊ณผ mask_future_state_for_qvalue_prediction์ ๋ ๋ค ๊ธฐ๋ณธ False ์ด๊ณ , ๋ ํฌ ์ ์ฒด์์ True๋ก ์ผ์ง๋ ๊ณณ์ ALOHA planning ์คํ ์ค์ ๋จ ํ ์ค๋ฟ์ด๋ค(์ ์๋ง. Q(s,a) ํ๋๊ทธ๋ ๊ณต๊ฐ ์ค์ ์์ ์์ ์ผ์ง์ง ์๋๋ค). ๋ฐ๋ผ์ LIBEROยทRoboCasa ๊ณต๊ฐ ์ค์ ์ ๊ฐ์น ์์ธก์ s, a, s'๋ฅผ ์ ๋ถ ์กฐ๊ฑด์ผ๋ก ๋ฐ๋ ํํ โ ์ ์ ์ฃผ์ ํ๊ธฐ๋ก๋ V(s,a,s') โ ์ด๊ณ , ๋
ผ๋ฌธ ๋ณธ๋ฌธ์ ๋ฑ์ฅํ์ง ์๋ ์ 3์ ๋ณํ์ด๋ค. ์ฌํ์ ์
์ฅ์์ ํจ์ ์ด๋ค: LIBERO ์ฒดํฌํฌ์ธํธ๋ก planning์ ํ๋ด ๋ด๋ฉด ๋
ผ๋ฌธ์ด ๋น๊ตํ ๊ฒ๊ณผ ๋ค๋ฅธ ๊ฐ์นํจ์๋ฅผ ์ฐ๊ฒ ๋๋ค.
โข \sigma ์ํ์ด ์ธ ๊ฐ์ด๊ณ ์๋ก ๋ค๋ฅด๋ค. ํ์ต sigma_max=200, ํผํฉ ๋ถํฌ์ ๊ท ๋ฑ ์ํ uniform_upper=85.0, ์ถ๋ก ์์์ sigma_max=80(+ sigma_min=4). ๋
ผ๋ฌธ์ ๋ณธ๋ฌธ์์ \sigma_\text{max}=80๊ณผ ๊ท ๋ฑ ๊ตฌ๊ฐ [1.0, 85.0]๋ง ์ธ๊ธํ๊ณ ํ์ต ์ํ 200์ ์ ์ง ์๋๋ค โ ๊ทธ๋์ \sigma \in (85, 200] ๊ตฌ๊ฐ์ด log-normal ๊ผฌ๋ฆฌ๋ก๋ง ๋๋ฌผ๊ฒ ์ฑ์์ง๋ค๋ ์ฌ์ค์ด ๋
ผ๋ฌธ๋ง ๋ด์๋ ๋ณด์ด์ง ์๋๋ค. ๋ง๋ถ์ฌ ํ์ต ์ค์ ์ p_mean = 1.3862943611198906์ ์ ํํ \ln 4์ด๊ณ โCopied from base model configโ ์ฃผ์์ด ๋ฌ๋ ค ์๋ค(๋
ผ๋ฌธ์ P_\text{mean}=1.39์ ์ผ์น). ์ถ๋ก \sigma_\text{min}๋ 4๋ผ๋ ๊ฒ ์ฐ์ฐ์ธ์ง ์๋์ง๋ ๋
ผ๋ฌธ์ ์ค๋ช
์ด ์๋ค.
๊ทธ๋ฆฌ๊ณ ์ด \sigma_\text{min}=4๋ ๋ณ๋ inference-only ์ค์ ์ ๊ฑฐ์ ํ๋ก ๋ค์ด ์๊ณ , ๋น ๋จ๋ ค๋ ์๋ฌ๊ฐ ๋์ง ์๋๋ค. ๊ทธ ์ค์ ์ด ์์ ์ค์ ์ ์น๋ ๋ด์ฉ์ด ์ฌ์ค์ sigma_max=80, sigma_min=4 ๋ ์ค๋ฟ์ด๋ผ, ์ค์ ์ ์ ์น์ผ๋ฉด ํ์ต ๊ฐ(sigma_min=0.01)์ผ๋ก ์กฐ์ฉํ ๋จ์ด์ง๋ค. ํฌ๋์๋ ๊ฒฝ๊ณ ๋ ์๊ณ ์์ฑ ํ์ง๋ง ๋๋น ์ง๋ค. ์๊ณ ๋ฆฌ์ฆ๋ง ์ฎ๊ฒจ ์ ๋ ์ฌ๊ตฌํ์์ ๊ฐ์ฅ ๋จผ์ ์๋ ์ง์ ์ด ์ฌ๊ธฐ์ผ ๊ฒ์ด๋ค.
โฃ ๋ฏธ๋ ์ด๋ฏธ์ง ์ฌ๋กฏ์ ์ด๊ธฐ๊ฐ์ blank๊ฐ ์๋๋ผ โํ์ฌ ์ด๋ฏธ์ง์ ๋ณต์ฌ๋ณธโ์ด๋ค. cosmos_utils.py์ ์ํ์ค ๊ตฌ์ฑ ์ฝ๋๋ฅผ ๋ณด๋ฉด, actionยท๋ฏธ๋ proprioยทvalue ์๋ฆฌ์๋ blank ์ด๋ฏธ์ง๋ฅผ ๋ฃ๋๋ฐ(blank_image_duplicated.copy()) ๋ฏธ๋ ์๋ชฉ/3์ธ์นญ ์ด๋ฏธ์ง ์๋ฆฌ์๋ ํ์ฌ ์๋ชฉ/3์ธ์นญ ์ด๋ฏธ์ง๋ฅผ ๋ณต์ฌํด ๋ฃ๋๋ค(์ฃผ์๋ โcopies of the current primary/secondary imagesโ๋ผ๊ณ ๋ช
์). ์ฆ ์๋๋ชจ๋ธ์ ๋ฌด์์ ๋ฏธ๋๋ฅผ ๊ทธ๋ฆฌ๋ ๊ฒ ์๋๋ผ ํ์ฌ ํ๋ ์์ ์ถ๋ฐ์ ์ผ๋ก ๋ณํ๋ถ์ ๊ทธ๋ฆฌ๋๋ก ์กฐ๊ฑด์ด ์กํ ์๋ค. ๋
ผ๋ฌธ ๋ณธ๋ฌธ์๋ Fig. 2ยทFig. 8์๋ ์ด ์ด๊ธฐํ ์ ํ์ ์์ ๋์ง ์๋๋ค โ ์ฌ๊ตฌํ ์ blank๋ก ๋๋ฉด ์กฐ๊ฑด ์์ฒด๊ฐ ๋ฌ๋ผ์ง๋ค. (๋ฏธ๋ proprio๋ blank์ธ๋ฐ ๋ฏธ๋ ์ด๋ฏธ์ง๋ง ๋ณต์ฌ๋ณธ์ด๋ผ๋ ๋น๋์นญ๋ ์ค๋ช
์ด ์๋ค.)
โค ์ก์ ๋ณต์์ โํ๊ท โ์ ๋ฌธ์ ๊ทธ๋๋ก ํ ์ค์ด๋ค โ ์์ ์ง๊ด ์ ์์ ๋ค๋ฃฌ ๋ฌด๋ฃ ์์๋ธ ํจ๊ณผ.
๋ถ์์ ์ผ๋ก, ๊ฐ์น ์์๋ธ ์ง๊ณ ํจ์์๋ ๋
ผ๋ฌธ์ด ๋ณด๊ณ ํ majority_mean ์ธ์ ๋น๊ด์ ํํ(LCB, mean โ std) ๋ฐฉ์์ด ๊ตฌํ๋ผ ์์ง๋ง ๋
ผ๋ฌธ์ ๋ณด๊ณ ๋์ง ์๋๋ค. ์ฑ๊ณต/์คํจ๋ฅผ ๊ฐ๋ฅด๋ ๋ฌธํฑ๊ฐ 0.05๋ ํจ์ ์ ์์๋ค(๋
ผ๋ฌธ์ โfixed thresholdโ๋ผ๊ณ ๋ง ์ ๋๋ค). ๊ทธ๋ฆฌ๊ณ best-of-N ๊ด๋ จ ๊ธฐ๋ณธ๊ฐ์ ๋
ผ๋ฌธ ์ค์ ๊ณผ ๋ค๋ฅด๋ค โ ์ง์ ์ ๊ธฐ๋ณธ 1(=ํ์ ์์), ์ง๊ณ ๊ธฐ๋ณธ average์ด๋ฏ๋ก, ๋
ผ๋ฌธ์ N=8ยทmajority_mean์ ์ฌํํ๋ ค๋ฉด ๋ช
์์ ์ผ๋ก ์ง์ ํด์ผ ํ๋ค. LIBERO ๊ณต๊ฐ ์ค์ ์ latent ์ํ์ค ๊ธธ์ด๋ state_t=9(blank, proprio, wrist, primary, action, future proprio, future wrist, future primary, value)๋ก, 3์ธ์นญ 2๋ ๊ตฌ์ฑ์ 11๊ณผ ยง4.1์ ์์ 7 ์ฌ์ด ์ด๋๊ฐ๋ค.
ํ๊ฒฝ ๊ตฌ์ฑ ์ชฝ์์๋ ๊ธ์ ์ ์ธ ๋ฐ๊ฒฌ์ด ์์๋ค. SETUP.md๋ Docker๋ฅผ ์ ์ ํ์ง๋ง, uv.lock์ NVIDIA ์์ฒด ์ธ๋ฑ์ค์ prebuilt ํ (flash-attnยทnattenยทtransformer-engine)์ด ๊ณ ์ ๋ผ ์์ด nvcc ์๋ ํธ์คํธ์์ uv sync --extra cu128 ํ ๋ฒ์ผ๋ก ์ค์น๊ฐ ์์ฃผํ๋ค(torch 2.7.0+cu128, RTX 5090 / sm_120์์ ํ์ธ). ๋ฌด๊ฑฐ์ด CUDA ํ์ฅ์ ์ง์ ๋น๋ํ์ง ์์๋ ๋๋ค๋ ๋ป์ด๊ณ , ์ด ๊ท๋ชจ์ NVIDIA ๋ ํฌ์น๊ณ ๋ ์ด๋ก์ ์ผ๋ก ๋งค๋๋ฝ๋ค.
๋ค๋ง ํ๊ฐ ํ๋กํ ์ฝ์ ๋จ์ผ ์๋น์ GPU์์ ์์ฃผํ๋ ๊ฒ์ ๊ตฌ์กฐ์ ์ผ๋ก ๋ถ๊ฐ๋ฅํ๋ค. LIBERO ์๋ฎฌ๋ ์ด์ ๋ฃจํ๋ง ๋๋ ค๋ ์ฝ 10.7 steps/s์ธ๋ฐ, suite๋น 500 trial ร ์๋ฐฑ step์ด๋ฉด ๋ชจ๋ธ ์ถ๋ก ์ ๋นผ๊ณ ๋ 6~7์๊ฐ์ด๊ณ ๋ ผ๋ฌธ์ 3 seed(6000 trial)๋ฅผ ๋๋ค. ์์์ ๋ณธ ํ์ต ์๊ตฌ์ฌํญ(64รH100)์ ๋ํด, ๊ฒ์ฆ์กฐ์ฐจ ํด๋ฌ์คํฐ ์์ด๋ ์ฌํ ๋ฒ์๊ฐ โ๋์๊ฐ๋์ง ํ์ธโ๊น์ง๋ผ๋ ์ ์ ๋ถ๋ช ํ ํด ๋ ํ์๊ฐ ์๋ค.
๋นํ์ ์ผ๋ก ๋ณด๋ฉด
๊ฐ์
- ๋จ์์ฑ์ด ์ค์ฆ์ผ๋ก ๋ท๋ฐ์นจ๋๋ค. โ๊ตฌ์กฐ ๋ณ๊ฒฝ 0, ํ์ต ๋จ๊ณ 1โ์ด๋ผ๋ ์ฃผ์ฅ์ ๋ง๋ก๋ ์ฝ์ง๋ง, Table 4์ scratch ablation(โ3.9)๊ณผ Table 5์ barebones ablation(โ22.7)์ด โ๋ฌด์์ ์ ํ๋์งโ์ โ๋ฌด์์ด ์ค์ ๋ก ๊ธฐ์ฌํ๋์งโ๋ฅผ ๋ถ๋ฆฌํด ๋ณด์ฌ์ค๋ค. ๋จ์ํจ์ ์ฃผ์ฅํ๋ ๋ ผ๋ฌธ์ด ํํ ๋น ์ง๋ โ๊ทธ๋์ ์ง์ง ์ด์ ๊ฐ ๋ญ๋โ์ ๋ต์ด ์๋ค.
- ๋ฐ์ดํฐ ํจ์จ์ด ์ง์ง ๊ฒฐ๊ณผ๋ค. RoboCasa์์ 50 ๋ฐ๋ชจ๋ก 300~3000 ๋ฐ๋ชจ ๊ธฐ๋ฐ ๋ฐฉ๋ฒ์ ๋๊ธด ๊ฒ์ ์ ๋ ์ฑ๋ฅ(67.1%)๋ณด๋ค ํจ์ฌ ๊ฐํ ์ฃผ์ฅ์ด๋ค. ALOHA๋ 4๊ฐ ํ์คํฌ ์ด 185 ๋ฐ๋ชจ๋ก ๋๊ท๋ชจ ์ฌ์ ํ์ต VLA๋ค์ ์ด๊ฒผ๋ค.
- ๊ฐ์ ๋ชจ๋ธ์ด ์ ์ฑ ยท์๋๋ชจ๋ธยท๊ฐ์นํจ์๋ฅผ ๊ฒธํ๋ค๋ ๊ฒ์ ์ค์ฉ์ ๊ฐ์น. ๋ง์คํฌ๋ง ๋ฐ๊ฟ V(s')/Q(s,a)๋ฅผ ์ ํํ๊ณ , ๊ฐ์ ์ฝ๋๋ก model-based์ model-free๋ฅผ ๋น๊ตํ๋ค. FLAREยทSAILORยทLatent Policy Steering์ฒ๋ผ ๋ชจ๋์ ๋ถ๋ฆฌํ ์ ๊ทผ๋ค๊ณผ ๋๋น๋๋ ๋ช ํํ ์ค๊ณ ์ด์ ์ด๋ค.
- ์คํจ ๋ชจ๋๋ฅผ ๊ทธ๋ฆผ์ผ๋ก ์ค๋ช ํ๋ค. Fig. 5๋ โ์ฐ๋ฆฌ๊ฐ ๋ ์ข๋คโ๊ฐ ์๋๋ผ โ๊ฒฝ์ ๋ฐฉ๋ฒ์ด ์ ๊ทธ ํ์คํฌ์์ ๋ฌด๋์ง๋๊ฐโ๋ฅผ ๋ณด์ฌ์ค๋ค. L1 ํ๊ท โ๏ธ ๋ฉํฐ๋ชจ๋ฌ ๋ถํฌ์ ๋ฌธ์ ๋ฅผ ํ ์ฅ์ผ๋ก ์ ๋ฌํ ์ข์ ์.
- ์ฌํ ์ ๋ณด๊ฐ ์ด๋ก์ ์ผ๋ก ์์ธํ๋ค. GPU ์ยท๋ฐฐ์น ํฌ๊ธฐยทgradient stepยทํ์ต ์๊ฐ๋ฟ ์๋๋ผ ๋ชจ๋ฌ๋ฆฌํฐ๋ณ L1 training loss(์ก์
0.010~0.016, ์ด๋ฏธ์ง latent 0.036~0.097)๊น์ง ๊ณต๊ฐํ๋ค. ์ฌํ ์ โ์ด๋๊น์ง ๋ด๋ ค๊ฐ์ผ ์ ์์ธ์งโ๋ฅผ ์ ์ ์๋ ๋๋ฌธ ์์ค์ด๋ค. ์ฝ๋ ์ชฝ๋
uv.lock์ prebuilt CUDA ํ ์ ๊ณ ์ ํด ๋ฌ์ ์ค์น๊ฐ ์ค์ ๋ก ํ ๋ฒ์ ํต๊ณผํ๋ค.
์ฝ์ ยทํ๊ณ
- OOD์์๋ \pi_{0.5}์ ์ง๋ค(89.3 vs 92.5). ๋ ผ๋ฌธ์ ์ด๋ฅผ Table 3 ์บก์ ์์ ํ ์ค๋ก ์ธ์ ํ๊ณ ๋์ด๊ฐ์ง๋ง, โ๋น๋์ค prior๊ฐ VLM prior๋ณด๋ค ๋ซ๋คโ๋ ์์ฌ์ ๊ฐ์ฅ ์ค์ํ ๋ฐ๋ก๋ค. ๋๊ท๋ชจ action-labeled ์ฌ์ ํ์ต์ด ์ฃผ๋ ๊ฒ๊ณผ ๋น๋์ค ์ฌ์ ํ์ต์ด ์ฃผ๋ ๊ฒ์ด ์๋ก ๋ค๋ฅธ ์ข ๋ฅ์ ์ด๋์์ ์์ฌํ๋๋ฐ, ๊ทธ ๊ตฌ๋ถ์ ๋ํ ๋ถ์์ ์๋ค.
- ์ถ๋ก ๋น์ฉ์ด ๋ฌด๊ฒ๋ค. planning ์์ด๋ ํ chunk์ 0.61์ด(5์คํ )~0.95์ด(10์คํ , H100 1์ฅ)์ด๊ณ , planning์ H100 8์ฅ ๋ณ๋ ฌ๋ก 4.9์ด๋ค. ALOHA์์ ์ด๊ฒ ๊ตด๋ฌ๊ฐ ๊ฒ์ chunk๊ฐ 2์ด๋ฅผ ์ปค๋ฒํ๊ณ ๋ก๋ด์ด ๊ทธ ๋์ ๋ฉ์ถฐ ์ ์์ด๋ ๋๋ ์ค์ ์ ํ์คํฌ์ด๊ธฐ ๋๋ฌธ์ด๋ค. ๋ ผ๋ฌธ๋ ๋์ ์กฐ์ยท๋ณดํ์ ์ ์ฉ์ด ์ด๋ ต๋ค๊ณ ์ค์ค๋ก ์ ๋๋ค. ๋ค๋ง 1-step denoising์ด โ0.5%๋ก ๊ฑฐ์ ๊ณต์ง์๋ค๋ ๊ฒฐ๊ณผ(Table 5)๋ฅผ ๋ณด๋ฉด, ์ง์ฐ ๋ฌธ์ ์ ์๋น ๋ถ๋ถ์ ์ต์ ํ ์ฌ์ง๊ฐ ์์ด ๋ณด์ธ๋ค.
- planning ํ๊ฐ ๊ท๋ชจ๊ฐ ์๋ค. Q3ยทQ4 ๊ฒฐ๋ก ์ ์ฒด๊ฐ 2๊ฐ ํ์คํฌ, ์ด๋ ค์ด ์ด๊ธฐ ์กฐ๊ฑด subset์ ๊ธฐ๋ฐํ๋ค. ์ํ ์ยท์๋ ์๊ฐ ๋ช ์๋์ง ์๊ณ , ์ ๋ขฐ๊ตฌ๊ฐ๋ ์๋ค. +12.5์ ์ด๋ผ๋ ์ซ์๋ ๋ฐฉํฅ์ฑ์ผ๋ก๋ ์ค๋๋ ฅ ์์ง๋ง ํต๊ณ์ ๊ฐ๋๋ ์ฝํ๋ค.
- โrollout ๋ฐ์ดํฐ๊ฐ ํ์ํ๋คโ๋ ์ํ์ฑ. ์ข์ ์๋๋ชจ๋ธ์ ์ป์ผ๋ ค๋ฉด ์ ์ฑ ์ ๊ตด๋ ค์ผ ํ๊ณ , ๊ทธ๋ฌ๋ ค๋ฉด ์ด๋ฏธ ์ธ ๋งํ ์ ์ฑ ์ด ์์ด์ผ ํ๋ค. ๋ ผ๋ฌธ์ ์ด๋ฅผ ํ๊ณ๋ก ์ธ์ ํ์ง๋ง(โeffective planning requires substantial rollout dataโ), 648๊ฐ ๋กค์์์ ๋ชจ์ผ๋ ๋ฐ ๋ ์ค์ธ๊ณ ์๊ฐยท๋ ธ๋์ ๋ณด๊ณ ๋์ง ์๋๋ค. ๋ฐ์ดํฐ ํจ์จ์ ํต์ฌ ์ฃผ์ฅ์ผ๋ก ๋ด์ธ์ด ๋ ผ๋ฌธ์์ ์ด ๋น์ฉ์ ๋ถ์ฌ๋ ์์ฝ๋ค.
- latent injection์ ๋์ ์ค๊ณ๊ฐ ๊ฒ์ฆ๋์ง ์์๋ค. ๋ณต์ ์ธ์ฝ๋ฉ์ ์ง๊ด์ ์ผ๋ก ๊ทธ๋ด๋ฏํ์ง๋ง(์ ์ง๊ด ์ ), ๋ ผ๋ฌธ์๋ โ๋ณต์ ์์ด sparseํ๊ฒ ๋ฃ๊ธฐโ, โํ์ต ๊ฐ๋ฅํ projection ์ฐ๊ธฐโ ๊ฐ์ ๋์๊ณผ์ ๋น๊ต๊ฐ ์๋ค. ์ฆ โ๊ตฌ์กฐ๋ฅผ ์ ๋ฐ๊ฟจ๋คโ๋ ์ฃผ์ฅ์ ๊ฒ์ฆ๋์ง๋ง โ์ด ์ธ์ฝ๋ฉ์ด ์ต์ ์ด๋คโ๋ ๊ฒ์ฆ๋์ง ์์๋ค.
- ๋น๋์ค ๋ชจ๋ธ์ ์ฐ๋ฉด์ ์๊ฐ ์ถ์ ๊ฑฐ์ ์ ์ด๋ค. ์ ๋ ฅ ํ์คํ ๋ฆฌ ์์, ๋ฏธ๋๋ t+K ํ ์์ ๋ง ์์ธก. best-of-N๋ ํ์ ํธ๋ฆฌ ๊น์ด 1์ด๋ค. ๋น๋์ค ๋ชจ๋ธ์ ์ง์ง ๊ฐ์ (๊ธด ์๊ฐ ์ผ๊ด์ฑ)์ ํ์ฉํ์ง ์๋ ์ ์ด๊ณ , ์ ์๋ค๋ ์์ธก ์งํ ํ์ฅ๊ณผ ๊น์ ํ์์ future work๋ก ๋จ๊ธด๋ค.
- โ ๏ธ โ์์ ๊ณต๊ฐโ๋ผ๋ ์ฌํ์ฑ ์ฃผ์ฅ์ ๊ตฌ๋ฉ์ด ์๋ค. ยง7 Reproducibility Statement๋ ์ฒดํฌํฌ์ธํธยทํ์ต ๋ฐ์ดํฐยท์ฝ๋๋ฅผ ๊ณต๊ฐํ๋ค๊ณ ์ ๊ณ , ์ค์ ๋ก ์ ์ฑ
์ฒดํฌํฌ์ธํธ
nvidia/Cosmos-Policy-LIBERO-Predict2-2B๋ HuggingFace์์ ๊ฒ์ดํ ์์ด ๋ฐ์ ์ ์๋ค. ๊ทธ๋ฐ๋ฐ ๊ทธ ์ ์ฑ ์ด ์์กดํ๋ VAE ํ ํฌ๋์ด์ ๋nvidia/Cosmos-Predict2-2B-Video2World์์ ์๊ณ (cosmos_policy/config/defaults/tokenizer.py์vae_pth="hf://nvidia/Cosmos-Predict2-2B-Video2World/tokenizer/tokenizer.pth"), ์ด ๋ ํฌ๋gated: auto๋ค(2026-09-27 HF API ํ์ธ). ์ฆ ๋ผ์ด์ ์ค ์๋ฝ + ํ ํฐ ์์ด๋ ์ถ๋ก ์ ํ ์ค๋ ๋๋ฆด ์ ์๋ค. ๋ ๋์ ๊ฒ์ READMEยทSETUP.mdยทLIBERO.md ์ด๋์๋ HF ์ธ์ฆ ์๋ด๊ฐ ์๋ค๋ ์ ์ด๋ค โ ์ฌํ์๋ โ๊ณต๊ฐโ๋ผ๋ ๋ฌธ์ฅ์ ์ฝ๊ณ ์์ํ๋ค๊ฐ ํ ํฌ๋์ด์ ๋ค์ด๋ก๋ ๋จ๊ณ์์ ๋งํ๋ค. Apache-2.0 ์ฝ๋์ ungated ์ ์ฑ ๊ฐ์ค์น๋ผ๋ ์ธ์์ด, ์ฌ์ค์ ๊ฒ์ดํ ๋ ๋ฐฑ๋ณธ ์์ ์ ์๋ค. - ์ฌํ ์ง์
์ฅ๋ฒฝ์ด ๋ฌธ์์ ๋ฐ์๋ผ ์์ง ์๋ค. ์ HF ๊ฒ์ดํ
์ ๋ํด,
SETUP.md๊ฐ Docker๋ฅผ ์ ์ ํ๋๋ฐ ์ค์ ๋ก๋ ๋ถํ์ํ๊ณ (์คํ๋ คuv sync์ชฝ์ด ๋งค๋๋ฝ๋ค), ์ถ๋ก ํ์ง์ ์ข์ฐํ๋ \sigma_\text{min}=4๋ ๋ณ๋ ์ค์ ์ ์น์ด์ผ ์ ์ฉ๋๋ฉฐ ๋น ๋จ๋ ค๋ ์กฐ์ฉํ ๋์ด๊ฐ๋ค. ๋ ผ๋ฌธ์ ์ฌํ์ฑ ์ฃผ์ฅ๊ณผ ๋ ํฌ์ ์ค์ ์จ๋ณด๋ฉ ๊ฒฝํ ์ฌ์ด ๊ฐ๊ทน์ ์ ์ ํต์ ๋ฒ์ ์์ ๋ฌธ์ ๋ค. - ๋ ผ๋ฌธ์ด ๊ธฐ์ ํ ์ค์ ๊ณผ ๊ณต๊ฐ ์ค์ ์ด ๊ฐ์ง ์๋ค. ๊ฐ์ฅ ๋์ ๋๋ ๊ฒ์ ๊ฐ์นํจ์๋ค โ ๋ ผ๋ฌธ์ V(s')์ Q(s,a) ๋ ํํ๋ง ๋ ผํ๋๋ฐ, ๊ณต๊ฐ LIBERO/RoboCasa ์ค์ ์ s,a,s'๋ฅผ ๋ชจ๋ ์กฐ๊ฑด์ผ๋ก ๋ฐ๋ ์ 3์ ํํ๋ฅผ ์ฐ๊ณ ๊ทธ ์ฌ์ค์ด ๋ ผ๋ฌธ์ ์๋ค. ํ์ต \sigma_\text{max}=200, ๋ฏธ๋ ์ด๋ฏธ์ง ์ฌ๋กฏ์ ํ์ฌ ํ๋ ์ ๋ณต์ฌ๋ณธ์ผ๋ก ์ด๊ธฐํํ๋ ์ ํ๋ ๋ง์ฐฌ๊ฐ์ง๋ก ๋ ผ๋ฌธ์ ์๋ค(์ฝ๋ ๋์กฐ ์ โก~โฃ). ์ด๋ ๊ฒ๋ ๋ ผ๋ฌธ์ ๊ฒฐ๋ก ์ ๋ฌด๋๋จ๋ฆฌ์ง ์์ง๋ง, ๋ ผ๋ฌธ๋ง ๋ณด๊ณ ์ฌ๊ตฌํํ๋ฉด ์ ์๊ฐ ์ด ๊ฒ๊ณผ ๋ค๋ฅธ ๋ชจ๋ธ์ด ๋์จ๋ค. ์ฌํ์ฑ ์ง์ ์ด โ์ฝ๋๋ฅผ ๊ณต๊ฐํ๋คโ์์ ๋ฉ์ถ๊ณ โ๋ ผ๋ฌธ๊ณผ ์ฝ๋์ ์ค์ ์ฐจ์ดโ๋ฅผ ์ ๋ฆฌํด ์ฃผ์ง ์์ ๊ฒฐ๊ณผ๋ค.
- ํ๋๋์ง ์์ ๊ฐ์ด ํ๋์ฝ๋ฉ๋ผ ์๋ค. ๋ ธ์ด์ฆ ํผํฉ 0.7/0.3์ ๋ ผ๋ฌธ์ด ์ค์ค๋ก โํ๋ํ์ง ์์๋คโ๊ณ ๋ฐํ ๊ฐ์ธ๋ฐ ์ฝ๋์๋ ์กฐ๊ฑด๋ฌธ ๋ฆฌํฐ๋ด๋ก ๋ฐํ ์๋ค(๊ท ๋ฑ ๋ถํฌ ๊ฒฝ๊ณ๋ง ์ค์ ๊ฐ๋ฅ). ๊ฐ์น ์์๋ธ์ ์ฑ๊ณต ๋ฌธํฑ 0.05๋ ํจ์ ์ ์์๋ค. ์ ์๋ค์๊ฒ๋ ์ฌ์ํ ์ ํ์ด์๊ฒ ์ง๋ง, ์ด ๋ ผ๋ฌธ์ ํต์ฌ ๊ธฐ์ฌ ์ค ํ๋๊ฐ โ๋ก๋ด์ฉ์ผ๋ก ๋ ธ์ด์ฆ ์ค์ผ์ค์ ๋ฐ๊ฟจ๋คโ์ธ ์ด์ ๊ฐ์ฅ ๋จผ์ ablationํ์ด์ผ ํ ๋ ธ๋ธ๋ค.
- ์ฉ์ด ๋ถ์ผ์น์ ๋น๊ต ๊ณต์ ์ฑ์ ํ์์ง๋. ์๋ก ์ ALOHA ๊ฒฐ๊ณผ๋ฅผ โsuccess rate 93.6%โ๋ก, ํ๋ โAverage Scoreโ๋ก ๋ถ๋ฅธ๋ค. ๋ ALOHA์์ ๋ฒ ์ด์ค๋ผ์ธ๋ค์ ๋์ผ wall-clock(8รH100 48์๊ฐ) ์์ฐ์ ์ค ๊ฒ์ ๊ณต์ ํ ์ค๊ณ์ด์ง๋ง, ๊ทธ ๊ฒฐ๊ณผ gradient step ์๋ \pi_{0.5} 400K vs Cosmos Policy 50K๋ก 8๋ฐฐ ์ฐจ์ด๊ฐ ๋๋ค. โ๊ฐ์ ์๊ฐโ๊ณผ โ๊ฐ์ ํ์ต๋โ ์ค ๋ฌด์์ด ๊ณต์ ํ์ง๋ ๋ ผ์์ ์ด๊ณ , ๋ ผ๋ฌธ์ ์ ์๋ฅผ ํํ ์ด์ ๋ฅผ ๊ธธ๊ฒ ๋ ผํ์ง ์๋๋ค.
๊ด๋ จ ์ฐ๊ตฌ์์ ์๋ฆฌ ๋งค๊น

ALOHA ํ๊ฐ ์ด๊ธฐ ์กฐ๊ฑด(Fig. 10 ์ข: in-distribution / Fig. 11 ์ฐ: OOD). OOD๋ ๋ฏธํ์ต ํํฌ ํฐ์ ์ธ ยท๋ฏธํ์ต ์์ ์ฃผํฉ ๋ณผยท75% ์ฑ์์ง ๋ฏธํ์ต ํ๋ ์งํผ๋ฐฑยท์๊ฐ ๋ฐฉํด๋ฌผ ๋ฑ์ผ๋ก ๊ตฌ์ฑ๋๋ค.
Cosmos Policy๋ ์ธ ํ๋ฆ์ ๊ต์ฐจ์ ์ ์๋ค.
โ ๋น๋์ค ๋ชจ๋ธ ๊ธฐ๋ฐ ์ ์ฑ . 2๋จ๊ณ ํ์ดํ๋ผ์ธ(Video Prediction Policy, Video Policy, FlowVLA, VidAR)๊ณผ ํตํฉ video-action ๋ชจ๋ธ(UVA, UWM) ์ฌ์ด์์, โ์ฌ์ ํ์ต ๋น๋์ค ๋ชจ๋ธ + ๋จ์ผ ๋จ๊ณ + ๊ตฌ์กฐ ๋ณ๊ฒฝ ์์โ์ด๋ผ๋ ๋น์นธ์ ๋ฉ์ด๋ค. ๋ฐฑ๋ณธ์ธ Cosmos-Predict2 ๊ณ์ด ์์ฒด๋ Cosmos predict/transfer 2.5 ๋ฆฌ๋ทฐ์์ ๋ค๋ฃฌ ๋ฌผ๋ฆฌ AI์ฉ world foundation model ๋ผ์ธ์ด๊ณ , ์ด ๋ ผ๋ฌธ์ ๊ทธ ๋ชจ๋ธ์ ์๋นํ๋ ์ชฝ์ ์ฒซ ๋ํ ์ฌ๋ก์ ๊ฐ๊น๋ค.
โก VLA. RT-2ยทOpenVLAยท\pi_{0.5}ยทUniVLAยทCogVLA๋ก ์ด์ด์ง๋ ํ๋ฆ์ ๋ํด, ์ด ๋ ผ๋ฌธ์ โ๋ฐฑ๋ณธ์ ์ฌ์ ํ์ต modality๋ฅผ ๋ฐ๊พธ์โ๋ ๋ฐ๋ก ์ ๋์ง๋ค. ํนํ ์ก์ ํํ ์ธก๋ฉด์์ OpenVLA-OFT ๋ฆฌ๋ทฐ์ ๋๋นํ๋ฉด ์ ๋ช ํ๋ค โ OFT๋ L1 ํ๊ท + parallel decoding์ผ๋ก ์๋๋ฅผ, Cosmos Policy๋ diffusion ์์ฑ์ผ๋ก ๋ฉํฐ๋ชจ๋ฌ์ฑ์ ํํ๊ณ , Fig. 5๊ฐ ๊ทธ ์ ํ์ ์ค์ธ๊ณ ๋๊ฐ๋ฅผ ๋ณด์ฌ์ค๋ค.
โข ์๋๋ชจ๋ธยท๊ฐ์นํจ์ ๊ธฐ๋ฐ planning. DynaยทMBPOยทTD-MPCยทDreamer ๊ณ์ด์ ํ๋์ ํ์์ด๋, ๋ณ๋ ๋ชจ๋ ๋์ ๋จ์ผ ์ํคํ ์ฒ๋ฅผ ์ด๋ค๋ ์ ์ด ์ฐจ๋ณ์ ์ด๋ค. ๋ก๋ด์ฉ world model ์์ฒด๋ฅผ ํ์ฅํ๋ ์ฐ๊ตฌ(์: DreamDojo ๋ฆฌ๋ทฐ)๊ฐ โ๋ ์ข์ ์ธ๊ณ ์๋ฎฌ๋ ์ดํฐโ๋ฅผ ๋ชฉํ๋ก ํ๋ค๋ฉด, Cosmos Policy๋ โ์ ์ฑ ๊ณผ ๊ฐ์ ๋ชธ์ ์ฐ๋ ์ ๋นํ ์ข์ ์ธ๊ณ ๋ชจ๋ธโ์ ์งํฅํ๋ค โ ์ ํ๋๋ณด๋ค on-policy ์ ํฉ์ฑ๊ณผ ๊ตฌํ ๋จ์์ฑ์ ๋ฒ ํ ํ ์ ์ด๋ค.
์์ฝ
Cosmos Policy๋ โ์ก์ ์ ๋น๋์ค ๋ชจ๋ธ์ latent frame์ผ๋ก ์ทจ๊ธํ๋ฉด, ์ฌ์ ํ์ต๋ ๋น๋์ค ๋ชจ๋ธ์ ์๋ฌด ๊ฐ์กฐ ์์ด๋ ์ต๊ณ ์์ค์ ์กฐ์ ์ ์ฑ ์ด ๋๋คโ๋ ๊ฒ์ LIBERO 98.5%ยทRoboCasa 67.1%(50 ๋ฐ๋ชจ)ยท์ค์ธ๊ณ ALOHA ํ๊ท 93.6์ ์ผ๋ก ๋ณด์ธ ๋ ผ๋ฌธ์ด๋ค. ์ฌ๊ธฐ์ ๊ฐ์ ๋ชจ๋ธ์ด world model๊ณผ value function์ ๊ฒธํ๊ฒ ํด test-time best-of-N ํ์์ ๋ถ์ด๋ฉด, ์ด๋ ค์ด ํ์คํฌ์์ +12.5์ ์ ๋ ์ป๋๋ค.
๊ฐ์ฅ ๊ฐ์ง ๋ฐ๊ฒฌ์ ๋ฐฉ๋ฒ๋ก ์์ฒด๋ณด๋ค ablation์ด ๋๋ฌ๋ธ ์ด์ ๋ผ๊ณ ๋ณธ๋ค. ์ ์ฑ ์ด ์ก์ ๋ง ์์ธกํ๊ฒ ํ๋ฉด RoboCasa ์ฑ๋ฅ์ด 62.5 โ 44.4๋ก ๋ฌด๋์ง๋ค. ๋น๋์ค ๋ชจ๋ธ์ ๋ก๋ด์ ์ฐ๋ ์ด๋์ โ์ข์ ์ด๊ธฐ ๊ฐ์ค์นโ๊ฐ ์๋๋ผ ๋ฏธ๋๋ฅผ ๊ณ์ ์์ธกํ๊ฒ ๋ง๋๋ ํ์ต ์ ํธ์ ์๋ค๋ ๋ป์ด๊ณ , ์ด๋ ๋น๋์ค ๋ฐฑ๋ณธ์ ์ฐ๋ ํ์ ์ฐ๊ตฌ ๋ชจ๋์ ์ ์ฉ๋ ๋งํ ๊ตํ์ด๋ค. ๊ณต๊ฐ ์ฝ๋๊ฐ ์ด ํด์์ ๊ตณํ์ค๋ค โ ๋ ผ๋ฌธ์ด โauxiliary lossโ๋ผ ๋ถ๋ฅธ ๊ฒ์ ๋ํด์ง ํญ์ด ์๋๋ผ ๋์ง ์์ ์นธ์ด์๊ณ , ๊ทธ๋ฌ๋ ๊ทธ๊ฑธ ๊ป์ ๋์ ๋ถ๊ดด๋ ๋ณด์กฐ ์ ํธ์ ์์ค์ด ์๋๋ผ ๋ฐฑ๋ณธ์ด ํ๋ ์ผ์ ๋นผ์๊ธด ๊ฒฐ๊ณผ๋ก ์ฝ๋ ํธ์ด ๋ง๋ค.
ํ๊ณ๋ ๋ถ๋ช
ํ๋ค. OOD ์ผ๋ฐํ์์๋ ์ฌ์ ํ ๋๊ท๋ชจ ์ฌ์ ํ์ต VLA(\pi_{0.5})๊ฐ ์์๊ณ , planning์ H100 8์ฅ์ 4.9์ด๋ฅผ ์๊ตฌํ๋ฉฐ, ๊ทธ ๊ฒฐ๋ก ์ 2๊ฐ ํ์คํฌ subset์ ๊ธฐ๋ฐํ๋ค. ๊ทธ๋ผ์๋ ์ฝ๋ยท์ฒดํฌํฌ์ธํธยทํ์ต ๋ฐ์ดํฐ๊ฐ ๊ณต๊ฐ๋๊ณ (๋
ผ๋ฌธ ยง7, ์ฝ๋ Apache-2.0), ๊ณต์ ๋ ํฌ README ๊ธฐ์ค ์ถ๋ก ์ GPU 1์ฅ์ 6.0~8.9 GB VRAM์ด๋ฉด ๋์๊ฐ๋ค๊ณ ์๋ด๋ผ ์์ด, โ๋น๋์ค ํ์ด๋ฐ์ด์
๋ชจ๋ธ์ ์ ์ฑ
์ผ๋ก ์ด๋คโ๋ ์์ด๋์ด๋ฅผ ์ค์ ๋ก ๋ง์ ธ๋ณผ ์ ์๋ ๋ช ์ ๋๋ ์ถ๋ฐ์ ์ด ๋๋ค. ์ค์ ๋ก ์ค์น๊น์ง๋ uv sync ํ ๋ฒ์ผ๋ก ํต๊ณผํ๋ค.
๋ค๋ง ๊ทธ โ์ถ๋ฐ์ โ์ ํญ์ ์ ์งํ๊ฒ ์ขํ ๋งํด์ผ ํ๋ค. ํ์ต์ 8ร80GB H100์ด ์ต์ ๊ถ์ฅ์ด๊ณ ๋ ผ๋ฌธ ์คํ์ LIBERO 64 GPUยทRoboCasa 32 GPUยทALOHA 8 GPU๋ฅผ ๊ฐ๊ฐ 48์๊ฐ์ฉ ์ผ๋ค. ํ๊ฐ์กฐ์ฐจ ๋จ์ผ ์๋น์ GPU๋ก๋ LIBERO ํ suite์ ๋ฐ๋์ ์ด ๊ฑธ๋ ค ๋ ผ๋ฌธ ์์น ๊ฒ์ฆ์ด ํ์ค์ ์ด์ง ์๋ค. ๊ทธ๋ฆฌ๊ณ ๊ทธ ์์ ๊ฒ์ดํ ๋ ํ ํฌ๋์ด์ ๋ผ๋, ๋ฌธ์์ ์ ํ ์์ง๋ ์์ ๊ด๋ฌธ์ด ํ๋ ์ ์๋ค. ์์ด๋์ด๋ ๋์์ด ๋จ์ํ๋ฐ ๊ทธ๊ฒ์ ํ์ธํ๋ ๋น์ฉ์ ์ ํ ๋จ์ํ์ง ์๋ค๋ ์ ์ด, ์ด ๋ ผ๋ฌธ์ ์ฝ๊ณ ๋จ๋ ๋ง์ง๋ง ์ธ์์ด๋ค.