๐Bridging Language and Action ๋ฆฌ๋ทฐ
Xiangtong Yao, Hongkuan Zhou, Oier Mees, Yuan Meng (๊ณต๋ 1์ ์), Ted Xiao, Yonatan Bisk, Jean Oh, Edward Johns, Mohit Shridhar, Dhruv Shah, Jesse Thomason, Kai Huang, Joyce Chai, Zhenshan Bing, Alois Knoll
TUM ยท Bosch ยท UC Berkeley ยท Microsoft ยท Google DeepMind ยท CMU ยท Imperial College London ยท Princeton ยท USC ยท Sun Yat-sen ยท Michigan ยท Stuttgart ยท Nanjing
International Journal of Robotics Research (IJRR) ๊ฒ์ฌ ์น์ธ๋ณธ (๋ ผ๋ฌธ ํ์ง ๋ช ์), arXiv v1 2023-12-17 โ v7 2026-06-22, ๋ณธ๋ฌธ 50์ชฝ + ๋ถ๋ก/์ฐธ๊ณ ๋ฌธํ ํฌํจ 70์ชฝ
- ๐ก ์ธ์ด๋ก ๋ก๋ด์ ์กฐ์ข ํ๋ ์ฐ๊ตฌ๋ฅผ โ์๊ณ ๋ฆฌ์ฆ ํจ๋ฌ๋ค์(RL/IL/planning)โ์ด ์๋๋ผ โ์ธ์ด๊ฐ ์ ์ด ๋ฃจํ ์์์ ๋งก๋ ๊ธฐ๋ฅ์ ์ญํ โ ๋ก ๋ค์ ์๋ฅธ ์๋ฒ ์ด๋ค โ ๊ฐ์ RL์ด๋ผ๋ ์ธ์ด๊ฐ ๋ณด์์ ๋ง๋๋ ๊ฒ๊ณผ ์ ์ฑ ์ ์กฐ๊ฑดํํ๋ ๊ฒ์ ๊ทผ๋ณธ์ ์ผ๋ก ๋ค๋ฅธ ์ผ์ด๋ผ๋ ๊ด์ฐฐ์์ ์ถ๋ฐํ๋ค.
- โ๏ธ ๊ทธ ์ญํ ์ โถ ์ํ ํ๊ฐ(state evaluation) โท ์ ์ฑ ์กฐ๊ฑด(policy condition) โธ ์ธ์ง์ ๊ณํยท์ถ๋ก (cognitive planning and reasoning) โน ํตํฉ VLA(unified vision-language-action models) ๋ค ๊ฐ๋๋ก ๋๋๊ณ , ๊ฐ ๊ฐ๋๋ฅผ ๋ค์ ์๊ณ ๋ฆฌ์ฆ ๊ณ๋ณด๋ก ์ธ๋ถํ ๋ค, ์ด์ ์ง๊ตํ๋ 5๊ฐ ์ถ(action granularity ยท data and supervision regimes ยท system cost and latency ยท environments and evaluations ยท task specification)์ผ๋ก ๊ฐ๋ก์ง๋ฌ ๋น๊ตํ๋ค.
- ๐ฏ 4๊ฐ์ ๊ณ์ธต์ taxonomy ๊ทธ๋ฆผ + 5๊ฐ์ ๊ณ์ด๋ณ ๋ํ๊ธฐ๋ฒ ๋น๊ตํ + ๋ฒค์น๋งํฌยท์๋ฎฌ๋ ์ดํฐยท์ง์ฐ์๊ฐ ํ๋ฅผ ๊ฐ์ท๊ณ , 2018๋ ์ด๊ธฐ ํ์ ๊ธฐ๋ฐ ๊ธฐ๋ฒ๋ถํฐ 2026๋ VLA๊น์ง๋ฅผ ๋ถ๋ก ํ 2์ฅ์ผ๋ก ์ฐํํํ์ผ๋ฉฐ, ๋ง์ง๋ง์ โVLA๊ฐ ์ณ์ ๊ธธ์ธ๊ฐ / ์๋๋ชจ๋ธ์ด ์ณ์ ๊ธธ์ธ๊ฐ / ์ค์๊ฐ ์ ์ฝ ์๋์ ์ค์ผ์ผ๋ง์ด ๋์์ด ๋๋๊ฐโ ์ธ ๋ ผ์์ ์ ๋ฉด์ผ๋ก ๋ค๋ฃฌ๋ค.
๐ Ping Review
๐ Ping โ A light tap on the surface. Get the gist in seconds.
โ์ธ์ด๋ก ๋ก๋ด ํ์ ์ํค๋โ ์ฐ๊ตฌ๋ ์ง๋ 5๋ ๊ฐ ํญ๋ฐํ์ง๋ง, ๊ทธ ์งํ๋๋ฅผ ๊ทธ๋ฆฌ๋ ๋ฐฉ์์ ๋์ฒด๋ก ๋ ๊ฐ์ง์๋ค. ํ๋๋ ๋ชจ๋ธ ์ข ๋ฅ๋ก ์๋ฅด๊ธฐ(LLM ๊ธฐ๋ฐ / VLM ๊ธฐ๋ฐ / VLA ๊ธฐ๋ฐ), ๋ค๋ฅธ ํ๋๋ ๋ก๋ด ๋ชจ๋๋ก ์๋ฅด๊ธฐ(perception / planning / control). ์ด ์๋ฒ ์ด๋ ๋ ๋ค ๊ฑฐ๋ถํ๋ค. ์ ์๋ค์ ๊ด์ฐฐ์ ๋จ์ํ๊ณ ๋ ์นด๋กญ๋ค โ RL ๋ ผ๋ฌธ ๋ ํธ์ด ์๋๋ฐ ํ๋๋ LLM์๊ฒ ๋ณด์ ํจ์ ์ฝ๋๋ฅผ ์ฐ๊ฒ ํ๊ณ ๋ค๋ฅธ ํ๋๋ ์ธ์ด ์๋ฒ ๋ฉ์ ์ ์ฑ ์ ๋ ฅ์ ๋ฃ๋๋ค๋ฉด, โ๋ ๋ค RLโ์ด๋ผ๋ ๋ถ๋ฅ๋ ์๋ฌด๊ฒ๋ ์ค๋ช ํ์ง ๋ชปํ๋ค. ์ธ์ด๊ฐ ํ๋ ์ผ์ด ๋ค๋ฅด๊ธฐ ๋๋ฌธ์ด๋ค. ๊ทธ๋์ ์ด ์๋ฒ ์ด๋ โ์ธ์ด๊ฐ ์กฐ์(manipulation) ์ ์ด ๋ฃจํ์ ์ด๋์ ๋ค์ด๊ฐ๋๊ฐโ๋ฅผ ์ ์ผํ 1์ฐจ ๋ถ๋ฅ์ถ์ผ๋ก ์ผ๋๋ค.
๊ทธ ๊ฒฐ๊ณผ๊ฐ ์๋ ๊ทธ๋ฆผ์ด๋ค. ๋ก๋ด ์์คํ
์ Language / Perception / Control ์ธ ๋ชจ๋๋ก ๋๊ณ , ์ธ์ด๊ฐ ๋ค์ด๊ฐ๋ ์ง์ ์ โถ~โน๋ก ๋ฒํธ ๋งค๊ธด๋ค. โถ์ language โ perception(๊ด์ธก์ ์ ์๋ก), โท๋ language โ control(๊ด์ธก+์ง์๋ฅผ ํ๋์ผ๋ก), โธ์ among language(์ธ์ด ์์์์ ์ถ๋ก ), โน๋ ์ธ ๋ชจ๋์ ํ๋๋ก ์ ๋ ๊ฒ์ด๋ค.

์๋ฒ ์ด์ ๋ผ๋(Fig. 2) โ Language / Perception / Control ์ธ ๋ชจ๋๊ณผ, ์ธ์ด๊ฐ ๊ฐ์ ํ๋ ๋ค ์ง์ โถ state evaluation, โท policy condition, โธ cognitive planning & reasoning, โน unified VLA. ์ผ์ชฝ ๋ฃจํ๋ ์ฌ๋-๋ก๋ด ๋ํ, ์ค๋ฅธ์ชฝ ๋ฃจํ๋ ์์ด์ ํธ-ํ๊ฒฝ ์ ์ด ๋ฃจํ๋ค.
ํต์ฌ ๋ฐฉ๋ฒ๋ก :
๋ค ๊ฐ๋๋ ๊ฐ๊ฐ ํ๋์ โํต์ฌ ์ง๋ฌธโ์ผ๋ก ์ ์๋๋ค(์๋ฌธ Sec. 3์ ์์ ์ ๊ทธ๋๋ก ๋ฐ๋ฅธ๋ค).
| # | ๊ฐ๋ (์๋ฌธ ์ฉ์ด) | ํต์ฌ ์ง๋ฌธ | ์ธ์ด์ ์ถ๋ ฅ๋ฌผ | ํ์ ๊ณ๋ณด |
|---|---|---|---|---|
| โถ | Language for state evaluation (Sec. 4) | ์ด๋ค ์ํยท๊ฒฐ๊ณผ๊ฐ ๋ฐ๋์งํ์ง๋ฅผ ์ธ์ด๊ฐ ์ด๋ป๊ฒ ๊ท์ ํ๋๊ฐ (์งํ๋ ํผ๋๋ฐฑ) | ์ค์นผ๋ผ ๋ณด์ / ๋น์ฉ(3D value map) | Reward designing(sparseยทdense) โ Reward learning(IRL ๋ฑ) โ FM-driven generation ยท Cost mapping(specific textโcost, FM-driven) |
| โท | Language as a policy condition (Sec. 5) | ์ธ์ด๊ฐ ์ ์ฑ ์ ์ด๋ป๊ฒ ์กฐ๊ฑดํํด ์ฌ๋ฐ๋ฅธ ํ๋์ ๋ด๊ฒ ํ๋๊ฐ | ํ๋ a_t | RL โ Behavioral Cloning โ Diffusion-based Policy |
| โธ | Language for cognitive planning and reasoning (Sec. 6) | ๋ก๋ด์ด ์ธ์ด ๊ณต๊ฐ์์ ์ด๋ป๊ฒ โ์๊ฐโํด ์๊ธฐ ํ๋์ ๊ตฌ์กฐํํ๋๊ฐ | ์๋ธ๊ณจ / ๊ณํ / ์ฝ๋ / ์ฌ๋ณผ | Classic neuro-symbolic โ Empowered by LLMs โ Empowered by VLMs |
| โน | Language in unified VLA models (Sec. 7) | ๋น์ ยท์ธ์ดยทํ๋์ ํ๋์ ํ์ฅ ๊ฐ๋ฅํ ๋ชจ๋ธ๋ก ์ด๋ป๊ฒ ํตํฉํ๋๊ฐ | ์ก์ ํ ํฐ / ์ฐ์ ์ก์ ์ฒญํฌ | Perception โ Reasoning โ Action โ Adaptation |
์ฌ๊ธฐ์ ์ง๊ตํ๋ 5์ถ(Sec. 8)์ด ์นํ๋ค: action granularity(skill-level / trajectory-level / low-level control), data and supervision regimes, system cost and latency, environments and evaluations, task specification(์ธ์ด vs. ์ด๋ฏธ์ง/์์). ์ด 5์ถ์ โ์ธ์ด๊ฐ ์ด๋ ๋ค์ด๊ฐ๋๊ฐโ์ ๋ฌด๊ดํ๊ฒ ์ค์ ๋ฐฐ์น ๊ฐ๋ฅ์ฑ์ ๊ฒฐ์ ํ๋ ๊ณตํ์ ์ ํ์ ๋น๊ตํ๊ธฐ ์ํ ์ฅ์น๋ค.
์์์ ์ผ๋ก๋ โท๊ฐ ๊ฐ์ฅ ๋ช ๋ฃํ๋ค. ๋ชฉํ ์กฐ๊ฑด IL(GCIL)์์ ๋ชฉํ g ์๋ฆฌ์ ์ธ์ด ์ง์ l์ ๋ผ์ ๋ฃ๋ ๊ฒ์ด ์ถ๋ฐ์ ์ด๊ณ ,
\mathcal{L}_{\text{BC}}(\theta, D) = \mathbb{E}_{(s_t^j,\,a_t^j,\,g^j)\sim D}\Big[\big\|\pi_\theta(s_t^j, g^j) - a_t^j\big\|_2^2\Big] \quad\Longrightarrow\quad \pi_\theta(a_t \mid s_t, l)
์ด ์๊ฐ ์ธ์ด์ ์ง์๊ฐ goal specifier์์ behavior specifier๋ก ๋ฐ๋๋ค๋ ๊ฒ์ด Sec. 5์ ํ ์ค ์์ฝ์ด๋ค. ๊ทธ๋ฆฌ๊ณ Sec. 8์ ์ธ ๊ณ์ด์ ํ์ต ์ ํธ๋ฅผ ํ๋์ ๋ชฉ์ ํจ์๋ก ๋ฌถ๋๋ค:
\mathcal{L}_{\text{final}} = \lambda_1 \mathcal{L}_{\text{targets}} + \lambda_2 \mathcal{L}_{\text{evaluations}} + \lambda_3 \mathcal{L}_{\text{auxiliary}}
\mathcal{L}_{\text{targets}}๋ per-sample ์ ๋ต(ํ๋ยท์๋ธ๊ณจยท์ฑ๊ณต ๋ผ๋ฒจ) ๋ชจ์ฌ, \mathcal{L}_{\text{evaluations}}๋ ์คํ์์ ๋์จ ์ค์นผ๋ผ ํ๊ฐ(๋ณด์ยท์ ํธยท์ฑ๊ณต), \mathcal{L}_{\text{auxiliary}}๋ ์๊ธฐ์ง๋(visual attention / reconstruction / future prediction). ์ ์๋ค์ด ์ ์ํ๋ ํํ ์ปค๋ฆฌํ๋ผ์ โ\lambda_1์ ํฌ๊ฒ ๋๊ณ ๋ชจ๋ฐฉ์ผ๋ก warm-start โ \lambda_2๋ฅผ ์ฌ๋ฆฌ๋ฉฐ \lambda_1์ ๋ฎ์ถฐ ๊ฒฐ๊ณผ ํ๊ฐ๋ก ๊ฐ๊ฑดํ โ \lambda_3๋ ์์ง๋ง 0์ด ์๋๊ฒ ๊ณ์โ์ด๋ค.
์ฃผ์ ๊ฒฐ๊ณผ(์๋ฒ ์ด์ด๋ฏ๋ก โ์ ๋ฆฌ๋ฌผ์ ๊ท๋ชจโ๋ก ์ฝ๋๋ค):
- ๋ถ๋ฅ ๊ทธ๋ฆผ 4์ฅ: Sec. 4ยท5ยท6ยท7 ๊ฐ๊ฐ์ ์ ์ฉ taxonomy ๊ทธ๋ฆผ(Fig. 5, 6, 9, 16)์ด ๋ถ๋๋ค. ๊ณ์ด๋ณ โ์ฝ์ด ์์ด๋์ดโ ํ ์ค์ด ๊ทธ๋ฆผ ์์ ๋ฐํ ์์ด(์: Sec. 5๋ โlanguage instructs how to doโ) ์ถ์ด ๋ฌด์์ ๊ฐ๋ฅด๋์ง ํท๊ฐ๋ฆฌ์ง ์๋๋ค.
- ๋ํ๊ธฐ๋ฒ ๋น๊ตํ 4์ฅ: Table 2~5๋ ๊ฐ ๊ฐ๋์์ ๋ํ ๊ธฐ๋ฒ 5~8๊ฐ๋ฅผ ๋ฝ์
ํต์ฌ ๋ฉ์ปค๋์ฆ / ์ฃผ์ ์ฅ์ / ์ฃผ์ ๋จ์ ์ ๋๋ํ ๋๋๋ค. ๋จ์ ์นธ์ด ๋น์ด ์์ง ์๋ค๋ ์ ์ด ์ด ์๋ฒ ์ด์ ๋ฏธ๋์ด๋ค. - ์ค์ธก ์งํฅ ํ: Table 6์ ํ๋ผ๋ฏธํฐ ์ยทํ๋์จ์ดยท์ ์ด ์ฃผํ์ยทํด๋ผ์ฐ๋ ์์กด ์ฌ๋ถ๋ฅผ ํ ํ์ ๋ชจ์๋ค(RT-1 35M ~3Hz, OpenVLA 7B/RTX4090 3โ6Hz, Diffusion Policy ~200M* ~1Hz, ManiCM ~200M*/RTX4090 ~50โ60Hz ๋ฑ). Table 7์ ์๋ฎฌ๋ ์ดํฐ 6์ข , Table 8์ ๋ฒค์น๋งํฌ 11์ข ์ ๊ด์ธก ๋ชจ๋ฌ๋ฆฌํฐยท๋ฐ์ดํฐ ๊ท๋ชจ๊น์ง ํฌํจํด ๋น๊ตํ๋ค.
- ์ฐํ: ๋ถ๋ก Table 11ยท12๊ฐ 2018๋
(IPRO, exePlan ๋ฑ ํ์/LSTM ์๋)๋ถํฐ 2026๋
(AffordanceGrasp-R1)๊น์ง 100ํธ ์ด์์
์ฐ๋ / ๋ฒค์น๋งํฌ / ์๋ฎฌ๋ ์ดํฐ / ์ธ์ด ๋ชจ๋ / ์ธ์ ๋ชจ๋ / ์ค๊ธฐ ์คํ ์ฌ๋ถ / FMยทRLยทILยทMP ์ฌ์ฉ ์ฌ๋ถ๋ก ํ์คํํด ๋์ดํ๋ค. - ๋ ผ์ 3์ (Sec. 9): VLA ์ค์ผ์ผ๋ง, ์๋๋ชจ๋ธ, ์ค์๊ฐ ์ ์ฝ โ ๊ฐ๊ฐ์ ๋ํด ์ฐฌ๋ฐ ๊ทผ๊ฑฐ๋ฅผ ๋ชจ๋ ์ ๊ณ ๊ฒฐ๋ก ์ ์ ๋ณดํ๋ค.
๊ฒฐ๋ก :
์ด ์๋ฒ ์ด์ ๊ฐ์ โ๋ ผ๋ฌธ ๋ชฉ๋กโ์ด ์๋๋ผ ์๋ฅด๋ ์นผ์ ์๋ค. ์ธ์ด๊ฐ ๋ณด์์ด ๋๋๊ฐ, ์กฐ๊ฑด์ด ๋๋๊ฐ, ๊ณํ์ด ๋๋๊ฐ, ์๋๋ฉด ์์ ์ก์ ๊ณผ ํ ๋ชธ์ด ๋๋๊ฐ โ ์ด ๋ค ์ง๋ฌธ์ ์ค์ ๋ก ์๋ก ๋ค๋ฅธ ๋ณ๋ชฉ๊ณผ ๋ค๋ฅธ ์คํจ ์์์ ๊ฐ๋๋ค(โถ์ ๋ณด์ ์ฝ๋์ ์ทจ์ฝ์ฑ, โท๋ ์ํ ๋นํจ์จ๊ณผ ์ถ๋ก ์ง์ฐ, โธ์ ํ๊ฐ๊ณผ ๊ทธ๋ผ์ด๋ฉ, โน๋ ๋ฐ์ดํฐ ๊ท๋ชจ์ catastrophic forgetting). ๋ฐ๋๋ก ์ด ์๋ฒ ์ด๋ โ์ด๋ค ๋ฐฉ๋ฒ์ด ์ผ๋ง๋ ์ํ๋๊ฐโ์ ๋ํด์๋ ์ ๋ ๋น๊ต๋ฅผ ๊ฑฐ์ ์ ๊ณตํ์ง ์๋๋ค โ ๋ฒค์น๋งํฌ๊ฐ ์ ๊ฐ๊ฐ์ด๋ผ ๊ทธ๋ด ์ ์๋ค๋ ๊ฒ์ด ์ ์๋ค์ ์ ์ฅ์ด๊ณ , ๊ทธ ์์ฒด๊ฐ ์ด ๋ถ์ผ์ ์ง๋จ์ด๊ธฐ๋ ํ๋ค.
๐ Ring Review
๐ Ring โ An idea that echoes. Grasp the core and its value.
ํ ์ค๋ก ์์ํ๋ฉด
โlanguage-conditioned manipulation์ ํ๋์ ๋ฌธ์ ๊ฐ ์๋๋ผ ๋ค ๊ฐ์ ๋ฌธ์ ๋คโ โ ์ด๊ฒ์ด ์ด ์๋ฒ ์ด๊ฐ ํ๋ ์ ์ผํ๊ณ ๋ ์ถฉ๋ถํ ์ฃผ์ฅ์ด๋ค.
๊ธฐ์กด ์๋ฒ ์ด๋ค์ ๋์ฒด๋ก โ๋ฌด์์ผ๋ก ๋ง๋ค์๋๊ฐโ(LLM/VLM/VLA)๋ โ์ด๋ ๋ชจ๋์ธ๊ฐโ(perception/planning/control)๋ก ์ ๋ฆฌํ๋ค. ๊ทธ๋ฌ๋ฉด SayCan๊ณผ Text2Reward๊ฐ โ๋ ๋ค LLM ํ์ฉโ์ผ๋ก ๋ฌถ์ด๊ณ , PerAct์ ฯ0๊ฐ โ๋ ๋ค policyโ๋ก ๋ฌถ์ธ๋ค. ์ค์ ๋ก ์ด ์กฐํฉ๋ค์ ์๋ก ๋ฐฐ์ธ ๊ฒ์ด ๊ฑฐ์ ์๋ค. ๋ฐ๋๋ก ์ด ์๋ฒ ์ด์ ์ถ์ผ๋ก ์๋ฅด๋ฉด Text2Reward๋ EUREKAยทVoxPoser์ ํ ๋ฐฉ์ ๋ค์ด๊ฐ๊ณ (๋ชจ๋ โ์ธ์ดโ์ ๋ ํจ์โ), SayCan์ SayPlanยทCode as Policies์ ํ ๋ฐฉ์ ๋ค์ด๊ฐ๋ค(๋ชจ๋ โ์ธ์ด ์์์์ ๊ณํโ). ๊ฐ ๋ฐฉ ์์์๋ ์ค์ ๋ก ๊ฐ์ ๋ณ๋ชฉ์ ๋ค๋ฅด๊ฒ ๊ณต๊ฒฉํ ๊ณ๋ณด๊ฐ ๋ณด์ธ๋ค. ์ด ์๋ฒ ์ด๋ฅผ ์ฝ๋ ๊ฐ์ ๊ทธ ๊ณ๋ณด๋ฅผ ๋ฐ๋ผ๊ฐ๋ ๋ฐ ์๋ค.
์ ๋ ์๋ฒ ์ด์ธ๊ฐ โ ๊ธฐ์กด ์๋ฒ ์ด์์ ์ฐจ์ด (Sec. 1.2)
์ ์๋ค์ ์๊ธฐ ์๋ฆฌ๋ฅผ ๋ช ์์ ์ผ๋ก ์ก๋๋ค. LLM ์ด์ ์๋ Tellex et al. (2020)์ด โlexically groundedโ vs โlearning methodsโ ๊ฐ์ ๊ธฐ์ ์ ํ ๋๋ก ์ธ์ด ๊ทธ๋ผ์ด๋ฉ์ ์ ๋ฆฌํ๋ค. LLM ์ดํ์ ์๋ฒ ์ด๋ค(Hu et al. 2023; Li et al. 2024a; Xiao et al. 2025)์ ํ์ด๋ฐ์ด์ ๋ชจ๋ธ์ ๋ชจ๋ธ ์ข ๋ฅ์ ๋์ฒด๋๋ ๋ก๋ด ๋ชจ๋๋ก ์กฐ์งํ๊ณ , Firoozi et al. (2025)์ โPerception / Decision-making / Controlโ์ด๋ผ๋ ์ผ๋ฐ ๋ก๋ณดํฑ์ค ๋ฅ๋ ฅ์ผ๋ก ์กฐ์งํ๋ค.
์ด ์๋ฒ ์ด๋ ์๊ธฐ ๊ด์ ์ โdistinct and orthogonalโํ๋ค๊ณ ํํํ๋ค. ์ฆ ๊ธฐ์กด ์ถ์ ๋ถ์ ํ๋ ๊ฒ์ด ์๋๋ผ ์ง๊ตํ๋ ์ถ์ ํ๋ ๋ ๋๋๋ค๋ ์ฃผ์ฅ์ด๋ค. ์ค์ ๋ก ๊ทธ ์ง๊ต์ฑ ๋๋ฌธ์ Sec. 8์ด ํ์ํด์ง๋ค โ ๊ธฐ๋ฅ์ ์ญํ ๋ก ์๋ฅธ ๋ค, ๊ณตํ์ ์ถ(granularity/data/cost/eval/spec)์ผ๋ก ๋ค์ ๊ฐ๋ก์ง๋ฅด๋ ๊ตฌ์กฐ๋ค.
๐ก ์ฐธ๊ณ ๋ก ์ด ๋ธ๋ก๊ทธ์๋ ๋ชจ๋ธ ์ข ๋ฅ ์ถ์ผ๋ก ์ ๋ฆฌํ VLA for Embodied AI ์๋ฒ ์ด ๋ฆฌ๋ทฐ์, ์กฐ์ ๋์ ์ถ์ผ๋ก ์ ๋ฆฌํ Dexterous Imitation Learning ์๋ฒ ์ด ๋ฆฌ๋ทฐ๊ฐ ์ด๋ฏธ ์๋ค. ์ด ์ธ ํธ์ ๊ฒน์น๊ธฐ๋ณด๋ค ์๋ก ๋ค๋ฅธ ์นผ๋ก ๊ฐ์ ๋ฉ์ด๋ฆฌ๋ฅผ ์๋ฅธ ๊ฒ์ ๊ฐ๊น๋ค.
๋ฐฐ๊ฒฝ: ์ ํํ ์ธ์ด์ธ๊ฐ (Sec. 1)
Sec. 1์ โ์ธ์ด ์กฐ๊ฑดํโ์ ๊ทผ๊ฑฐ๋ฅผ ์ธ ๊ฐ์ง๋ก ์ ๋ฆฌํ๋ค. ํฅ๋ฏธ๋ก์ด ๊ฒ์ ์ ์๋ค์ด ์ธ์ด๋ฅผ ์ด๋ฏธ์ง/์์ ์กฐ๊ฑดํ์ ๊ฒฝ์ ๊ด๊ณ๊ฐ ์๋๋ผ ์๋ณด ๊ด๊ณ๋ก ๋๊ณ ์์ํ๋ค๋ ์ ์ด๋ค(์ด ์ ์ ๋ Sec. 8.5์์ ๋ค์ ํ์๋๋ค).
- Accessibility and usability โ Tellex et al. (2020)์ ํํ์ ์ธ์ฉํ๋ค: โmost future robot users will not be programmers.โ ์ธ์ด๋ GUI๋ ์คํฌ๋ฆฝํธ ์์ด ๋ชฉํ๋ฅผ ์ง์ ํ๊ฒ ํ๋ โzero-learningโ ์ธํฐํ์ด์ค๋ค.
- Trust through bidirectional communication โ ๋ช ๋ น์ ์ฃผ๋ ์ฑ๋์ด ๊ณง ์ ์ ยทํด๋ช ์ ๋ฐ๋ ์ฑ๋์ด ๋๋ค. ์ฌ์ฉ์๊ฐ โI have a trach and have to eat slowlyโ ๋ผ๊ณ ๋งํ๋ฉด ๋ก๋ด์ด ๊ทผ๊ฑฐ๋ฅผ ๋๋๋ ค์ค ์ ์๋ค๋ ๊ฒ.
- Transferring textual knowledge to robotics โ โstack the two lightest boxesโ ๊ฐ์ ๋ช ๋ น์ ์ง๊ฐ ์ง์ + ๊ด๊ณ ์ถ๋ก + ์คํฌ ์ํ์ค๋ก ๋ถํด๋๋ค. ์ธ์ด๋ ๋ฌผ์ฑยท์ ์ฐจยท์์ ๊ท์น ๊ฐ์ ์์์ ์ ์ด๊ณ๋ก ์์ ํ๋ ์์ถ ์ธํฐํ์ด์ค๋ค.
๊ทธ๋ฆฌ๊ณ ์ด ์๋ฒ ์ด์ ํต์ฌ ํ๋ ์ด๋ฐ์ด ๋์จ๋ค: ์ธ์ด๋ ์ธ๋ถ ํ์คํฌ ๋ช ์ธ์ผ ๋ฟ ์๋๋ผ ๋ก๋ด ์ถ๋ก ์ ๋ด๋ถ ์ธ์ง ๋งค์ฒด์ด๊ธฐ๋ ํ๋ค. โธ์ด ๋ณ๋ ๊ฐ๋๋ก ์กด์ฌํ๋ ์ด์ ๊ฐ ์ฌ๊ธฐ ์๋ค.
๊ณตํต ์ธ์ด: ์๋ฒ ์ด๊ฐ ๊น์๋๋ ์์ ๊ธฐ์ด (Sec. 2)
Sec. 2๋ MDP โ RL(๊ฐ์นํจ์, ๋ฒจ๋ง) โ IL(BC / GCIL / IRL) โ diffusion policy โ KBยทKGยทKGE โ ๋ฉํฐ๋ชจ๋ฌ ์ตํฉ โ ์ธ์ด๋ชจ๋ธ ๊ณ๋ณด(NLM โ PLM โ LLM โ VLM โ VLA)๋ฅผ ์์ถํด ๊น๋ค. ์๋ฒ ์ด ์น๊ณ ์์์ ์ฑ์คํ ์ ์ด๋ ํธ์ด๊ณ , ๋ค ์ ๋ค์ด ์ด ๊ธฐํธ๋ฅผ ์ฌ์ฌ์ฉํ๋ฏ๋ก ๊ฑด๋๋ฐ๋ฉด ์ํด๋ค. ํนํ ์ธ ๋๋ชฉ์ด ๋ค์์ ๊ณ์ ์ฐ์ธ๋ค.
(a) GCIL๊ณผ hindsight relabeling. ๋ชฉํ ์กฐ๊ฑด ์ค์ ์์ ๋ณด์์ ์ง์ํจ์๋ก ์ ์๋๋ค.
r(s_t, a_t, s_{t+1}, g) = \mathbb{1}\big[s_{t+1} = g\big]
๊ทธ๋ฆฌ๊ณ ์ ์ด (s_t^j, a_t^j, s_{t+1}^j, g^j)๋ (s_t^j, a_t^j, s_{t+1}^j,\, g'=s_{t+k}^j)๋ก ์ฌ๋ผ๋ฒจ๋ง๋ ์ ์๋ค. HER(Andrychowicz et al. 2017)๊ณผ ๊ฐ์ ์๋ฆฌ๋ค. ์ด ๊ด์ ์ด ๋ค์์ โplay data๋ฅผ ์ฌํ์ ์ธ์ด๋ก ๋ผ๋ฒจ๋งํด ์ด๋คโ(Learning from Play, MCIL)๋ก ์ด์ด์ง๋ค.
(b) ํ์ฐ ์ ์ฑ ์ ๋ ๋จ๊ณ. ์ญ๋ฐฉํฅ(denoising) ๊ฐฑ์ ๊ณผ ํ์ต ๋ชฉ์ :
\boldsymbol{A}_t^{k-1} = \alpha\big(\boldsymbol{A}_t^{k} - \gamma\,\varepsilon_\theta(\boldsymbol{O}_t, \boldsymbol{A}_t^k, k)\big) + \mathcal{N}(0, \sigma^2 I)
\mathcal{L} = \mathbb{E}_{k,\varepsilon}\Big[\big\|\varepsilon - \varepsilon_\theta(\boldsymbol{O}_t,\ \boldsymbol{A}_t^0 + \varepsilon,\ k)\big\|_2^2\Big]
์ฌ๊ธฐ์ k๊ฐ ๋ฐ๋ณต ํ์๋ผ๋ ์ฌ์ค์ด Sec. 5.3ยท8.3์ โinference latencyโ ๋ ผ์์ Table 6์ Diffusion Policy ~1Hz ์์น๋ก ์ง๊ฒฐ๋๋ค.
(c) ์ง์ ๊ทธ๋ํ. \mathcal{G} \subseteq \mathcal{E} \times \mathcal{R} \times \mathcal{E}, ์๋ฒ ๋ฉ์ M_\theta:\mathcal{E}\cup\mathcal{R}\to\mathbb{R}^d. Sec. 6.1(neuro-symbolic)์ ์ ์ ์ด์, ๊ทธ ๊ณ์ด์ด ์ ํ์ฅ๋์ง ์๋์ง(KG ๊ตฌ์ถ ๋น์ฉ)์ ๊ทผ๊ฑฐ๋ค.
๋ถ๋ฅ์ฒด๊ณ โ ์ถ์ด ์ค์ ๋ก ๋ฌด์์ ๊ฐ๋ฅด๋๊ฐ (Sec. 3)
Sec. 3์ ์งง์ง๋ง ์ด ์๋ฒ ์ด์์ ๊ฐ์ฅ ์ค์ํ ์ ์ด๋ค. ์ ์๋ค์ ๋ฌธ์ฅ์ ๊ทธ๋๋ก ์ฎ๊ธฐ๋ฉด: โan RL agent might use language to shape its reward function or, in a completely different manner, to directly condition its policy learning. Although both involve RL methods, the function of language is fundamentally different.โ
๊ทธ๋ฆฌ๊ณ ์๋ ๊ทธ๋ฆผ์ด ์ ์ฒด ์ง๋๋ค. ์ผ์ชฝ๋ถํฐ โถโทโธ์ด ๋์ด๊ณ , โธ์ โEmpowered by VLMsโ ๋ฐ์ค์์ ์๋๋ก ํ์ดํ๊ฐ ๋ด๋ ค์ โน๋ก ์ฐ๊ฒฐ๋๋ค(โVLMs drivenโ). ์ฆ ์ ์๋ค์ VLA๋ฅผ ๊ฐ์๊ธฐ ๋ฑ์ฅํ ๋ณ์ข ์ด ์๋๋ผ VLM ๊ธฐ๋ฐ ๊ณํยท์ถ๋ก ๊ณ์ด์ ์ฐ์ฅ์ ์ผ๋ก ๋ฐฐ์นํ๋ค.

์ ์ฒด ์ง๋(Fig. 3) โ ๋ค ๊ฐ๋์ ๊ทธ ์๋ ๊ณ๋ณด, ๊ทธ๋ฆฌ๊ณ ๊ฐ ์นธ์ ๋ฐฐ์น๋ ๋ํ ์ฐ๊ตฌ๋ค. ์ขํ๋จ ๋ฒ๋ก์ ์์ด์ฝ(Expert Designed / Demonstrations / Knowledge Base)์ ๊ฐ ๊ณ์ด์ด ๋ฌด์์ ์์กดํ๋์ง๋ฅผ ํ์ํ๋ค. โน ๋ฐ์ค ์์ 4๊ฐ ๋ถ๋ฆฟ(Perception / Reasoning / Action / Adaptation)์ด Sec. 7์ ํ์ ์ถ์ด๋ค.
์ด ๊ทธ๋ฆผ ํ ์ฅ์ด ์๋ฒ ์ด ๋ณธ๋ฌธ 40์ชฝ์ ๋ชฉ์ฐจ๋ค. ๋์ด๋ ์ด๋ฆ์ ๋ค ์ ํ์๋ ์๊ณ , ์นธ์ ๊ตฌ์กฐ๋ฅผ ๋ณด๋ฉด ๋๋ค. ์๋ฅผ ๋ค์ด โถ์ Reward Design/Learning๊ณผ Cost Functions Mapping ๋๋ก ๊ฐ๋ฆฌ๋๋ฐ, ์ ์๋ ํ์ต ๊ธฐ๋ฐ ์์ด์ ํธ(RL)๋ฅผ, ํ์๋ ์ต์ ํ ๊ธฐ๋ฐ ๋ชจ์
ํ๋๋๋ฅผ ๊ฒจ๋ฅํ๋ค. ๊ฐ์ โ์ธ์ดโ์ซ์โ์ธ๋ฐ ์๋น์๊ฐ ๋ค๋ฅด๋ค.
โถ ์ธ์ด๋ก ์ํ๋ฅผ ํ๊ฐํ๋ค (Sec. 4)
ํต์ฌ ์ง๋ฌธ: ์ธ์ด๋ฅผ ์ด๋ป๊ฒ โํ์คํฌ ์งํ๋โ์ ์ ๋ ํจ์๋ก ๋ฐ๊ฟ ๊ฒ์ธ๊ฐ.

Sec. 4์ taxonomy(Fig. 5) โ Reward Functions(4.1: Reward Design / Reward Learning / FM-driven Learning)์ Cost Functions(4.2: Specific Text2value Mapping / FM-driven Cost Mapping). ๊ทธ๋ฆผ ํ๋จ์ ์ฝ์ด ์์ด๋์ด๊ฐ ๋ช ์๋ผ ์๋ค: โLanguage to quantify task progress.โ
4.1 ๋ณด์: ์์์ ์ค๊ณ โ ๋ฐ์ดํฐ ํ์ต โ ํ์ด๋ฐ์ด์ ๋ชจ๋ธ ์์ฑ
์ด ์ ์ ์์ฌ๋ โ๋ณด์ ์ค๊ณ ๋ ธ๋์ ๋๊ฐ ๋์ ํ๋๊ฐโ์ 3์ธ๋ ๊ต์ฒด๋ค.
- 1์ธ๋ โ ์ธ์ดโ๋ณด์ ์ ํธ ์ค๊ณ. ZSRM(Mahmoudieh et al. 2022)์ ์นด๋ฉ๋ผ ์ด๋ฏธ์ง์ ๋ชฉํ ํ ์คํธ๋ฅผ CLIP ์ธ์ฝ๋๋ก ์ธ์ฝ๋ฉํด ์ ์ฌ๋๋ฅผ ๋ณด์์ผ๋ก ์ด๋ค. ์ถ๊ฐ ํ์ต ์์ด ์ ๋ชฉํ๋ฅผ ์ง์ ํ ์ ์์ง๋ง, CLIP์ ๊ณต๊ฐ ์ถ๋ก ๋ฅ๋ ฅ์ด ์ํ์ด ๋๋ค. ๋ฐ์ง ๋ณด์ ์ชฝ์์๋ PixL2R(Goyal et al. 2021)์ด (์ธ์ด, ๊ถค์ ) ์์์ relatedness ๋ชจ๋ธ์ ํ์ตํด ๋งค ์คํ shaping ๋ณด์์ ๋ง๋ ๋ค โ ํ์ต ํจ์จ์ ํฌ๊ฒ ์ค๋ฅด์ง๋ง ์ ๋ ์ ์๋ฅผ ์ ๋ต์ผ๋ก ์ผ๋ ํ๊ท/๋ถ๋ฅ ๋ชฉ์ ์ด๋ผ ํ์คํฌ ์งํ์ ์จ์ ํ ๋ด์ง ๋ชปํ๋ค.
- 2์ธ๋ โ ๋ณด์ ํจ์ ํ์ต. LOREL(Nair et al. 2022)์ ์ด๊ธฐ ์ํ s_0, ํ์ฌ ์ํ s, ์ง์ l์ ๋ฐ์ โ์ด ๊ถค์ ์ด ์ง์๋ฅผ ๋ง์กฑํ๋๊ฐโ๋ฅผ ํ๋ณํ๋ ์ด์ง ๋ถ๋ฅ๊ธฐ R(s_0, s, l)์ ์คํ๋ผ์ธ ์์ฐ์ผ๋ก ํ์ตํ๋ค. IRL ๊ณ์ด(Fu et al. 2019; MacGlashan et al. 2015)์ ์์ฐ์์ ๋ณด์ ๊ตฌ์กฐ๋ฅผ ์ญ์ถ๋ก ํ๋ค. ์๋ฒ ์ด๊ฐ ์ง๋ ํ๊ณ๊ฐ ๊ตฌ์ฒด์ ์ด๋ค โ โsort out the kitchen table and wiping a stainโ ๊ฐ์ ๋ณตํฉ ํ์คํฌ์์๋ ์ ๋ฌธ๊ฐ ์์ฐ์ ๊ถค์ ๋ถํฌ ์์ฒด๊ฐ ํฌ๊ฒ ๊ฐ๋ผ์ ธ์ ์ง์ง ๋ชฉํ์ ํ์ ์๊ด์ ๊ตฌ๋ถํ ๋ณด์์ ๋ฐฐ์ฐ๊ธฐ ์ด๋ ต๋ค.
- 3์ธ๋ โ FM์ด ๋ณด์์ ๋ง๋ ๋ค. Kwon et al. (2023)์ GPT-3์ ํ๋ก์ ๋ณด์์ผ๋ก ๊ทธ๋๋ก ์ด๋ค(๊ถค์ ์์ฝ์ ๋ฃ๊ณ โ๋ชฉํ๋ฅผ ๋ง์กฑํ๋๊ฐโ๋ฅผ ๋ฌป๋๋ค). Language2Reward(Yu et al. 2023c)์ Text2Reward(Xie et al. 2024)๋ LLM์๊ฒ ์คํ ๊ฐ๋ฅํ Pythonic ๋ณด์ ์ฝ๋๋ฅผ ์ฐ๊ฒ ํ๋ค. EUREKA(Ma et al. 2024)๋ RL ์ฑ๋ฅ์ fitness๋ก ์ผ์ ๋ณด์ ํ๋ก๊ทธ๋จ ์ง๋จ์ ์งํ์ ์ผ๋ก ๊ฐ์ ํ๋ค.
์ฌ๊ธฐ์ ์๋ฒ ์ด๊ฐ ์ ์ก์๋ธ ์ง์ : ์ฝ๋ ์์ฑ์ ๋ฌธ์ ๋ฅผ ์ฎ๊ฒผ์ ๋ฟ ์์ ์ง ์์๋ค. ์์ฑ๋ ๋ณด์ ์ฝ๋๋ Reward = 0.8รgrasp_success โ 0.2รdist_to_cube ์ฒ๋ผ ์ ์ ์ธ ์์น ๊ฐ์ค์น๋ฅผ ๊ฐ๊ณ , ์ด์์ด ์ทจ์ฝํ ํผ์ฒ๋ฅผ ๊ณ ๋ฅด๋ฉด RL์ด ์์ ํ์ตํ์ง ๋ชปํ๋ค. ๊ทธ๋์ ๋ค์ ์ธ๋๊ฐ ๋์จ๋ค โ Reward-Self-Align(Zeng et al. 2024)์ LLM์ด ํผ์ฒ ํ
ํ๋ฆฟ์ ์ฐ๊ฒ ํ๊ณ ์ค์ ๋กค์์์ ์๋ ๋ญํน์ผ๋ก ํ๋ผ๋ฏธํฐ๋ฅผ ์ ๋ ฌํ๋ฉฐ, R*(Li et al. 2025a)๋ ๊ตฌ์กฐ ์งํ์ ๊ฐ์ค์น ์ ๋ ฌ์ ๋ถ๋ฆฌํด ํฌ๋ฆฌํฑ์ด ๋ณด์ ๊ฐ์ค์น๋ฅผ ์ฌ๋ ์ ํธ์ ๋ง์ถ๋ค.
๋ ํ๋์ ์ถ์ ํน๊ถ ์ ๋ณด ์์กด์ด๋ค. LLM ์ฝ๋ ๊ณ์ด์ ์๋ฎฌ๋ ์ดํฐ ์ํ์ ์ ๊ทผํด์ผ ํ๋ค. ์ด๊ฑธ ๋ฒ์ด๋๋ ค๋ ๊ฒ์ด VLM ๊ธฐ๋ฐ ๋ณด์์ด๋ค โ Video-Language Critic(Alakuijala et al. 2025)์ Open X-Embodiment ์์์ผ๋ก ์๊ฐ ๋์กฐ VLM์ ๋ญํน ์์ค๋ก ํ์ตํด ํฝ์ -์ง์ ์๋ง์ผ๋ก ๋ฐ์งยท๋จ์กฐ ์ฆ๊ฐ ๋ณด์์ ๋ง๋ค๊ณ , ReWiND(Zhang et al. 2025b)๋ ์์์ ์ธ์ด ์ฃผ์ ์์ฐ + โvideo-rewindโ๋ก ๋ง๋ ์คํจ ์์๋ก ์งํ๋ ์์ธก ๋ณด์์ ํ์ตํ๋ค. ReWiND์ ์ฑ๊ณต๋ฅ ์ Meta-World ์๋ฎฌ๋ ์ด์ ์์ ๋ฒ ์ด์ค๋ผ์ธ ๋๋น 2ร, ์ค์ ์ํ ์ ์ ์์ 5ร ๋ผ๋ ๊ฒ์ด ์๋ฒ ์ด๊ฐ ์ธ์ฉํ๋ ์์น๋ค.
4.2 ๋น์ฉ: ๋ชจ์ ํ๋๋๋ฅผ ์ํ ์ธ์ดโ๋น์ฉ ์ง๋
๊ฐ์ โ์ธ์ดโ์ซ์โ์ด์ง๋ง ์๋น์๊ฐ ์ต์ ํ ๊ธฐ๋ฐ ํ๋๋์ผ ๋๋ ์ด์ผ๊ธฐ๊ฐ ๋ค๋ฅด๋ค. ์ด๊ธฐ์๋ Park et al. (2019)์ด CRF๋ก ๋ช ์ฌ๊ตฌยท๋ถ์ฌ(โuprightโ, โslowlyโ)๋ฅผ ๊ถค์ ์ต์ ํ๊ธฐ์ ์ฐ์ ํ๋ผ๋ฏธํฐ๋ก ๋งคํํ๊ณ , Sharma et al. (2022)์ โstay away from the yellow bottleโ ๊ฐ์ ๊ตฌ์ด ์ ์ ์ ์์ฐจ ๋น์ฉ ํจ์๋ก ํ์ตํ๋ค(๋จ 2D ๋น์ฉ ์ง๋์ ํ์ ).
3D๋ก ๋์ด๊ฐ๋ ๋ถ๊ธฐ์ ์ด VoxPoser(Huang et al. 2023b)๋ค. GPT-4๊ฐ OWL-ViT๋ฅผ ์ง์ํ๋ Python ์ฝ๋๋ฅผ ์ฐ๊ณ , ๊ทธ ๊ฒฐ๊ณผ๋ก ๋ฐ์ง 3D value map์ ํฉ์ฑํด ํ์ค ๋ชจ์ ํ๋๋๊ฐ ๊ทธ๋๋ก ๊ถค์ ์ ๋ฝ๋๋ค. ํ๋๋ ์ฌํ์ต์ด ํ์ ์๋ค๋ ๊ฒ์ด ๊ฐ์ ์ด๊ณ , ์ธ์ ๋ชจ๋(OWL-ViT/SAM/XMEM)์ด ํ๋ฆฌ๋ฉด ๋น์ฉ ์ง๋๊ฐ ํต์งธ๋ก ํ๋ฆฐ๋ค๋ ๊ฒ์ด ์ฝ์ ์ด๋ค. ReKep(Huang et al. 2025b)์ value map ๋์ DINOv2 ํคํฌ์ธํธ ์์ ๊ธฐํธ์ ์ ์ฝ ์ฝ๋๋ฅผ VLM์๊ฒ ์ฐ๊ฒ ํด, ์ด๋ ค์ด ๊ธฐํ ๊ณ์ฐ์ ์์น ์๋ฒ์ ๋๊ธฐ๊ณ VLM์ 3D ์ ๊ด๊ณ๋ง ์ถ๋ก ํ๊ฒ ํ๋ค. IMPACT(Ling et al. 2025)๋ ๋ค์ค๋ทฐ RGBD๋ฅผ GPT-4o์ ๋ฃ์ด ๋ฌผ์ฒด๋ณ โcontact toleranceโ๋ฅผ 0โ10 ์ฒ๋๋ก ๋งค๊ธฐ๊ณ ์ด๋ฅผ 3D ๋น์ฉ ์ง๋๋ก ๋ฐ๊ฟ RRT*์ ๋ฃ๋๋ค โ ๋ช ์์ ์ง์ ์์ด๋ ๋ถ๋๋ฌ์ด ๋ฌผ์ฒด์ ์ ์ด์ ํ์ฉํ๊ณ ๊นจ์ง๊ธฐ ์ฌ์ด ๊ฒ์ ํผํ๊ฒ ๋ง๋๋, ๊ฝค ์ค์ฉ์ ์ธ ์์ด๋์ด๋ค(๋์ ์ ์ ์ฅ๋ฉด๊ณผ ์๋ฒฝํ ๋ถํ ์ ๊ฐ์ ํ๋ค).
๊ด๋ จ: ์ด ๊ณ์ด์ ์ต์ ํ๋ฆ(VLM์ด ๋ง๋ ๋น์ฉ/์ ์ฝ์ ๋์งํธ ํธ์ ์ MPC์ ๋ฃ๊ธฐ)์ PWTF ๋ฆฌ๋ทฐ์์, LLM ๊ธฐ๋ฐ ๋ณด์ ์ฝ๋ ์์ฑ์ ์์กฐ ๊ฒฉ์ Eureka ๋ฆฌ๋ทฐ์์, ๋ณด์ ์ค๊ณยทshaping ์ผ๋ฐ๋ก ์ Reward Engineering ๋ฆฌ๋ทฐ์์ ๋ ๊น๊ฒ ๋ณผ ์ ์๋ค.
Table 2 โ Sec. 4 ๋ํ๊ธฐ๋ฒ (์๋ฌธ ํ ์ฌํ)
| Method | Signal Category | ํต์ฌ ๋ฉ์ปค๋์ฆ | ์ฅ์ | ๋จ์ |
|---|---|---|---|---|
| ZSRM (Mahmoudieh et al. 2022) | Sparse Reward Design | CLIP์ผ๋ก ์นด๋ฉ๋ผ ์ด๋ฏธ์ง์ ๋ชฉํ ํ ์คํธ์ ์ ์ฌ๋๋ฅผ ๋ณด์์ผ๋ก | ์ถ๊ฐ ๋ณด์๋ชจ๋ธ ํ์ต ์์ด ์ผ๋ถ ์ ๋ชฉํ ์ง์ ๊ฐ๋ฅ | CLIP์ ๊ณต๊ฐ ์ถ๋ก ๋ฅ๋ ฅ์ด ๊ทผ๋ณธ ์ํ |
| PixL2R (Goyal et al. 2021) | Dense Reward Design | (์ธ์ด, ๊ถค์ ) ์์์ relatedness ๋ชจ๋ธ ํ์ต โ ๋ฐ์ง shaping ๋ณด์ | ์ฐ์ ๊ฐ์ด๋๋ก ์ ์ฑ ํ์ต ํจ์จ ํฌ๊ฒ ๊ฐ์ | ์ ๋ ์ ์๋ฅผ ์ ๋ต์ผ๋ก ์์กด, ๋ค์ํ ์ธ์ด ๋ฐ์ดํฐ์ ํ์ |
| LOREL (Nair et al. 2022) | Reward Learning | ์คํ๋ผ์ธ ์ ๋ฌธ๊ฐ ์์ฐ์ผ๋ก ์ด์ง ๋ถ๋ฅ๊ธฐ ํ์ต | ์๊ฐ ๊ด์ธก+์ง์ โ ๋ณด์ ์ ํธ ๋ณํ์ ์๋ํ | ์ธ๋ฐํ ํ๋/๋ค๋ฌผ์ฒด๊ฐ ์ฝํ ๋ณต์ก ์กฐ์์์ ์ทจ์ฝ |
| Text2Reward (Xie et al. 2024) | FM-driven Reward Generation | LLM์ด ์์ฐ์ด ๋ชฉํ์์ ๋ฐ์ง Pythonic ๋ณด์ ํจ์๋ฅผ ์ง์ ์์ฑ | ์์จ์ ๋ณด์ ์์ฑ, ์๋ฎฌ ํ์คํฌ์์ ์ ๋ฌธ๊ฐ ๋ณด์์ ํ์ | ์์ฑ ์ฝ๋์ ์ ํ์ฑ์ ํฌ๊ฒ ์์กด, ํน๊ถ ์๋ฎฌ๋ ์ดํฐ ์ํ ํ์ |
| ReWiND (Zhang et al. 2025b) | VLM-driven Reward Learning | ์ธ์ด ์ฃผ์ ์์ฐ + ์์ฑ๋ ์คํจ์์ ์งํ๋ ์์ธก ๋ณด์ ํ์ต | ์๋ฎฌยท์ค์ ์ํ ์ ์ ๋ชจ๋์์ ์ฑ๊ณต๋ฅ ์ ์๋ฏธ ๊ฐ์ | ์ผ๋ฐ ๋ณด์์ ๋ฐฐ์ฐ๋ ค๋ฉด ์์์ ์์ฐ์ด ์ฌ์ ํ ํ์ |
โท ์ธ์ด๋ฅผ ์ ์ฑ ์ ์กฐ๊ฑด์ผ๋ก (Sec. 5)
ํต์ฌ ์ง๋ฌธ: ์ธ์ด๊ฐ ์ด๋ป๊ฒ ์ ์ฑ ์ ์กฐ๊ฑดํํด ์ฌ๋ฐ๋ฅธ ํ๋์ ๋ด๊ฒ ํ๋๊ฐ. ์ธ์ด์ ์ง์๊ฐ goal specifier โ behavior specifier๋ก ๋ฐ๋๋ค.

Sec. 5์ taxonomy(Fig. 6) โ RL(5.1) โ BC(5.2) โ Diffusion-based Policy(5.3). ์ธ ๊ณ์ด์ ์๋ ํ์ดํ์ โaddresses limitations ofโ๋ผ๊ณ ์ ํ ์๊ณ , ๊ฐ ํ์ดํ ์์ ๊ทน๋ณต ๋์์ด ๋ช ์๋๋ค(RL์ ๋ณด์ ์์ง๋์ด๋งยท๋นํจ์จยท์ฝํ ๊ทธ๋ผ์ด๋ฉ โ BC์ ์ค์ต์ ํ๋ ๋ชจ์ฌ โ DP์ ์ถ๋ก ์ง์ฐ). ์บก์ ์ ์ด๊ฒ์ด โ์๊ฒฉํ ๊ณ์ธต์ด๋ ์์ ํ ๋์ฒด๊ฐ ์๋๋คโ๋ผ๊ณ ๋ชป ๋ฐ๋๋ค. (์๋ฌธ ๊ทธ๋ฆผ ๋ผ๋ฒจ์ โDiffuisonโ ํ๊ธฐ๋ ์คํ)
์ด ๊ทธ๋ฆผ์ ํ์ดํ๋ ์ด ์๋ฒ ์ด์์ ๊ฐ์ฅ ์ ์งํ ์ฅ์น๋ค. ๋ณดํต ์๋ฒ ์ด์ ๊ณ๋ณด๋๋ ์๋ฌต์ ์ผ๋ก โ๋ค์ ๋์จ ๊ฒ์ด ๋ซ๋คโ๋ฅผ ์์ฌํ๋๋ฐ, ์ฌ๊ธฐ์๋ โ์ ๊ณ์ด์ ์ค์ฉ์ ํ๊ณ๋ฅผ ์ํํ๋คโ๋ ๊ด๊ณ๋ก๋ง ์ ์ํ๊ณ ์บก์ ์์ ๊ทธ ์ ์ ๋ช ์ํ๋ค.
5.1 RL ์์ ์ธ์ด
์ด๊ธฐ ์ธ์ด ์กฐ๊ฑด RL์ ์ฌ์ค ๊ฒ์ ๋๋ฉ์ธ์ด์๋ค(๊ท์น์ด ๋ช ํํ๊ณ ์ฌํ์ด ์ฌ์์). ์กฐ์์ผ๋ก ๋์ด์ค๋ฉด์ ์ฒซ ํด๋ฒ์ ๋ถ๋ฆฌ(decoupling) ์๋ค โ LCGG(Colas et al. 2020)๋ ์ธ์ด๋ก goal generator๋ฅผ ์กฐ๊ฑดํํ๊ณ ๊ทธ ๋ชฉํ๋ฅผ ์ฌ์ ํ์ต๋ goal-conditioned ์ ์ฑ ์ ๋๊ธด๋ค. ์ด๋ค RL ์ปจํธ๋กค๋ฌ๋ ๊ฝ์ ์ ์์ด ๋ชจ๋์ ์ด์ง๋ง, ์ธ์ด๊ฐ ์ ์ฑ ๋ง์ ์ง์ ๋ฟ์ง ์์์ ์ ์์ค ํ๋์ ์ธ์ด ์๋์ ๋ง๊ฒ ์กฐ์ ํ ์ ์๊ณ ์๊น๋ง ๋ฐ๋๋ pick-and-place์ ๋จธ๋ฌธ๋ค.
๊ทธ๋์ ์ธ์ด๋ฅผ ๋ฃจํ ์์ผ๋ก ๋ฐ์ด ๋ฃ๋ ํ๋ฆ์ด ์ด์ด์ง๋ค. LanCon-Learn(Silva et al. 2021)์ ์ธ์ด ์๋ฒ ๋ฉ์ attention router์ ๋ฃ์ด ๊ณต์ actor-critic ์์ ์ฌ๋ฌ ์คํฌ ๋ชจ๋์ ๋งค ์คํ ์ฌ๊ฐ์คํ๋ค โ ํํ๋ ฅ์ ์ป์ง๋ง ๋ผ์ฐํฐ์ ์ ์ด ์ ์ฑ ์ ๋์์ ๋ฐฐ์ฐ๋ ๊ฒ์ด ๋ถ์์ ํ๊ณ ์ํ์ ๋ง์ด ๋จน๋๋ค. MILLION(Bing et al. 2023a)์ Gated Transformer-XL ๊ธฐ๋ฐ ๋ฉ๋ชจ๋ฆฌ ๋ฉํ๋ฌ๋์ผ๋ก โ์ฝ๊ธฐ ๋จ๊ณโ์ โํ๋ ๋จ๊ณโ๋ฅผ ๋ถ๋ฆฌํด ์ ์์ ๊ฐ์ํ๊ณ , Yao et al. (2023)์ ์ง์๊ฐ โopen left drawerโ / โopen right drawerโ ์ฒ๋ผ ๋์นญ ์์ผ๋ก ์ค๋ ์ฑ์ง์ ์ด์ฉํด ๋ฐ์์ด ๊ท์น์ผ๋ก ์ง์๋ฅผ ์๋ ์์ฑยท๊ณต๋ํ์ตํ๋ค(๋ค๋ง ์์์ ๋์นญ ๊ท์น์ด ํญ์ ํตํ์ง ์๋๋ค).
๋ ๋ค๋ฅธ ๊ฐ๋๋ ์์ ํ ์ธ์ด๋ฅผ ๊ตฌ์กฐํ๋ ํํ์ผ๋ก ์์ถํ๋ ๊ฒ์ด๋ค. TALAR(Pang et al. 2023)๋ VAE ๊ธฐ๋ฐ ๋ฒ์ญ๊ธฐ๋ก ์์ ํ ํ ์คํธ๋ฅผ ์ด์ฐ Task-Language ์ ์ด ์งํฉ์ผ๋ก ๋ฐ๊พธ๊ณ RL ์ ์ฑ ์ ๊ทธ ์์์๋ง ํ์ตํ๋ค. LOVM(Ye et al. 2024)์ FiLM์ผ๋ก ์ด๋ฏธ์ง ํผ์ฒ๋ฅผ ์ง์์ ๋ฐ๋ผ ๋ณ์กฐํด ๋ค์ด์คํธ๋ฆผ DQN์ ๋ฌผ์ฒด ๋ง์คํฌ๋ฅผ ์์ธกํ๋ค(ํฝ์ ์์ค ๋ง์คํฌ ๊ฐ๋ ์ด ํ์).
์ต๊ทผ ํ๋ฆ์ ๋๊ท๋ชจ ์ฌ์ ํ์ต ์ ์ฑ ์ ๋ฏธ์ธ์กฐ์ ํ๋ ์ชฝ์ด๋ค. FLaRe(Hu et al. 2025a)๋ ์ฌ์ ํ์ต๋ ๋น์ -์ธ์ด ํธ๋์คํฌ๋จธ BC ์ ์ฑ ์ ํฌ์ ์ธ์ด ๋ณด์์ผ๋ก PPO ๋ฏธ์ธ์กฐ์ ํด ๋ฐ์ง ๋ณด์ ๋ฒ ์ด์ค๋ผ์ธ ๋๋น 15๋ฐฐ ๋น ๋ฅธ ํ์ต๊ณผ ๋น ๋ฅธ embodiment ์ ์ด๋ฅผ ๋ณด๊ณ ํ๋ค โ ๋์ ์ฌ์ ํ์ต BC ๋ชจ๋ธ์ ๋ฐ์ดํฐ ๋ถํฌ๋ฅผ ๊ทธ๋๋ก ์์ํ๋ค. V-GPS(Nakamoto et al. 2025)๋ ์คํ๋ผ์ธ RL๋ก ์ธ์ด ์กฐ๊ฑด ๊ฐ์นํจ์๋ฅผ ๋ฐฐ์ ๋ฐฐํฌ ์์ ์ ์ ์ฑ ์ ํ๋์ ์ฌ๋ญํนํ๋ค(์ ์ฑ ๊ฐ์ค์น์ ์๋์ง ์๋๋ค). LIMT(Aljalbout et al. 2025)๋ Dreamer ํ์ดํ๋ผ์ธ ์์์ ์ธ์ด๋ก ์๋๋ชจ๋ธ์ latent dynamics๋ฅผ ์กฐ๊ฑดํํด, ์์ ์ ๋ฏธ๋์๊น์ง ์ธ์ด ์ ๋ณด๊ฐ ๋ค์ด๊ฐ๊ฒ ํ๋ค.
5.2 BC ์์ ์ธ์ด
BC ์ชฝ ์์ฌ๋ โ3D ๊ตฌ์กฐ๋ฅผ ์ด๋ป๊ฒ ์ธ๊ฒ ์ป์ ๊ฒ์ธ๊ฐโ ์ โ์ธ์ด ์ฃผ์์ ์ด๋ป๊ฒ ์๋ ๊ฒ์ธ๊ฐโ ๋ ์ถ์ผ๋ก ์ฝํ๋ค.
- ๋ฐ์ดํฐ ์ ์ฝ: MCIL(Lynch and Sermanet 2021)์ ํ์คํฌ IDยท์ด๋ฏธ์งยท์ธ์ด๋ฅผ ํจ๊ป ํ์ตํด ์์ฐ์ 1% ๋ฏธ๋ง๋ง ์ธ์ด ์ฃผ์์ด์ด๋ ํ์ต์ด ๋๋ค๋ ๊ฒ์ ๋ณด์๋ค. BC-Z(Jang et al. 2022)๋ ์ ๋ฌธ๊ฐ ์์ฐ + ์ ๋ ดํ ๋ถ์์ ๊ฐ์ ์ ์๊ณ , MimicPlay(Wang et al. 2023a)๋ ์ฌ๋์ด ๋ฌผ์ฒด์ ์์ ๋กญ๊ฒ ์ํธ์์ฉํ ์์์์ ๋ฐฐ์ด๋ค.
- ์ํคํ ์ฒ: CLIPORT(Shridhar et al. 2022)๊ฐ CLIP์ ๋์ ์๋ฏธ ์ดํด + Transporter์ ๊ณต๊ฐ ์ ๋ฐ๋๋ฅผ ๊ฒฐํฉํ ์ดํ, HiveFormer(Guhur et al. 2023)๋ ๊ณผ๊ฑฐ ์๊ฐ-๊ณ ์ ์์ฉ ํ ํฐ์ ๋ชจ๋ ์ด์ด๋ถ์ฌ ๋ถ๋ถ๊ด์ธก์ฑ์ ๋ค๋ฃจ๊ณ 74๊ฐ RLBench ํ์คํฌ์์ ์ฅ๊ธฐ ์ฑ๊ณต๋ฅ ์ ์ฌ๋ ธ๋ค. PerAct(Shridhar et al. 2023)๋ ๋ฌธ์ ๋ฅผ โdetecting the next best voxel actionโ ์ผ๋ก ์ฌ์ ์ํด RGB-D์ 6-DoF ํ๋ ๊ณต๊ฐ์ ๋ชจ๋ ๋ณต์ ํํ๋ค โ ๊ฐํ 3D ๊ท๋ฉ ํธํฅ์ ์ป๋ ๋์ ๊ณ ํด์๋ ๊ฒฉ์์ ์ฐ์ฐ ๋น์ฉ์ ์น๋ฅธ๋ค.
- ๋ณต์ ๋น์ฉ ์ค์ด๊ธฐ: Act3D(Gervet et al. 2023)๋ 3D feature field์ coarse-to-fine attention์, GNFactor(Ze et al. 2023)๋ ์ฌ์ ํ์ต 2D VLM ํผ์ฒ๋ฅผ 3D ํ๋์ ์ฆ๋ฅํด ์๋ฏธ๋ฅผ ์ฃผ์ ํ๋ค(100 ์์ฐ์ผ๋ก ์ธ์ด ์กฐ๊ฑด ์ค์ ์ฃผ๋ฐฉ ํ์คํฌ ์ ์ด). RVT(Goyal et al. 2023)๋ ์์ ๋ณต์ ์ ๋ฒ๋ฆฌ๊ณ 8โ16๊ฐ ๊ฐ์ ์นด๋ฉ๋ผ๋ก ํฌ์ธํธํด๋ผ์ฐ๋๋ฅผ ์ฌ๋ ๋๋งํด ๋ฉํฐ๋ทฐ ViT๋ฅผ ์ด๋ค โ PerAct ๋๋น 36๋ฐฐ ๋น ๋ฅธ ํ์ต์ ๋๋ฑ ์ฑ๋ฅ. ฮฃ-agent(Ma et al. 2025)๋ ์ฌ๊ธฐ์ ๋์กฐ IL ์์ค์ ๋ํ๋ค.
- ์ฅ๊ธฐ ํ์คํฌ: HULC(Mees et al. 2022a) โ HULC++(Mees et al. 2023, ์๊ฐ affordance + LLM ๊ณํ) โ SPIL(Zhou et al. 2024a, ์ฌ์ ํ์ต ์คํฌ prior). ๋ค๋ฅธ ๋ฐฉํฅ์ผ๋ก ACT(Zhao et al. 2023a)์ action chunking๊ณผ ์๊ฐ์ ์์๋ธ, MT-ACT(Bharadhwaj et al. 2024)์ ๋ฉํฐํ์คํฌ ํ์ฅ, ์์ ๋๋ฉ์ธ์ SRT-H(Kim et al. 2025a, ๊ณ ์์ค ํธ๋์คํฌ๋จธ๊ฐ ์ธ์ด ์ง์๋ฅผ ์์ฑํด ์ ์์ค ์ ์ฑ ์ ์ ๋).
BC ๊ณ์ด์ ๊ณ ์ ๋ณ๋ชฉ์ผ๋ก ์๋ฒ ์ด๊ฐ ๋ฐ๋ณตํด ์ง๋ ๊ฒ์ compounding error๋ค. ์ด๊ฒ์ด ๋ค์ ์ ์ ๋๊ธฐ๊ฐ ๋๋ค.
5.3 ํ์ฐ ์ ์ฑ ์์ ์ธ์ด
ํ๊ท ๊ธฐ๋ฐ BC๋ ๋ค์ค๋ชจ๋ ํ๋ ๋ถํฌ๋ฅผ ํ๊ท ๋ด๋ฒ๋ ค โ๋ณด์์ ์ด๊ฑฐ๋ ์์ ์ ํจํ์ง ์์โ ํ๋์ ๋ธ๋ค. ํ์ฐ ์ ์ฑ ์ด ์ด๋ฅผ ํผ๋ค. ์ธ์ด๊ฐ ๋ค์ด๊ฐ๋ ๋ฐฉ์์ ๋ค ๊ฐ์ง๋ก ์ ๋ฆฌ๋๋ค.
- ๋จ์ผ ์คํ ๋ชฉํ ์ํ๋ง โ StructDiffusion(Liu et al. 2023c)์ โSet the table in the center left, relative to youโ ๋ฅผ ๊ณ ์์ค ์ ์ฝ์ผ๋ก ์ผ์ ๋ฌผ์ฒด ์ค์ฌ ํ์ฐ ๋ชจ๋ธ์ด ๋ฌผ๋ฆฌ์ ์ผ๋ก ํ๋นํ๊ณ ์ถฉ๋ ์๋ ๋ชฉํ ์์ธ๋ฅผ ๋ค๋ฌผ์ฒด์ ๋ํด ์ํ๋งํ๋ค. ์ดํ ์ ์์ค ์ ์ฑ ์ ๋ฅ๋ ฅ์ด ์ํ์ด ๋๋ค.
- ์๊ธฐ์ง๋ ๋ฐ์ดํฐ ํ๋ ์ด์ โ Scaling&Distilling(Ha et al. 2023)์ LLM์ด ์๋ธํ์คํฌ๋ฅผ ์ ์ํ๊ณ ์๋ฎฌ๋ ์ด์ ์์ ์คํํ ๋ค ์ฑ๊ณต ๊ถค์ ๋ง ์ธ์ด ์กฐ๊ฑด ํ์ฐ ์ ์ฑ ์ ์ฆ๋ฅํ๋ค.
- ์คํฌ ๋ฐ๊ฒฌยท์กฐํฉ โ PlayFusion(Chen et al. 2023b)์ ์ธ์ด ์ฃผ์ play๋ฅผ ์ฝํ ๊ฐ๋ ์ผ๋ก ์ผ์ ์์ ๊ถค์ ์ ์ด์ฐ ์ฝ๋๋ถ ์์ latent skill๋ก ๋ถํดํ๋ค. Ju et al. (2024), Wu et al. (2025a)๋ VQ๋ก ์ฐ์ ํ๋์ ์ด์ฐ latent skill ๊ณต๊ฐ์ ๋งคํํ๋ค.
- ์ฅ๊ธฐ ๊ณํ ๋ถํด โ ChainedDiffuser(Xian et al. 2023)๋ ์ ์ญ ํธ๋์คํฌ๋จธ๊ฐ ์ด์ฐ ํคํฌ์ฆ ์ํ์ค๋ฅผ ์์ธกํ๊ณ ์ง์ญ ๊ถค์ ํ์ฐ๊ธฐ๊ฐ ๊ทธ ์ฌ์ด๋ฅผ ๋งค๋๋ฝ๊ฒ ์๋๋ค. LCD(Zhang et al. 2024a)๋ ํ์ฐ ๋ชจ๋ธ์ ์ ์ฐจ์ latent ๊ณต๊ฐ์ ๊ณ ์์ค ํ๋๋๋ก ์ด๋ค.
๋ฐฐ์น๋ฅผ ๊ฐ๋ก๋ง๋ ๋ ๋ฌธ์ ๋ ์ ๋ฆฌ๋๋ค. ๋ฐ์ดํฐ ์ด์ง์ฑ(์๋ฎฌ/์ค์ ๋ก๋ด/์ฌ๋ ์์)์ ๋ํด PoCo(Wang et al. 2024c)๋ ์ ์ฑ ํฉ์ฑ์ ์กฐ๊ฑด๋ถ ํ์ฐ ํฉ์ฑ ๋ฌธ์ ๋ก ์ ์ํํด ์ฌ์ ํ์ต๋ ์ฌ๋ฌ ์ ์ฑ ์ ์ธ์ด๋ก ์กฐํฉํ๊ณ , RoLD(Tan et al. 2024)๋ ํ์คํฌ ๋ฌด๊ด ์คํ ์ธ์ฝ๋๋ก ํตํฉ latent action ๊ณต๊ฐ์ ๋ง๋ ๋ค ๊ทธ ์์์ ํ์ฐ ์ ์ฑ ์ ํ์ตํด cross-embodiment ์ ์ด๋ฅผ ๋ ธ๋ฆฐ๋ค. ๋๋ฝ๋ ๋ชจ๋ฌ๋ฆฌํฐ์ ๋ํด์๋ MDT(Reuss et al. 2024)์ GR-MG(Li et al. 2025b)๊ฐ ์ธ์ด/์ด๋ฏธ์ง ์ด๋ ์ชฝ์ด๋ ๋ฐ๋๋ก ์ค๊ณ๋๋ค(GR-MG๋ ์ธ์ด ์ง์๋ก ๋ชฉํ ์ด๋ฏธ์ง๋ฅผ ํ์ฐ ์์ฑํ ๋ค ๋ ๋ชจ๋ฌ๋ฆฌํฐ ๋ชจ๋๋ก ์ ์ฑ ์ ์กฐ๊ฑดํ).
๊ทธ๋ฆฌ๊ณ ๋จ๋ ๋ณ๋ชฉ์ ํ๋๋ก ์๋ ดํ๋ค: ๋ฐ๋ณต์ denoising์ ์ถ๋ก ์ง์ฐ. ์๋ฒ ์ด๋ (์ธ์ด ์กฐ๊ฑด์ ์๋์ง๋ง) ์ผ๊ด์ฑ ์ ์ฝ์ผ๋ก ์ ์ง์ฐ ์ํ๋ง์ ๋ง๋๋ ๋ฐฉํฅ(Lu et al. 2024; Prasad et al. 2024)์ ์ ๋งํ ๋์์ผ๋ก ์ ์ํ๋ค.
Table 3 โ Sec. 5 ๋ํ๊ธฐ๋ฒ (์๋ฌธ ํ ์ฌํ)
| Method | ํ์ต ํจ๋ฌ๋ค์ | ๊ฒจ๋ฅํ ๋ณ๋ชฉ | ์ฅ์ | ๋จ์ |
|---|---|---|---|---|
| MILLION (Bing et al. 2023a) | RL | ํ์ ์ค ์ํ ๋นํจ์จ | ๋ฉ๋ชจ๋ฆฌ ๊ธฐ๋ฐ ๋ฉํ๋ฌ๋์ผ๋ก ๋ฏธํ์ต ํ์คํฌ์ ๋น ๋ฅด๊ฒ ์ ์ | ์ฝ๊ธฐ ๋จ๊ณ์ ํ๋ ๋จ๊ณ๋ฅผ ๋ถ๋ฆฌํด์ผ ํจ |
| FLaRe (Hu et al. 2025a) | RL | ๋ฉํฐํ์คํฌ ํ๋์ ์ฒ์๋ถํฐ ๋ฐฐ์ฐ๋ ๋นํจ์จ | ๋ฏธ์ธ์กฐ์ ์ผ๋ก ๋ฐ์ง ๋ณด์ ๋ฒ ์ด์ค๋ผ์ธ ๋๋น 15ร ๋น ๋ฅธ ํ์ต | ์ฌ์ ํ์ต BC ๋ชจ๋ธ์ ๋ฐ์ดํฐ ๋ถํฌ ํ๊ณ๋ฅผ ์์ |
| PerAct (Shridhar et al. 2023) | BC | 2D ํฌ์์์ 3D ๊ณต๊ฐ ๊ด๊ณ ํ์ต | ๊ด์ธกยทํ๋ ๊ณต๊ฐ์ ๋ชจ๋ ๋ณต์ ํํด ๊ฐํ 3D ๊ตฌ์กฐ prior | ์กฐ๋ฐยท๊ณ ํด์๋ ๋ณต์ ํ๋ก ์ฐ์ฐ ๋น์ฉ ํผ |
| HULC (Mees et al. 2022a) | BC | ์ฅ๊ธฐ ํ์คํฌ ํ์ต๊ณผ ์ผ๋ฐํ | ํธ๋์คํฌ๋จธ ๊ธฐ๋ฐ์ผ๋ก ๊ฐ๊ฑดํ ์ธ์ด ์กฐ๊ฑด ํํ ํ์ต | ํ์ค BC์ ์ฅ๊ธฐ ๊ตฌ๊ฐ compounding error๋ฅผ ๊ทธ๋๋ก ์์ |
| StructDiffusion (Liu et al. 2023c) | Diffusion Policy | ๋ฌผ๋ฆฌ์ ์ผ๋ก ํ๋นํ ์ฅ๋ฉด ๋ฐฐ์น์ ์ธ์ด ๊ทธ๋ผ์ด๋ฉ | ๋ฏธํ์ต ๋ฌผ์ฒด์๋ ๋ค์ยท๋ฌด์ถฉ๋ ๋ชฉํ ์์ธ ์ํ๋ง | ํ์ ์ ์์ค ์ ์ฑ ์ ๋ฅ๋ ฅ์ด ์ฑ๋ฅ ์ํ |
| ChainedDiffuser (Xian et al. 2023) | Diffusion Policy | ์ฅ๊ธฐ ์ฐ์ ๊ถค์ ์์ฑ | ์ด์ฐ ํคํฌ์ฆ ์์ธก + ์ง์ญ ๊ถค์ ํ์ฐ์ผ๋ก ๋งค๋๋ฌ์ด ๋ชจ์ | ๋ฐ๋ณต denoising์ ๋์ ์ถ๋ก ์ง์ฐ์ ๊ทธ๋๋ก ์์ |
โธ ์ธ์ด๋ก ๊ณํํ๊ณ ์ถ๋ก ํ๋ค (Sec. 6)
ํต์ฌ ์ง๋ฌธ: ๋ก๋ด์ด ์ธ์ด ๊ณต๊ฐ์์ ์ด๋ป๊ฒ โ์๊ฐโํด ์๊ธฐ ํ๋์ ๊ตฌ์กฐํํ๋๊ฐ. ์ฌ๊ธฐ์ ์ธ์ด๋ ์ธ๋ถ ์ง์๊ฐ ์๋๋ผ ๋ด๋ถ ์ถ๋ก ๋งค์ฒด๋ค.

Sec. 6์ taxonomy(Fig. 9) โ 6.1 Classic Neuro-symbolic(learning for reasoning / reasoning for learning / learning-reasoning), 6.2 Empowered by LLMs(Planning / Reasoning / Structured Planning), 6.3 Empowered by VLMs(Contrastive / Generative / Autoregressive). 6.1์ Reasoning-Learning์์ 6.2์ Structured Planning์ผ๋ก โenhanceโ ํ์ดํ๊ฐ ์ด์ด์ง๋ค.
6.1 ๊ณ ์ ๋ด๋ก์ฌ๋ณผ๋ฆญ โ ๊ทธ๋ฆฌ๊ณ ๊ทธ๊ฒ์ด ์ ๋ฉ์ท๋๊ฐ
Yu et al. (2023a)์ ํ์ ๋ฐ๋ผ ์ธ ๊ฐ๋๋ก ๋๋๋ค. Learning for reasoning(์ ๊ฒฝ๋ง์ด ์ง๊ฐยทํน์ง ์ถ์ถ์ ๋งก๊ณ ์ฌ๋ณผ๋ฆญ์ด ๊ณํ: Tenorth et al. 2010์ wikiHow ํ์ฑ + WordNet/Cyc โ STRIPS ๊ณํ, She et al. 2014์ โGrounded Action Frameโ, HiTUT, DANLI), Reasoning for learning(์ฌ๋ณผ๋ฆญ์ด ๊ตฌ์กฐยท๊ท์น์ ์ ๊ณตํด ์ ๊ฒฝ ํ์ต์ ์ ๋: Misra et al. 2016์ verb clause CRF, Silver et al. 2023์ ์ฌ์ ์ ์ ์ฌ๋ณผ ์ ์ด), Learning-reasoning(๋์ด ๋ฐ๊ฒฐํฉ ๋ฃจํ๋ก ๊ณต์งํ: Chai et al. 2018์ ๋ํํ ํ์คํฌ ํ์ต, K et al. 2023์ ์ฌ๋ณผ๋ฆญ ํ์ + ์ ๊ฒฝ ์๊ฐ ์ถ๋ก ๊ธฐ + ์ ๊ฒฝ ์ก์ ์๋ฎฌ๋ ์ดํฐ).
์๋ฒ ์ด๊ฐ ์ด ๊ณ์ด์ ํ๊ณ๋ฅผ ๋ค ๊ฐ๋ก ์ ๋ฆฌํ ๋ถ๋ถ์ด ์ข๋ค. (i) ๋ ธ๋์ง์ฝ์ KG ๊ตฌ์ถ โ DANLI๋ KGE ๊ธฐ๋ฐ ์ง์ํ์ต์ ํ์คํฌ๋ณ KG๋ฅผ ์ ์ ํ๋๋ฐ, ์ด๋ฆฐ ์ธ๊ณ์์๋ ์ ๋ฌผ์ฒดยท๊ด๊ณ๊ฐ ๊ณ์ ๋์ ์ ์ง๊ฐ ๋ณ๋ชฉ์ด ๋๋ค. (ii) ์์์ ์ฌ๋ณผ ๊ณตํ๊ณผ ์จํจ๋ก์ง ํ๋ฅ โ ์ ๋๋ฉ์ธ์ผ๋ก ํ์ฅํ๋ ค๋ฉด ์ฌ๋์ด ์จํจ๋ก์ง๋ฅผ ํ๋ ์ด์ ํ๊ณ ์ธ์ ๋ชจ๋์ ์ฌํ์ตํด์ผ ํ๋ค. (iii) ์์ยท์ค์ธ๊ณ ์ง์ ์ปค๋ฒ๋ฆฌ์ง ๋ถ์กฑ โ ์ฌ๋ณผ ๊ท์น์ ๋ช ์์ ์ผ๋ก ์ธ์ฝ๋ฉ๋ ๊ฒ๋ง ๋ด๋๋ค. (iv) ์ฅ๊ธฐ ํ์คํฌ์์์ ํ์ฅ์ฑ โ ๊ณํ ๊ธธ์ด๊ฐ ๋๋ฉด ์ด์ฐ ์ฐ์ฐ์์ ๊ทธ๋ผ์ด๋ฉ ์ ํ ์์ ํ์์ด ์กฐํฉ์ ์ผ๋ก ํญ๋ฐํ๋ค.
์ด ๋ค ๊ฐ์ง๊ฐ ๊ทธ๋๋ก โ์ LLM์ด ์ด ์๋ฆฌ๋ฅผ ๋์ฒดํ๋๊ฐโ์ ๋ต์ด๋ค.
6.2 LLM์ด ๋ค์ด์จ ๋ค
LLM์ ์์ (i)(ii)(iii)๋ฅผ ํ๋กฌํํธ ํ๋๋ก ์ฐํํ๋ค. ๋์ ์๊ธฐ ๊ณ ์ ์ ๋ฌธ์ ์ ์ ๋ค์ฌ์จ๋ค. ์๋ฒ ์ด๋ ์ ์ผ๋ก ์ ๋ฆฌํ๋ค: grounding problem(ํ๊ฒฝ์ ์๋ ๋ฌผ์ฒด๋ฅผ ์ฐ๋ ๊ทธ๋ด๋ฏํ์ง๋ง ์คํ ๋ถ๊ฐ๋ฅํ ๊ณํ), ambiguity in language(โmoving fasterโ, โplacing objects slightly leftโ ๊ฐ์ ๊ณต๊ฐยท๊ธฐํ ํํ), lack of feedback and reactivity(๊ฐ๋ฃจํ ํ๋๋๋ ์คํจ๋ฅผ ๋ชจ๋ฅด๊ณ , ์ ์๋ ์ธ์ง์ ๊ธ์์ ๋ฃ๋ ๊ณํ์ ๋ผ ์ ์๋ค).
๊ณํ(6.2.1) ์ ๊ฐ๋ฃจํ์ ํ๋ฃจํ๋ก ๊ฐ๋ฆฐ๋ค.
- ๊ฐ๋ฃจํ: SayCan(Brohan et al. 2023b)์ด affordance ํจ์๋ก ๊ฐ ํ๋์ ํ์ฌ ์ํ ์ฑ๊ณต๋ฅ ์ ์ ๋ํํด LLM์ ์์ธก์ ์ฌ์ ๋ ฌํ๋ค. KnowNo(Ren et al. 2023a)๋ conformal prediction์ผ๋ก ๊ณํ์ ๋ค์ง์ ๋ค QA๋ก ๋ง๋ค๊ณ , ์ฌ์ฉ์๊ฐ ์ ํ ์ฑ๊ณต๋ฅ ๋ก ์๊ณ๊ฐ์ ์ก์ ํ์ ์ด ์์ผ๋ฉด ์ฌ๋์๊ฒ ๋ฌป๋๋ค(โPut a plastic bowl in the microwaveโ vs โmetal bowlโ). Huang et al. (2022)์ ์ธ๊ณผ LLM์ด ๊ณ ์์ค ๋ชฉํ๋ฅผ ์ค๊ฐ ๊ณํ์ผ๋ก ๋ถํดํ๊ณ ๋ง์คํฌ๋ LLM์ด ๊ทธ๊ฒ์ ์คํ ๊ฐ๋ฅํ ํ์ต๋ ํ๋์ผ๋ก ๋ฒ์ญํ๊ฒ ํ๋ค(โsqueeze out a glob of lotionโ โ โpour the lotion into right handโ).
- ํ๋ฃจํ: SayPlan(Rana et al. 2023)์ ๊ณ์ธต์ 3D scene graph๋ก ํ๊ฒฝ์ ํํํด ์ ์ดยทํ์ฌ ์ํยทaffordance๋ฅผ ํ ์คํธ ํผ๋๋ฐฑ์ผ๋ก ๋๋จน์ธ๋ค(์ฌ๋ฌด์ค ๊ท๋ชจ๊น์ง ํ์ฅ). Text2Motion(Lin et al. 2023)์ STAP์ ๊ธฐํ ํ๋น์ฑ ๊ฒ์ฌ๋ก ์ฐ๊ณ ์คํจํ๋ฉด ๋ค์ ๊ณํํ๋ค. SELP(Wu et al. 2025b)๋ ์ ํ์์ ๋ ผ๋ฆฌ(LTL) ๋ฅผ ๋ฃ์ด LLM์ ์ํํ ๊ณํ์ ๊ฐ์ง์น๊ธฐํ๋ค(๋์ ํ๊ฒฝ๋ณ LTL ๋ช ์ธ๋ฅผ ๋ฏธ๋ฆฌ ๋ง๋ค์ด์ผ ํ๋ค).
์ถ๋ก (6.2.2) ์ ๋ค ๊ฐ๋๋ค. ์์ฝ(Tidybot์ด few-shot ํ๋กฌํํธ๋ก โyellow shirts go in the drawerโ + โwhite socks go in the drawerโ ์์ โlighter-colored clothes go in the drawerโ ๋ผ๋ ์ผ๋ฐ ์ ๋ต์ ๋ฝ๋๋ค โ ๋ค๋ง LLM์ ํ์คํฌ ๋ฌด๊ด ์ง์์ด ์์ฌ ์์ ํ ๋ง๋ ์์ฝ์ ๋ชป ๋ง๋ค๊ธฐ๋ ํ๋ค), ํ๋กฌํํธ ์์ง๋์ด๋ง(CoT, Socratic Models, ECoT), ์ฝ๋ ์์ฑ(Code as Policies, ProgPrompt, VOYAGER์ ์คํฌ ๋ผ์ด๋ธ๋ฌ๋ฆฌ ์ถ์ ), ๋ฐ๋ณต์ ์ถ๋ก (Inner Monologue์ ์ฑ๊ณต ๊ฐ์ง๊ธฐ + ์ฅ๋ฉด ์์ ์ ๋๋จน์, REFLECT์ ์คํจ ์ค๋ช ์์ฑ, HiCRISP์ ๊ณ์ธต์ ์ค๋ฅ ์ ์ , DAHLIA์ โplanner + reporterโ ์ด์ค ๋ฃจํ, LYRA์ human-in-the-loop ์คํฌ ์ถ์ ).
์ฌ๊ธฐ์ ์๋ฒ ์ด๊ฐ ์ธ์ฉํ ๊ฐ์ฅ ๊ตฌ์ฒด์ ์ธ ๊ทผ๊ฑฐ ํ๋: Mialon et al. (2023)์ ๋ฐ๋ฅด๋ฉด GSM8K ๋ฒค์น๋งํฌ์์ ์ฝ๋ ์ต์ ํ๋ code-davinci-002๊ฐ ํ
์คํธ ์ต์ ํ๋ text-davinci-002๋ฅผ ๋ฅ๊ฐํ๋ค โ code-as-policy ๊ณ์ด์ ์ฑ๋ฅ์ด ๊ฒฐ๊ตญ ์ด๋ค ํ์ด๋ฐ์ด์
๋ชจ๋ธ์ ๊ณจ๋๋๊ฐ์ ์ํด ์ํ์ด ์ ํด์ง๋ค๋ ๋ป์ด๋ค.
๊ตฌ์กฐํ๋ ๊ณํ(6.2.3) ์ LLM์ ํ์ ์ฒด๊ณ์ ๊ฒฐํฉํ๋ค. PDDL ๊ฒฐํฉ์ ์ธ ๋์ (์ฌ๋ณผ๋ฆญ ํ์ ์๋, ์ฌ๋ณผ ๊ทธ๋ผ์ด๋ฉ, ๋ณต์กํ ์ํธ์์ฉ ํํ)์ ๋ํด ๊ฐ๊ฐ ๋๋ฉ์ธ ํนํ ๋ฏธ์ธ์กฐ์ (Capitanelli and Mastrogiovanni 2024), ์ค์๊ฐ ์ผ์ ํผ๋๋ฐฑ์ผ๋ก ์ ์ด๋ฅผ ๊ฒ์ฌํ๋ IALP(Wang et al. 2025a), ์ด๊ฐยทํํ ํฌ ์์ฐ์ ๋ฃ์ด โ์ผ์ด๋ธ ์ฅ๋ ฅโ ๊ฐ์ ๋์ ์ ๋ณด์ด๋ ์ฌ๊ฑด๊น์ง ์ ์ด๋ก ์ ์ํ๋ LEMMo-Plan(Chen et al. 2025b)์ด ๋์ํ๋ค. ํ๋ํธ๋ฆฌ(BT) ๊ฒฐํฉ์ LLM-bt(๋ฐํ์ ๊ณํ ์ ์) โ LLM-OBTEA(1์ฐจ ๋ ผ๋ฆฌ ๋ชฉํ๋ก ๋ฒ์ญ ํ Optimal BT Expansion์ผ๋ก ์ต์๋น์ฉ BT๋ฅผ ๋ณด์ฅ) โ BETR-XP-LLM(LLM์ โrepair agentโ๋ก ์จ์ ์คํจ๋ง๋ค ์ต์ ์ ์ ์กฐ๊ฑด๊ณผ ์๋ธํธ๋ฆฌ๋ฅผ ์ ์ํ๊ณ ๊ฒ์ฆ ๊ฐ๋ฅํ ์์ ์ ์ ์ฑ ์ ์๊ตฌ ํตํฉ)์ผ๋ก ์ด์ด์ง๋ค.
6.3 VLM์ด ๋ค์ด์จ ๋ค
LLM์ ๊ทผ๋ณธ ํ๊ณ๋ ํ๋๋ค: disembodied. ํ ์คํธ๋ง ๋ค๋ฃจ๋ฏ๋ก ํ๊ฒฝ์ ์ง์ ๋ณผ ์ ์๊ณ , ๋ฌผ์ฒด ๊ฒ์ถ๊ธฐ ๊ฐ์ ์ค๊ฐ ๋ชจ๋์ด ์ ๋ณด๋ฅผ ์๋๋ค. VLM์ ์ด ๋ค๋ฆฌ๋ฅผ ์์ค๋ค.
- ๋์กฐ ํ์ต ๊ณ์ด: CLIPORT, Dream2Real(CLIP์ผ๋ก ๊ฐ์ ๋ชฉํ ์ํ๋ฅผ โ์์โํด ํ๊ฐ), CLIP-Fields, EmbCLIP, MOO(OWL-ViT์๊ฒ โAn image of an Xโ ๋ก ๊ด์ฌ ๋ฌผ์ฒด์ ๋ฐ์ด๋ฉ๋ฐ์ค๋ฅผ ์์ฒญ), LATTE, R+X(Gemini๋ก ์ฌ๋ ์์ฐ ์์ ์ค ๊ด๋ จ ๊ตฌ๊ฐ์ ๊ฒ์ํด ์ ์ฑ ์ ์กฐ๊ฑดํ).
- ์์ฑ ๊ณ์ด: ํ ์คํธ ์์ฑ(PaLM-E 562B๊ฐ ๋จ์ผ ๊ฑฐ๋ ๋ชจ๋ธ๋ก ๋ก๋ด ํ์คํฌ ํนํ ๋ฏธ์ธ์กฐ์ ๊ฑฐ์ ์์ด ์คํ ๊ฐ๋ฅ ๊ณํ์ ๋ง๋ ๋ค; Socratic Models๊ฐ ์ ๋ฌธ ๋ชจ๋ธ๋ค์ ์ธ์ด๋ก ๋ํ์ํจ๋ค; PIVOT์ด ์กฐ์์ VLM๊ณผ์ ๋ฐ๋ณต์ ์๊ฐ ๋ํ๋ก ์ฌ๊ตฌ์ฑ), ์ด๋ฏธ์ง ์์ฑ(SuSIE๊ฐ ์ด๋ฏธ์ง ํธ์ง ๋ชจ๋ธ๋ก ์๋ธ๊ณจ ์ํ์ค๋ฅผ ๋ง๋ค์ด ์ ์์ค ์ปจํธ๋กค๋ฌ์ ๋๊ธด๋ค; Dall-E-Bot; ๋ฐ์ดํฐ ์ฆ๊ฐ; GR-MG์ ๋ชฉํ ์ด๋ฏธ์ง ์์ฑ; ๋ฏธ๋ ํ๋ ์ ์์ธก์ผ๋ก ์ญ๋์ญํ์ ๋ฐฐ์ฐ๋ ์๋๋ชจ๋ธ ์ฉ๋ฒ).
Table 4 โ Sec. 6 ๋ํ๊ธฐ๋ฒ (์๋ฌธ ํ ์ฌํ, ์ผ๋ถ)
| Method | ์ธ์ง ์ฒด๊ณ | ์ถ๋ก ๋ฉ์ปค๋์ฆ | ์ฅ์ | ๋จ์ |
|---|---|---|---|---|
| DANLI (Zhang et al. 2022) | Classic Neuro-symbolic | ๋ํ ์ด๋ ฅ๊ณผ ์ฌ๋ณผ๋ฆญ ์๋ธ๊ณจ์ ํตํ learning-for-reasoning | ์งํ ์ํฉ์ ์ถ๋ก ํ๊ณ ์ค๋ฅ์์ ๋์ ์ผ๋ก ๋ณต๊ตฌ | ๋ ธ๋์ง์ฝ์ ยทํ์คํฌ ํนํ KG ๊ตฌ์ถ์ ์์กด |
| SayCan (Brohan et al. 2023b) | LLM-Empowered | affordance ํจ์์ ๊ฒฐํฉ๋ ๊ฐ๋ฃจํ ๊ณํ | ์์ฐ์ด๋ฅผ ์๋ฏธ์ ํ๋นํ๊ณ ๋ฌผ๋ฆฌ์ ์ผ๋ก ์คํ ๊ฐ๋ฅํ ์ํ์ค๋ก | ์คํฌ ์คํ์ด ๋ฌด๊ฒฐํ๋ค๊ณ ๊ฐ์ , ์ฌ๊ณํ์ฉ ์ค์๊ฐ ํผ๋๋ฐฑ ์์ |
| SayPlan (Rana et al. 2023) | LLM-Empowered | 3D scene graph + ์๋ฏธ ์๋ฎฌ๋ ์ดํฐ ๊ธฐ๋ฐ ํ๋ฃจํ ๊ณํ | ์ง์์ ํ ์คํธ ํผ๋๋ฐฑ์ผ๋ก ๋๊ท๋ชจ ํ๊ฒฝ์์ ๋์ | ์ฑ๋ฅ์ด ๊ธฐ๋ฐ LLM์ ์ถ๋ก ๋ฅ๋ ฅ์ ๊ฐํ๊ณ ์ง์ฐ ๊ฐ๋ฅ์ฑ |
| Code as Policies (Liang et al. 2023) | LLM-Empowered | ์ ์ฑ ๋ก์ง์ ์กฐ์จํ๋ ์๊ธฐํ๊ท ์ฝ๋ ์์ฑ | API ํธ์ถ์ ์ ์ฐํ๊ฒ ์ฌ์กฐํฉํด ๋ฏธํ์ต ๋ฌผ์ฒด์ ์ผ๋ฐํ | ๋ณต์กํ ๋ช ๋ น์ ์ทจ์ฝ, ์กด์ฌํ์ง ์๋ ํจ์๋ฅผ ํธ์ถํ๊ธฐ๋ |
| PaLM-E (Driess et al. 2023) | VLM-Empowered | ๊ฑฐ๋ ๋จ์ผ embodied ์ถ๋ก ๋ชจ๋ธ์ ํ ์คํธ ์์ฑ | ์ผ๋ถ ํ๊ฐ ์ค์ ์์ ๋ก๋ด ํ์คํฌ ํนํ ๋ฏธ์ธ์กฐ์ ์์ด ์คํ ๊ฐ๋ฅ ๊ณํ | ๋ฐฐํฌยท๊ตฌ๋์ ๋งค์ฐ ํฐ ์์ ์์ |
| SuSIE (Black et al. 2024) | VLM-Empowered | ์์ฐจ ์๋ธ๊ณจ ์๊ฐํ๋ฅผ ์ํ ์ด๋ฏธ์ง ์์ฑ | ๊ณ ์์ค ์๋ฏธ ์ดํด์ ์ ์์ค ์ ์ด ์ต์ ํ๋ฅผ ๋ถ๋ฆฌ | ์์ฑ ์ด๋ฏธ์ง์ ๋ฌผ๋ฆฌ์ ๋นํ์ค ๋ํ ์ผ์ด ์ ์ด ์ ํธ๋ฅผ ์ค์ผ |
| LEMMo-Plan (Chen et al. 2025b) | LLM-driven ๊ตฌ์กฐํ ๊ณํ (Symbolic) | ์ด๊ฐยทํํ ํฌ ์์ฐ์ PDDL ์ฌ๋ณผ๋ฆญ ๊ณํ์ ํตํฉ | ์ผ์ด๋ธ ์ฅ๋ ฅ ๊ฐ์ โ๋ณด์ด์ง ์๋โ ์ฌ๊ฑด์ ํ ๊ธฐ๋ฐ ์คํฌ ์กฐ๊ฑด์ผ๋ก ์ ์ | PDDL ๊ฒฐํฉ์ด ์ฌ๋ณผ๋ฆญ ํ์์ ๋๋ฆฌ๊ฒ ํด ํ๋์ ์ง์ฐ |
| BETR-XP-LLM (Styrud et al. 2025) | LLM-driven ๊ตฌ์กฐํ ๊ณํ (Behavior Trees) | LLM์ โrepair agentโ๋ก ์ผ์ ์ต์ ์ ์ ์กฐ๊ฑดยท์๋ธํธ๋ฆฌ ์ ์ | ๊ฒ์ฆ ๊ฐ๋ฅํ ์์ ์ ์ ์ฑ ์ ์๊ตฌ ํตํฉ, ์คํจํ ์๋ก ๊ฐ๊ฑดํด์ง | ๋ฐํ์ ํผ๋๋ฐฑยท์ฌ๊ณํ์ LLM์ ์ฐ๋ฉด ํ ํฐยท์ง์ฐ ๋น์ฉ ์ฆ๊ฐ |
โน ์ธ์ด๋ฅผ ์ก์ ๊ณผ ํ ๋ชธ์ผ๋ก โ ํตํฉ VLA (Sec. 7)
์ฌ๊ธฐ์ ์ธ์ด๋ ๋ ์ด์ ์ธ๋ถ ์กฐ๊ฑด์ด ์๋๋ผ ๋ชจ๋ธ์ ํต์ฌ ํํ๊ณผ ํ์ต ๋ชฉ์ ์์ ํจ๊ป ๋ชจ๋ธ๋ง๋๋ค.
์ฃผ๋ชฉํ ์ ์ ์ ์๋ค์ด VLA์ ๊ฒฝ๊ณ๋ฅผ ์ข๊ฒ ์ ์ํ๋ค๋ ๊ฒ์ด๋ค. ๋์ ์ ์ถ๋ ฅ ์ ์(โ์๊ฐ ๊ด์ธก + ์ธ์ด ์ง์๋ฅผ ๋ฐ์ ๋ก๋ด ํ๋์ ๋ธ๋คโ)๋ก๋ CLIPORT๋ ์ด๊ธฐ VLA๋ก ๋ณผ ์ ์์ง๋ง, ์ด ์๋ฒ ์ด๋ CLIPORT๋ฅผ VLM-empowered ์ ์ฑ ์ผ๋ก ๋ถ๋ฅํ๋ค โ CLIP์ด ๊ณ ์ ๋ ์๋ฏธ ๊ทธ๋ผ์ด๋ฉ ๋ชจ๋์ด๊ณ ํ๋ ์์ฑ์ Transporter ์คํ์ผ ์ ์ฑ ์ด ๋ฐ๋ก ํ๊ธฐ ๋๋ฌธ์ด๋ค. ์ด ์๋ฒ ์ด๊ฐ ๋งํ๋ VLA๋ ์ก์ ์์ฑ์ด ์๊ฐ-์ธ์ด ํํ๊ณผ ๋ฐ๊ฒฐํฉํด ํ์ต๋๋ ๊ฒ(์ด์ฐ ์ก์ ํ ํฐ์ ๋ํ ํฌ๋์ด์ฆ, ์ฐ์ ์ก์ ํค๋, ํ์ฐ ๊ธฐ๋ฐ ์์ฑ, flow-matching ์ปจํธ๋กค๋ฌ, VLM ๋ฐฑ๋ณธ์ ๋ถ์ action expert)์ ๋ปํ๋ค. ๊ฒฝ๊ณ๋ฅผ ๋ช ์์ ์ผ๋ก ๊ทธ์ ์๋ฒ ์ด๋ ๋๋ฌผ๊ณ , ์ด๊ฑด ์ค์ ๋ก ์ ์ฉํ๋ค.

VLA taxonomy(Fig. 16) โ Perception โ Reasoning โ Action โ Adaptation์ ์ต์ ํ ๋ฐฉํฅ์ผ๋ก ์๋ฅธ๋ค. Group I: Perception(๋ฐ์ดํฐ ์์คยท์ฆ๊ฐ, ๊ณต๊ฐ ์ดํด, ๋ฉํฐ๋ชจ๋ฌ ์ตํฉ), Group II: Reasoning(์ฅ๊ธฐ ํ์คํฌ, ์ง์ ๋ณด์กด, ์ถ๋ก ยท์๋๋ชจ๋ธ), III: Policy execution, IV: Adaptation. (์๋ฌธ ์บก์ ์ โHierachicalโ, โfllowsโ๋ ์คํ)
7.2 Perception โ ๋ฐ์ดํฐ, 3D, ๊ทธ๋ฆฌ๊ณ ์ด๊ฐ
๋ฐ์ดํฐ. ๋ก๋ด ์์ฐ ์์ง ๋น์ฉ์ด ๊ทผ๋ณธ ๋ณ๋ชฉ์ด๋ฏ๋ก ์ฌ๋ ํ๋ ๋ฐ์ดํฐ๋ก ์ฐํํ๋ค. EgoVLA(Yang et al. 2025d)๋ 1์ธ์นญ ์ฌ๋ ์์์ผ๋ก ์๋ชฉยท์ ๋์์ ์์ธกํ๋๋ก ์ฌ์ ํ์ตํ ๋ค ์์์ ๋ก๋ด ์์ฐ์ผ๋ก ๋ฏธ์ธ์กฐ์ ํ๊ณ , H-RDT(Bi et al. 2026)๋ ์ด 2๋จ๊ณ ํจ๋ฌ๋ค์์ 20์ต ํ๋ผ๋ฏธํฐ ํ์ฐ ํธ๋์คํฌ๋จธ๋ก ํค์ด๋ค. ๋ค๋ง ์์ ๋๋ฆฌ๋ ๊ฒ๋ง์ผ๋ก๋ ์ผ๋ฐํ๊ฐ ์ค์ง ์๋๋ค โ Xing et al. (2025b)๋ ๋๊ท๋ชจ ์งํฉ ๋ฐ์ดํฐ์ ์์ shortcut learning์ด ์๊ธฐ๋ ๋ ์์ธ์ ์ง๋๋ค: (1) ๊ฐ๋ณ ์๋ธ๋ฐ์ดํฐ์ ๋ด๋ถ์ ๋ค์์ฑ ๋ถ์กฑ, (2) dataset fragmentation(์๋ก ๋ค๋ฅธ ๋ฉยท๋ก๋ด์์ ์จ ์๋ธ๋ฐ์ดํฐ์ ๊ฐ ๋ถํฌ ๊ฒฉ์ฐจ). ๊ทธ๋์ ๋ชจ๋ธ์ด ์นด๋ฉ๋ผ ์์ ์ด๋ ๋ฐฐ๊ฒฝ ๊ฐ์ ํ์คํฌ ๋ฌด๊ด ํผ์ฒ์ ์คํฌ์ ์ฐ๊ฒฐํ๋ค. ๋์ฑ ์ ์๋ก์ด ์์ ํฉ์ฑยท์ฅ๋ฉด ๊ฐ ๋ฌผ์ฒด ๊ตํ ๊ฐ์ ๋ก๋ด ๋ฐ์ดํฐ ์ฆ๊ฐ์ด๋ค.
3D. 2D VLM์ โ๊ณต๊ฐ ์ธ์ ๊ฒฉ์ฐจโ๋ฅผ ๋ฉ์ฐ๋ ์ธ ๊ฐ๋๊ฐ ๋๋ ทํ๋ค. (a) 2D ํผ์ฒ์ 3D๋ฅผ ์ฃผ์ โ SpatialVLA(Qu et al. 2025)์ Ego3D Position Encoding + Adaptive Action Grids, PointVLA(Li et al. 2026a)๋ ๋ณ๋ ๊ฒฝ๋ ์ธ์ฝ๋๊ฐ ํฌ์ธํธํด๋ผ์ฐ๋๋ฅผ ์ฒ๋ฆฌํด ๋๊ฒฐ๋ action expert์ ๊ธฐํ ํผ์ฒ๋ง ์ฃผ์ (VLM ๋ฌด๊ฒฐ์ฑ ๋ณด์กด). (b) 3D๋ฅผ 2D๋ก ์ฌํฌ๋งท โ BridgeVLA(Li et al. 2026b)๋ ํฌ์ธํธํด๋ผ์ฐ๋๋ฅผ top/front/side ์ ์ฌ์ 2D ์ด๋ฏธ์ง๋ก ํฌ์ํด ํ์ค VLM ๋ฐฑ๋ณธ์ ๋ฃ๊ณ ๊ฐ์ ํฌ์๋ฉด ์์ 2D ํํธ๋งต์ผ๋ก ํ๋์ ์์ธกํ๋ค. ์ ๋ ฅ๊ณผ ์ถ๋ ฅ์ ํ๋์ 2D ๊ณต๊ฐ์ผ๋ก ํต์ผํ๋ ์๋ฆฌํ ์ค๊ณ์ด๊ณ , ํ์คํฌ๋น 3๊ฐ ๊ถค์ ์ด๋ผ๋ ์ํ ํจ์จ์ด ์ธ์์ ์ด๋ค(๋์ ์ ์ฌ์์์ ๋ชฉํ ํคํฌ์ธํธ๊ฐ ๊ฐ๋ ค์ง ์ ์๊ณ ๋ณต์กํ ์ฅ๊ธฐ ํ์คํฌ์์ ์ฑ๋ฅ์ด ๋จ์ด์ง๋ค). (c) 2Dยท3D ๋ณ๋ ฌ ์ฒ๋ฆฌ ํ ์ตํฉ โ GeoVLA(Sun et al. 2025)๋ ํ์ค VLM์ด 2D+์ธ์ด๋ฅผ, ๋ณ๋ ๋คํธ์ํฌ๊ฐ ํฌ์ธํธํด๋ผ์ฐ๋๋ฅผ ์ฒ๋ฆฌํ ๋ค MoE ๊ธฐ๋ฐ 3D-enhanced Action Expert๋ก ์ตํฉํ๋ค.
์ด๊ฐยทํ. ์กฐ๋ฆฝยท์ฝ์ ๊ฐ์ ์ ์ด ๊ณผ์ ์์๋ ์๊ฐ๋ง์ผ๋ก ๋ถ์กฑํ๋ค. VTLA(Zhang et al. 2026a)๋ ์ด๊ฐ ์ด๋ฏธ์ง ์ํ์ค๋ฅผ ํ ํฐํํ๊ณ DPO 2๋จ๊ณ ํ์ต์ผ๋ก โVLM์ ๋ถ๋ฅ ๋ชฉ์ โ๏ธ ์ฐ์ ๋ก๋ด ์ ์ดโ์ ๋ถ์ผ์น๋ฅผ ๋ค๋ฃฌ๋ค. Tactile-VLA(Huang et al. 2025a)๋ ์ ์ฑ ์ถ๋ ฅ์ด ๋ชฉํ ํ๊ณผ ๋ชฉํ ์์น๋ฅผ ํจ๊ป ์์ธกํ๊ฒ ํด โgentlyโ, โhardโ ๊ฐ์ ํ ๊ด๋ จ ๋ถ์ฌ๋ฅผ ์ดํดํ๊ฒ ํ๊ณ , ์คํจ ์ ์ด๊ฐ ํผ๋๋ฐฑ์ ํด์ํ๋ CoT ๋ฉ์ปค๋์ฆ์ ๋ฃ๋๋ค. ์ผ์ ์ด์ง์ฑ(GelSight๋ฅ vs ํ ๊ธฐ๋ฐ)์ OmniVTLA(Cheng et al. 2025)์ ์ด์ค ๊ฒฝ๋ก ์ธ์ฝ๋ + ๊ต์ฐจ๋ชจ๋ฌ ๋์กฐ ํ์ต์ผ๋ก, ์ตํฉ ๋ฐฉ์์ ForceVLA(Yu et al. 2026)์ force-aware MoE ๊ธฐ๋ฐ ๋์ late fusion์ผ๋ก ๋์ํ๋ค.
๊ด๋ จ: ์ด๊ฐ์ VLA์ ๋ น์ด๋ ๊ณ์ด์ ์ด ๋ธ๋ก๊ทธ์ Tactile-VLA ๋ฆฌ๋ทฐ์์ ์ ๋ ผ๋ฌธ ์์ค์ผ๋ก ๋ณผ ์ ์๋ค. ์ ์ด ์ํฉ์ ์ปดํ๋ผ์ด์ธ์ค๋ฅผ VLM์ผ๋ก ์กฐ์ ํ๋ ์ต๊ทผ ํ๋ฆ์ CompliantVLA ๋ฆฌ๋ทฐ๋ฅผ ์ฐธ๊ณ .
7.3 Reasoning โ ๊ณํ, ์ง์ ๋ณด์กด, ์๋๋ชจ๋ธ
์ฅ๊ธฐ ๊ณํ ์ ๋ต์ ์ ์ด๋ค. ๊ณ์ธต์ ๋ถํด(LoHoVLA, DexVLA๊ฐ ํตํฉ ๋ชจ๋ธ์ด ๋จผ์ ์ธ์ด ์๋ธํ์คํฌ๋ฅผ ์์ฑํ๊ณ ๊ทธ ์๊ธฐ์์ฑ ์ง์๋ก ํ๋์ ์์ธก โ โthink before you actโ), phase-aware control(Long-VLA๊ฐ ๊ฐ ์๋ธํ์คํฌ๋ฅผ โmoving phaseโ์ โinteraction phaseโ๋ก ๋๋๊ณ phase-aware ์ ๋ ฅ ๋ง์คํน์ผ๋ก ์ด๋ ์์ ๊ด๊ฐ, ์กฐ์ ์์ ๊ทธ๋ฆฌํผ ๋ทฐ๋ฅผ ๋ณด๊ฒ ๊ฐ์ โ skill chaining ๋ฌธ์ ๋ฅผ ๊ฒจ๋ฅ), memory-augmented reasoning(MemoryVLA๊ฐ Perceptual-Cognitive Memory Bank๋ก ์ ์์ค ์ง๊ฐ ๋ํ ์ผ๊ณผ ๊ณ ์์ค ์๋ฏธ ์์ฝ์ ํจ๊ป ์ ์ฅยท๊ฒ์ํด, ์ฃผ๋ฅ VLA๊ฐ ์ฌ์ค์ โmemorylessโ์ธ ๋ฌธ์ ๋ฅผ ํผ๋ค).
์ง์ ๋ณด์กด์ ์ด ์ ์์ ๊ฐ์ฅ ํฅ๋ฏธ๋ก์ด ๋๋ชฉ์ด๋ค. VLA๋ฅผ ๋ง๋๋ ์ด์ ๊ฐ VLM์ ๋ฐฉ๋ํ ์๋ฏธ ์ง์์ ์ฐ๊ธฐ ์ํด์์ธ๋ฐ, ์ข์ ๋ก๋ด ๋ฐ์ดํฐ๋ก ๋ฏธ์ธ์กฐ์ ํ๋ฉด ๋ฐ๋ก ๊ทธ ๋ฅ๋ ฅ์ด ์ฌ๋ผ์ง๋ค(catastrophic forgetting). ChatVLA(Zhou et al. 2025b)๋ ์์ธ์ ๋๋ก ์ง๋จํ๋ค โ spurious forgetting(๋ก๋ด ๋ฐ์ดํฐ ํ์ต์ด ์๊ฐ-ํ ์คํธ ์ ๋ ฌ์ ๋ฎ์ด์)๊ณผ task interference(์ ์ด์ ์ดํด์ ๋ชฉ์ ์ด ๊ฒฝ์). ๋์์ ๋ค ๊ฐ๋๋ก ๊ฐ๋ฆฐ๋ค:
- ์ํคํ ์ฒ ๊ฒฉ๋ฆฌ: MoE๋ก ํ ๋ชจ๋ธ ์์ โ์ ๋ฌธ๊ฐโ๋ฅผ ๋ถ๋ฆฌ(ChatVLA, ChatVLA-2).
- ํ์ต ๋์ญํ ๋ณดํธ: Driess et al. (2026)์ knowledge insulation โ action expert์์ VLM ๋ฐฑ๋ณธ์ผ๋ก ๊ฐ๋ ๊ทธ๋๋์ธํธ๋ฅผ ๋๊ณ , ๋์ ์ด์ฐํ๋ ํ๋์ ๋ํ ์๊ธฐํ๊ท ๋ค์ ํ ํฐ ์์ธก ์์ค์ ๋ณ๋ ฌ ํ์ต ์ ํธ๋ก ์ค๋ค. MoE๊ฐ ๊ทธ๋ํ์ โ๋ชจ๋ธ ๊ตฌ์กฐโ๋ฅผ ๋ฐ๊พธ๋ ๋ฐ๋ฉด ์ด์ชฝ์ โํ์ต ๊ทธ๋ํโ๋ฅผ ๋ฐ๊พผ๋ค.
- ๋ฐ์ดํฐ ์ค์ฌ co-training: InstructVLA(Yang et al. 2025e)๋ catastrophic forgetting์ด ๋ก๋ด ๋ฐ์ดํฐ์ ์ ์ง์ ๋ค์์ฑ ๋ถ์กฑ์์ ์ ํ๋๋ค๊ณ ๋ณด๊ณ ๋ค์ํ ์ง์ยท์บก์ ยทQA ๋ฐ์ดํฐ์ ์ ํ๋ ์ด์ ํ๋ค. GR-3(Cheang et al. 2025)๋ ์น ๊ท๋ชจ ๋น์ -์ธ์ด ๋ฐ์ดํฐ์์ ๋๊ท๋ชจ co-training์ผ๋ก ๊ฐ์ ํจ๊ณผ๋ฅผ ๋ธ๋ค.
- ์ถ๋ก ์ ํธ ์ฃผ์ : DiffusionVLA(Wen et al. 2025c)์ โreasoning injection moduleโ์ด ์๊ธฐ์์ฑ ํ ์คํธ ์ถ๋ก ์ ํ์ฐ ์ ์ฑ ์ ์๋ฒ ๋ฉํ๋ค.
๋ด๋ถ ์๋๋ชจ๋ธ: Seer(Tian et al. 2025)๊ฐ ๋ฏธ๋ ์๊ฐ ์ํ๋ฅผ ์์ธกํ๊ณ ์ญ๋์ญํ์ผ๋ก ํ๋์ ์ ํ๋ ํจ๋ฌ๋ค์์ ์ธ์ ๊ณ , CoT-VLA(Zhao et al. 2025)๋ ์๋ธ๊ณจ ์ด๋ฏธ์ง๋ฅผ ๋ช ์์ ์ถ๋ก ๋จ๊ณ๋ก ์์ฑํ๋ค(โthink visuallyโ). WorldVLA(Cen et al. 2025)๋ ์ก์ ๋ชจ๋ธ๊ณผ ์๋๋ชจ๋ธ์ ํ๋์ ์๊ธฐํ๊ท ํ๋ ์์ํฌ๋ก ์๋ฐฉํฅ ๊ฒฐํฉํ๋ค(์ํ+๋ชฉํโํ๋, ์ํ+ํ๋โ๋ค์ ์๊ฐ ์ํ). ํฝ์ ์์ธก์ ๋นํจ์จ(์ ์ ๋ฐฐ๊ฒฝ ๊ฐ์ ๋ฌด๊ด ์ ๋ณด ํฌํจ)์ ๋ํด DreamVLA(Zhang et al. 2026b)๋ ํฝ์ ๋์ ์์ถ๋ โworld embeddingโ ์ ์์ธกํ๊ณ ๋ธ๋ก ๋จ์ ๊ตฌ์กฐํ ์ดํ ์ ์ผ๋ก ์ง์ ์ข ๋ฅ๋ฅผ ๋ถ๋ฆฌํ๋ค.
๊ด๋ จ: โํฝ์ ์ฌ๊ตฌ์ฑ ๋์ ์๋ฏธ์ ์ง์์๋ต์ผ๋ก ์ธ๊ณ๋ฅผ ๋ชจ๋ธ๋งํ๋คโ๋ ๋์์ ์ ๊ทผ์ Semantic World Models ๋ฆฌ๋ทฐ์์ ๋ณผ ์ ์๋ค. Sec. 9.2์ ์๋๋ชจ๋ธ ๋ ผ์๊ณผ ํจ๊ป ์ฝ์ผ๋ฉด ์ข๋ค.
7.4 Action โ ์ด์ฐ ํ ํฐ์์ ์ฐ์ ์ฒญํฌ๋ก
์ด๊ธฐ VLA(OpenVLA ๋ฑ)์ ์ด์ฐ ์ก์ ํ ํฐ์ ์ฐ์ ๋์์ ์ถฉ์ค๋์ ๋ถ๋๋ฌ์์ ์ ํํ๋ค. ฯ0(Black et al. 2025b)๋ ์ฌ์ ํ์ต VLM ๋ฐฑ๋ณธ์ ์ ์ฉ action expert๋ฅผ ๋ถ์ฌ flow matching์ผ๋ก ์ฐ์ ์ก์ ์ฒญํฌ(50 Hz ๊ถค์ )๋ฅผ ์์ฑํ๋ค โ ์ ๋ฐ๋ ๋ฌธ์ ๋ ํ์ง๋ง ํ์ต ์ฐ์ฐ ๋น์ฉ์ด ๋๊ณ , ์๋ฒ ์ด Table 5์ ํํ์ผ๋ก๋ โ๋๊ท๋ชจยท๋ค์ํ ํ์ต ๋ฐ์ดํฐ(10,000์๊ฐ)โ ๋ฅผ ์๊ตฌํ๋ค.
ํจ์จ ์ชฝ์์๋ Pertsch et al. (2025)์ ์ง๋จ์ด ๋ ์นด๋กญ๋ค: ์๊ธฐํ๊ท VLA์ ์ ์กฐํ ์ฑ๋ฅ์ ์ฐ์ ์ก์ ํ ํฐ๋ค์ด ์๋ก ๋งค์ฐ ์๊ด๋์ด ๋ค์ ํ ํฐ ์์ธก์ด ์ฝํ ํ์ต ์ ํธ๊ฐ ๋๊ธฐ ๋๋ฌธ์ด๋ค. FAST(Frequency-space Action Sequence Tokeniser)๋ ์ด์ฐ ์ฝ์ฌ์ธ ๋ณํ์ผ๋ก ์ก์ ์ํ์ค๋ฅผ ์ฃผํ์ ์์ญ์์ ์์ถํด ์๊ฐ์ ์ค๋ณต์ ์ ๊ฑฐํ๊ณ , ์๋ฒ ์ด ์ธ์ฉ์ ๋ฐ๋ฅด๋ฉด ฯ0 flow matching๊ณผ ๋๋ฑํ ์ฑ๋ฅ์ ์ต๋ 5๋ฐฐ ์งง์ ํ์ต ์๊ฐ์ผ๋ก ๋ฌ์ฑํ๋ค. ฯ0.5(Black et al. 2025a)๋ ์ฌ์ ํ์ต์ FAST ํ ํฌ๋์ด์ ๋ฅผ, ํํ์ต์ flow-matching action expert๋ฅผ ์จ ์ด์ฐยท์ฐ์์ ํจ๊ป ํ์ตํ๊ณ , ๋ฐํ์์๋ ๊ณ ์์ค ์๋ธํ์คํฌ(ํ ์คํธ)๋ฅผ ๋จผ์ ์์ธกํ ๋ค ์ฐ์ ๋ช ๋ น์ผ๋ก ์ ์ ํ๋ค. Discrete Diffusion VLA(Liang et al. 2025)๋ ์์ ์ก์ ์ฒญํฌ๋ฅผ ๋จ์ผ ํธ๋์คํฌ๋จธ ์์ ์ด์ฐ ํ์ฐ ๊ณผ์ ์ผ๋ก ๋ชจ๋ธ๋งํด VLM ๋ฐฑ๋ณธ๊ณผ ๋์ผํ ๊ต์ฐจ์ํธ๋กํผ ๋ชฉ์ ์ ๊ณต์ ํ๋ค.
๊ด๋ จ: ฯ0์ ์ ๋ ผ๋ฌธ ๋ฆฌ๋ทฐ๋ ฯ0 ๋ฆฌ๋ทฐ์ ์๋ค. VLA์ ์จ๋ผ์ธ RL์ ๋ถ์ฌ ์ ๋ฐ๋๋ฅผ ์ฌ๋ฆฌ๋ ํ๋ฆ์ RL Token ๋ฆฌ๋ทฐ ์ฐธ๊ณ .
7.5 Adaptation โ ๋ฐฐํฌ ๊ฐ๋ฅ์ฑ์ ๋ฌธ์
OpenVLA-OFT(Kim et al. 2025b)๊ฐ ๋ํ๋ค. ๋ณ๋ ฌ ๋์ฝ๋ฉ + action chunking + ์ฐ์ ์ก์ ์์ธก(L1 ํ๊ท)์ผ๋ก LIBERO ์ฑ๊ณต๋ฅ 20% ๊ฐ์ , OpenVLA ๋๋น ์ ์ด ์ฃผํ์ 26๋ฐฐ(Sec. 7.5 ๋ณธ๋ฌธ)๋ฅผ ๋ณด๊ณ ํ๋ค. ๊ฐ์ ๋ ผ๋ฌธ์ ๋ํด Table 5๋ โ์ถ๋ก ์๋ 25โ50ร ๊ฐ์ โ ์ด๋ผ๊ณ ์ ๋๋ฐ, ๋ ์์น๋ ์ธก์ ๋์์ด ๋ค๋ฅด๋ฏ๋ก(์ ์ด ์ฃผํ์ vs ์ถ๋ก ์๋) ๋ชจ์์ ์๋๋ ์ธ์ฉํ ๋ ๊ตฌ๋ถ์ด ํ์ํ๋ค. ControlVLA(Li et al. 2025c)๋ ๋ฌผ์ฒด ์ค์ฌ ํํ์ zero-initialized layer๋ก ์ฃผ์ ํด 10โ20๊ฐ ์์ฐ๋ง์ผ๋ก ์ ๋ฌผ์ฒดยท๋ฐฐ๊ฒฝ์ ์ ์ํ๋ค(GroundingDINOยทSAM2 ๊ฐ์ ์ธ๋ถ ์๊ฐ ๋ชจ๋ธ์ ์์กด, ํ๊ฐ๊ฐ ๋จ์ผ ํ ์ค๋ด๋ก ํ์ ). ํํ์ต ๊ณ์ด๋ก ConRFT(Chen et al. 2025g)์ RIPT-VLA(Tan et al. 2025)๊ฐ ํ์คํฌ ๋ณด์ยท์จ๋ผ์ธ ์ํธ์์ฉยท์ฌ๋ ๊ฐ์ ์ผ๋ก ์คํจ๋ฅผ ๊ต์ ํ๋ค.
Table 5 & Table 10 โ VLA ๊ณ์ด ์ ๋ฆฌ (์๋ฌธ ํ ์ฌํ)
| Method | ์ต์ ํ ๋ฐฉํฅ | ํต์ฌ ๋ฉ์ปค๋์ฆ | ์ฅ์ | ๋จ์ |
|---|---|---|---|---|
| EgoVLA (Yang et al. 2025d) | Perception | 1์ธ์นญ ์ฌ๋ ์์์ผ๋ก ํ๋ ์์ธก ์ฌ์ ํ์ต ํ ๋ก๋ด ๋ฐ์ดํฐ๋ก ๋ฏธ์ธ์กฐ์ | ๋๊ท๋ชจยท๊ณ ๋น์ฉ ๋ก๋ด ๋ฐ์ดํฐ ์์ง ์์กด์ ํฌ๊ฒ ๋ฎ์ถค | ์ฌ๋โ๏ธ๋ก๋ด โembodiment gapโ์ ๋ฉ์ธ ๊ฐ๊ฑดํ ์ก์ ๋ฆฌํ๊ฒํ ํ์ |
| BridgeVLA (Li et al. 2026b) | Perception | 3D ํฌ์ธํธํด๋ผ์ฐ๋๋ฅผ ๋ค์ค๋ทฐ 2D๋ก ํฌ์ํ๊ณ 2D ํํธ๋งต์ผ๋ก ํ๋ ์์ธก | ๋งค์ฐ ๋์ ์ํ ํจ์จ(ํ์คํฌ๋น 3๊ถค์ ), ์๊ฐ ๊ต๋ยท์ ์ง์์ ๊ฐ๊ฑด | 2D ์ ์ฌ์์์ ๋ชฉํ ํคํฌ์ธํธ ๊ฐ๋ฆผ, ๋ณต์กํ ๋ค๋จ๊ณ ์ฅ๊ธฐ ํ์คํฌ์์ ์ฑ๋ฅ ํ๋ฝ |
| CoT-VLA (Zhao et al. 2025) | Reasoning | ์ค๊ฐ ์๋ธ๊ณจ ์ด๋ฏธ์ง๋ฅผ ์๊ฐ์ chain-of-thought๋ก ์๊ธฐํ๊ท ์์ฑ | ๋ชฉํ ์ํ๋ฅผ ๋ช ์์ ์ผ๋ก ์๊ฐํํด ๋ค๋จ๊ณ ์ถ๋ก ยท๋ณต์ก ์ง์ ์ํ ๊ฐ์ | ์ด๋ฏธ์ง ํ ํฐ ์์ฑ์ ํฐ ์ฐ์ฐ ๋ถ๋ด, OOD ์๋ธ๊ณจ ํฉ์ฑ์ ์ทจ์ฝ |
| MemoryVLA (Shi et al. 2026) | Reasoning | ํ์คํฌ ๋งฅ๋ฝยท์๊ฐ ์ด๋ ฅ์ ์ ์งํ๋ ๋ช ์์ ๋ฉ๋ชจ๋ฆฌ | ์ฅ๊ธฐ ํ์คํฌ์ ๋งฅ๋ฝ ์์ค ์ํ | ์ปค์ง๋ ๋ฉ๋ชจ๋ฆฌ ๋ฒํผ์ ๊ด๋ฆฌยท๊ฒ์์ด ๊ตฌ์กฐ์ ยท์ฐ์ฐ์ ๋ถ๋ด |
| ฯ0 (Black et al. 2025b) | Action | ์ฌ์ ํ์ต VLM์ flow-matching action expert๋ฅผ ๋ถ์ฌ ๊ณ ์ฃผํ ์ฐ์ ํ๋ ์ถ๋ ฅ | ์๋ฏธ ์ถ๋ก ๊ณผ ์ ๋ฐ ์ฐ์ ๋ชจํฐ ์ ์ด๋ฅผ ์ฐ๊ฒฐ, ๊ณ ๋๋ ๋ค๋จ๊ณ ํ์คํฌ ๊ฐ๋ฅ | ๋ฐฉ๋ํ๊ณ ๋ค์ํ ํ์ต ๋ฐ์ดํฐ ํ์(10,000์๊ฐ) |
| ControlVLA (Li et al. 2025c) | Adaptation | ๋ฌผ์ฒด ์ค์ฌ ํํ์ zero-initialized layer๋ก ์ฃผ์ | ๋งค์ฐ ๋ฐ์ดํฐ ํจ์จ์ (10โ20 ์์ฐ), ๋ฏธํ์ต ๋ฌผ์ฒดยท๋ฐฐ๊ฒฝ์ ๊ฐ๊ฑด | ์ธ๋ถ ์๊ฐ ๋ชจ๋ธ(GroundingDINO, SAM2) ์์กด, ํ๊ฐ๊ฐ ๋จ์ผ ํ ์ค๋ด๋ก ํ์ |
| OpenVLA-OFT (Kim et al. 2025b) | Adaptation | ์๊ธฐํ๊ท ์ด์ฐ ์์ธก์ ๋ณ๋ ฌ ๋์ฝ๋ฉยทaction chunkingยท์ฐ์ L1 ํ๊ท๋ก ๋์ฒด | ์ถ๋ก ์๋ 25โ50ร ๊ฐ์ , ์ค์๊ฐ ์ ์ด ์ง์ฐ ๊ฐ์, ์ฑ๊ณต๋ฅ ๋ ์์น | ๋ณต์กํ ๋ฉ๋ชจ๋ฆฌ ์์กด ํ์คํฌ์ ์ทจ์ฝ, ๊ณ ๋๋ก ๋ค์ค๋ชจ๋์ธ ํ๋ ๋ถํฌ ๋ชจ๋ธ๋ง ์ญ๋ ๋ถ์กฑ ๊ฐ๋ฅ |
(์๋ฌธ Table 5์ โAdaptatingโ ํ๊ธฐ๋ ์คํ๋ก ๋ณด์ด๋ฉฐ, ์ฌ๊ธฐ์๋ Adaptation์ผ๋ก ์ฎ๊ฒผ๋ค.)
๋ถ๋ก Table 10์ ์ ๊ณ์ด์ ์ค๊ณ ์ฐจ์์ ์ฒดํฌ๋ฐ์ค ํ๋ก ํ์ฅํ๋ค. ๊ด์ธก(RGB/D/ROB/TX), ์ก์ ์์ฑ(FM/DM/AR/DP), VLM ์ ์ฑ ๋ฉ์ปค๋์ฆ(CoT/Future Prediction/Memory), ์ฌ์ ํ์ต(Multiple Datasets / Cross-embodiment), ํ๊ฐ ์๋๋ฆฌ์ค(Multi-scenario / Real World / Cross-embodiment Execution)๋ฅผ ํ ๋์ ๋์กฐํ๋ค. ์ด ํ๋ฅผ ํ์ผ๋ฉด CoT๋ฅผ ์ฐ๋ VLA๋ ์์ง ์์์ด๊ณ , Future Prediction์ โReasoning & World Modelsโ ๊ทธ๋ฃน์ ๋ชฐ๋ ค ์์ผ๋ฉฐ, ๋๋ถ๋ถ์ด RGB+ROB+TX๋ผ๋ ๋์ผํ ๊ด์ธก ์กฐํฉ์ ์๋ ดํ๋ค๋ ์ฌ์ค์ด ๋ฐ๋ก ๋ณด์ธ๋ค.

VLA ์ค๊ณ ์ฐจ์ ๋์กฐํ(Table 10, ๋ถ๋ก A) โ ์ต์ ํ ๋ฐฉํฅ๋ณ๋ก 35๊ฐ ๋ชจ๋ธ์ ๊ด์ธกยท์ก์ ์์ฑยทVLM ์ ์ฑ ยท์ฌ์ ํ์ตยทํ๊ฐ ์๋๋ฆฌ์ค๋ก ์ ๋ฆฌํ๋ค. Time ์ด์ ์ต์ ํญ๋ชฉ์ 2025-09(ForceVLA)๋ค.
์ง๊ตํ๋ 5์ถ ๋น๊ต ๋ถ์ (Sec. 8)
์ฌ๊ธฐ๋ถํฐ๊ฐ โ์ด ์๋ฒ ์ด๋ฅผ ์ฝ๋ ์ด์ โ์ ํ๋ฐ๋ถ๋ค. ๊ธฐ๋ฅ์ ๋ถ๋ฅ๋ what role์ ๋งํด์ฃผ์ง๋ง, ๋ฐฐ์น ๊ฐ๋ฅ์ฑ์ ๋ค๋ฅธ ์ถ์์ ๊ฒฐ์ ๋๋ค.
8.1 Action granularity โ skill / trajectory / low-level
- Skill-level: ์ฌ์ ์ ์๋ ์คํฌ์ด๋ API๋ฅผ ๋ถ๋ฅธ๋ค(SayCan, Code as Policies, Inner Monologue, ReKep, TAMP ๊ณ์ด). ์ธ์ด์ ์ ๋ง๋๋ค(โ์คํฌ์ ์์ฐ์ด ๋จ์โ). ์ฃผ ์คํจ ์์์ skill library uncoverage โ ์ ์ฑ ์ด ์๊ตฌํ ํ๋ฆฌ๋ฏธํฐ๋ธ๊ฐ ๋ผ์ด๋ธ๋ฌ๋ฆฌ์ ์๋ค. ๋์์ affordance/value ํํฐ, ์์ฑ ์ฝ๋์ ์คํค๋ง ๊ฒ์ฆ, ์ฅ๋ฉด ์ธ์ง ์ฑ๊ณต ๊ฒ์ฌ + ์ฌ๊ณํ.
- Trajectory-level: ์๋์ดํํฐ ์จ์ดํฌ์ธํธยท๊ถค์ ์ ๋ธ๋ค(๋๋ถ๋ถ์ ์ธ์ด ์กฐ๊ฑด IL, ํ์ฐ ์ ์ฑ ). ํํ๋ ฅ๊ณผ ์ธ์ด ์กฐ๊ฑดํ์ ๊ท ํ์ . ์ฃผ ์คํจ ์์์ covariate shift๋ก ์ธํ ๊ถค์ ํ๋ฅ์ compounding error, ๋์์ receding-horizon ์ฌ๊ณํ๊ณผ ๊ฐ์ ๊ธฐ๋ฐ ๋ฐ์ดํฐ ์ง๊ณ.
- Low-level control: 100 Hz+ ๊ด์ ํ ํฌ/์๋. ์ ์ด์ด ์ง๋ฐฐํ๋ ๊ณผ์ (์ ๊ต ์กฐ์, ๋ณํ์ฒด)์ ํ์ํ๋ค. EUREKA๊ฐ ํ ์คํผ๋ ๊ฐ์ ์ ์์ค ์คํฌ์ ๋ณด์์ ์งํ์ ์ผ๋ก ๋ง๋ค๊ณ , Bi-LAT(Kobayashi et al. 2025)๋ ์์ธก ์ ์ด(bilateral control) ์๊ฒฉ์กฐ์์ผ๋ก ์์นยท์๋๋ฟ ์๋๋ผ ๊ด์ ํ ํฌ๊น์ง ๊ธฐ๋กํด โsoftly/strongly twist the spongeโ ๊ฐ์ ์ง์๊ฐ ํ ์ถ๋ ฅ์ ๋ณ์กฐํ๊ฒ ํ๋ค. ManiFoundation(Xu et al. 2024)์ ์กฐ์์ contact synthesis ๋ฌธ์ ๋ก ์ฌ์ ์ํํ๋ค. TA-VLA(Zhang et al. 2025d)๋ โํ ํฌ ์ธ์ง VLAโ์ ์ค๊ณ ๊ณต๊ฐ์ ์ ๋ฆฌํ๋ค โ (i) ํ ํฌ ์ ํธ๋ ์ก์ ๋์ฝ๋์ ๋ฃ๋ ๊ฒ์ด ์ข๊ณ (๊ด์ ๊ฐ ๊ฐ์ ๊ณ ์ ์์ฉ ์ ํธ์ ์ ๋ ฌ๋จ), (ii) ํ ํฌ ์ด๋ ฅ์ ๋จ์ผ ํ ํฐ์ผ๋ก ์์ฝ ๊ฐ๋ฅํ๋ฉฐ, (iii) ๋ฏธ๋ ํ ํฌ ์์ธก ๋ณด์กฐ ํ์คํฌ๊ฐ ์ฑ๋ฅ์ ์ฌ๋ฆฐ๋ค.
์๋ฒ ์ด๊ฐ ์ง๋, ์ ๋๋ถ๋ถ์ด ์ฌ์ ํ ๊ถค์ ์์ค์ ๋จธ๋ฌด๋๊ฐ์ ๋ํ ๋ต ๋ ๊ฐ์ง๊ฐ ์ค์ฉ์ ์ด๋ค: (a) ๋ฐ์ดํฐ ๋ผ๋ฒจ๋ง โ ์ ํํ ํ ์ผ์ฑ๊ณผ ๊ด์ ๋ณ ์บ๋ฆฌ๋ธ๋ ์ด์ ์ด ๋ถ์ ์๊ฐ ์ ๋ ฌ ํ ํฌ ๋ผ๋ฒจ์ ๋น์ธ์ง๋ง ๊ถค์ ์ ์๊ฒฉ์กฐ์์ผ๋ก ์ฝ๊ฒ ์ป๊ณ ๋ ธ์ด์ฆ๋ ์ ๋ค. (b) sim-to-real โ ๋ง์ฐฐยท์ปดํ๋ผ์ด์ธ์คยท์ก์ถ์์ดํฐ ๋์ญํ ์๋ฎฌ๋ ์ด์ ์ด ์ด๋ ค์ ํ ํฌ ์์ค ์ ์ฑ ์ ์๋ฎฌ๋ ์ดํฐ ๋ฌผ๋ฆฌ์ ๊ณผ์ ํฉ๋์ง๋ง, ๊ถค์ ์ถ๋ ฅ์ ๊ฐ๊ฑดํ ์ ์์ค ์ปจํธ๋กค๋ฌ๊ฐ ์ถ์ข ํด ์ฃผ๋ฉด ์ ์ด๊ฐ ๋งค๋๋ฝ๋ค.
8.2 Data and supervision regimes
๋ฐ์ดํฐ ์์ค๋ (i) ๋ก๋ด ์ํธ์์ฉ ๋ฐ์ดํฐ, (ii) ์น ๊ท๋ชจ ๋ฐ์ดํฐ๋ก ๋๋๊ณ , ์ ์๋ ๋ค์ ์ ๋ฌธ๊ฐ ์์ฐ(RT-1์ 130k ์์ฐ ๋ฑ, ๊ณ ํ์ง์ด์ง๋ง ๋น์ธ๋ค)๊ณผ ๋น๊ตฌ์กฐ์ play data(๋ผ๋ฒจ ์์ด ์์ ๋กญ๊ฒ ์ํธ์์ฉํ ๋ก๊ทธ, ์ฌํ์ ์ธ์ด๋ก relabelingํด ์ด๋ค โ Learning from Play, MCIL์ 1% ์ธ์ด ๋ผ๋ฒจ๋ก ํ์ต)๋ก ๊ฐ๋ฆฐ๋ค.
๊ฐ๋ ํํ๋ ์ ์ด๋ค. Target labels(per-sample ์ ๋ต ๋ชจ์ฌ: RT-2, OpenVLA, Octo), Outcome evaluations(์คํ์์ ๋์จ ์ค์นผ๋ผ: ์ฌ๋์ด ์ ์ํ๊ฑฐ๋ VLM ์ฑ๊ณต ๊ฐ์ง๊ธฐยทLLM ๋ณด์ ์์ฑ์ด ๋ง๋ ๋ค), Auxiliary supervision(visual attention: region-text alignmentยทkeypoint/graspability map / reconstruction: imageยทvideo ์ฌ๊ตฌ์ฑ / future prediction: ๋ค์ ์ํยทkeyframe ์์ธก). ๊ทธ๋ฆฌ๊ณ ์์ ๋ณธ \mathcal{L}_{\text{final}} = \lambda_1 \mathcal{L}_{\text{targets}} + \lambda_2 \mathcal{L}_{\text{evaluations}} + \lambda_3 \mathcal{L}_{\text{auxiliary}} ๋ก ๋ฌถ์ธ๋ค. ์ธ ๊ณ์ด์ ๊ฐ๋ ์ ํ๋์ ๋ชฉ์ ํจ์์ ์ปค๋ฆฌํ๋ผ์ผ๋ก ํตํฉํ ์์ ์ ์ด ์๋ฒ ์ด์ ๋ ์์ ๊ธฐ์ฌ์ ๊ฐ๊น๋ค.
8.3 System cost and latency โ ์ด ์๋ฒ ์ด์์ ๊ฐ์ฅ ์ค์ฉ์ ์ธ ํ
ํ์ต ๋น์ฉ์ ์ธ ์ ๋ต์ผ๋ก ๋๋๋ค: from scratch(Gato์ฒ๋ผ ํ ํฐํ๋ ์ด๋ฏธ์งยทํ ์คํธยทํ๋์ ์ฒ์๋ถํฐ โ ์์ฒญ๋ ๋ฐ์ดํฐยทGPU ์๊ตฌ), fine-tuning(RT-2๊ฐ PaLI-XยทPaLM-E ์์ ๋ก๋ด ๋ฐ์ดํฐ๋ฅผ ์น๋ ์ โ ์ฌ์ ์ง์์ ์ด๋ฆฌ์ง๋ง ๊ณผ์ ํฉยท๋ง๊ฐ์ ์ํ), prompt engineering(FM ๋๊ฒฐ, ์ถ๋ก ์ ํ๋กฌํํธ๋ก๋ง โ ์ถ๊ฐ ๋ก๋ด ํ์ต์ด 0์ด๊ณ ๊ฐ๋ฐฉํ ์ง์์ด ๊ทธ๋๋ก ์ค์ง๋ง, ์๋ฒ ๋๋จผํธ์ ๋ถ๋ฆฌ๋ผ ๊ฐ๋ฃจํยทํ๊ฐยท์ฅ๊ธฐ ํ์คํฌ ์ทจ์ฝ).

์ถ๋ก ๋น์ฉยท์ง์ฐ(Table 6) โ ํ๋ผ๋ฏธํฐ ์, ํ๋์จ์ด, ์ ์ด ์ฃผํ์, ํด๋ผ์ฐ๋ ์์กด ์ฌ๋ถ. โโโ๋ ๋ฏธ๋ณด๊ณ ,โ*โ๋ ์ํคํ ์ฒ์์ ์ถ๋ก ํ ๊ฐ, Cloud๋ ์๊ฒฉ ์ปดํจํธ ์ถ๋ก ์ ๋ปํ๋ค.
์ด ํ์ ๊ฐ์ ์ซ์๋ณด๋ค โ๋ฌด์์ด ๋น์ด ์๋๊ฐโ ์ ์๋ค. RT-1(35M)์ด ~3Hz, RT-2(5B/55B)๊ฐ TPU์์ 1โ3Hz, OpenVLA(7B)๊ฐ RTX 4090์์ 3โ6Hz, CLIP-RT(1B)๊ฐ 8โ16Hz. ํ์ฐ ์ ์ฑ ์ชฝ์ Diffusion Policy(~200M*)๊ฐ ~1Hz, DP3(~150M*)๊ฐ 5โ6Hz, ManiCM(~200M*)์ด RTX 4090์์ ~50โ60Hz. ๊ทธ๋ฐ๋ฐ PaLM-SayCan(540B)๊ณผ PaLM-E(562B)์ ์ง์ฐ ์นธ์ โโโ(๋ฏธ๋ณด๊ณ ) ์ด๊ณ , ์ฌ๋ฌ ํญ๋ชฉ์ ํ๋์จ์ด ์นธ๋ ๋น์ด ์์ผ๋ฉฐ, ํ์ฐ ์ ์ฑ ํ๋ผ๋ฏธํฐ ์๋ ์ ์๋ค์ด ์ํคํ ์ฒ์์ ์ถ์ ํ ๊ฐ์ด๋ค.
์ด ๊ณต๋ฐฑ์ด ๊ณง Sec. 9.3์ ์ฃผ์ฅ์ผ๋ก ์ด์ด์ง๋ค. ์๋ฌธ ํํ์ ๊ทธ๋๋ก ์ฎ๊ธฐ๋ฉด: โWe note that latency is not consistently treated as a first-class evaluation metric in the literature, and often it is mentioned only in footnotes. To assess real-world feasibility, we strongly encourage authors to report latency prominently as a primary performance metric.โ ์๋ฒ ์ด๊ฐ ์ปค๋ฎค๋ํฐ์ ๋์ง๋ ๊ฐ์ฅ ๊ตฌ์ฒด์ ์ธ ์ ์์ด๊ณ , ์ด ํ๋ ๊ทธ ์ ์์ ์ฆ๊ฑฐ๋ฌผ์ด๋ค.
8.4 Environments and evaluations
์๋ฎฌ๋ ์ดํฐ 6์ข (Table 7: PyBullet, MuJoCo, CoppeliaSim, NVIDIA Omniverse, Unity, UniSim)๊ณผ ๋ฒค์น๋งํฌ 11์ข ์ ์ ๋ฆฌํ๋ค.

๋ฒค์น๋งํฌ ๋น๊ต(Table 8) โ ์๋ฎฌ๋ ์ดํฐ/์ค๊ธฐ ๋ฐ์ดํฐ์ , embodiment, ๋ฐ์ดํฐ ๊ท๋ชจ, ๊ด์ธก(RGB/Depth/Masks), ๋๊ตฌ ์ฌ์ฉยท๋ฉํฐ์์ด์ ํธยท์ฅ๊ธฐ ํ์คํฌ ์ง์ ์ฌ๋ถ. ์์ชฝ 8๊ฐ๋ ์๋ฎฌ๋ ์ด์ , ์๋ 3๊ฐ๋ ์ค๊ธฐ ๋ฐ์ดํฐ์ ์ด๋ค. (ARNOLD ํ์ โFramka Pandaโ๋ ์๋ฌธ ์คํ)

๋ฒค์น๋งํฌ ์คํฌ๋ฆฐ์ท ๋ชจ์(Fig. 17) โ ์: CALVIN, Meta-world, RLbench, VIMAbench, LoHoRavens / ์๋: ARNOLD, RoboGen, Open X-Embodiment, DROID, Galaxea Open-world.
๋ณธ๋ฌธ์์ ํ์ธ๋๋ ๊ท๋ชจ ์์น๋ค: CALVIN์ PyBullet ๊ธฐ๋ฐ 4๊ฐ ํ๊ฒฝ 34๊ฐ ํ์คํฌ, ํ๊ฐ ์งํ๊ฐ MTLC์ LH-MTLC ๋. Meta-World๋ MuJoCo ์ 50๊ฐ ํ์คํฌ(ML10/ML45). RLBench๋ CoppeliaSim/V-REP ์ 100๊ฐ ํ์คํฌ. VIMAbench๋ Ravens ๊ธฐ๋ฐ 17๊ฐ ํ์ ํ์คํฌ ํ ํ๋ฆฟ, ์ฝ 650,000 ์ ๋ฌธ๊ฐ ๊ถค์ , 4๋จ๊ณ ๊ณ์ธต์ ํ๊ฐ ํ๋กํ ์ฝ(๋ฌด์์ ๋ฌผ์ฒด ๋ฐฐ์น โ ์์ ํ ์๋ก์ด ํ์คํฌ). LoHoRavens๋ ์ฅ๊ธฐ ํ์คํฌ 10๊ฐ. ARNOLD๋ Omniverse ์ 8๊ฐ ์ธ์ด ์กฐ๊ฑด ํ์คํฌ, ๋ฌผ์ฒด 40์ข ยท์ฅ๋ฉด 20๊ฐ, 10,000 ์ ๋ฌธ๊ฐ ์์ฐ. LIBERO๋ SPATIAL/OBJECT/GOAL/-100 ๋ค ์ค์ํธ ์ด 130๊ฐ ํ์คํฌ. ์ค๊ธฐ ์ชฝ์ Open X-Embodiment(21๊ฐ ๊ธฐ๊ด, 22๊ฐ ๋ก๋ด, 527 ์คํฌ, 160,266 ํ์คํฌ, 2M+ ๊ถค์ ), DROID(76k ๊ถค์ โ 350์๊ฐ, 564 ์ฅ๋ฉด, 52 ๊ฑด๋ฌผ, 86 ํ์คํฌ, Franka + Robotiq 2F-85, ZED ์คํ ๋ ์ค 3๋), Galaxea Open-world(100k ๊ถค์ โ 500์๊ฐ, 150 ํ์คํฌ, 50 ์ฅ๋ฉด, 1,600+ ๋ฌผ์ฒด, 23-DoF Galaxea R1 Lite ์ํ ๋ชจ๋ฐ์ผ).
๊ทธ๋ฆฌ๊ณ ํ์คํฌ ๊ณ์ด 3๋ถ๋ฅ(Table 9)๋ฅผ ์ ์ํ๋ค โ ์ด๊ฑด ๋ฒค์น๋งํฌ ์ ์ ํด์์ฉ ์ฅ์น๋ค.
| ํ์คํฌ ๊ณ์ด | ์์ | ๋ํ ๋ฒค์น๋งํฌ | ์ง๋ฐฐ์ ๋์ด๋ |
|---|---|---|---|
| Object-centric | ๋ฌผ์ฒด ์ฌ๋ฐฐ์น, ์๊ธฐ, ์์ธ ์กฐ์ | Meta-World, RLBench, VIMAbench | ์๊ฐ-์ธ์ด ๊ทธ๋ผ์ด๋ฉ, ๋จ๊ธฐ visuomotor ์ ์ด |
| Interaction-centric | ๊ด์ ์ฒด ์กฐ์, ๋ณํ์ฒด ์กฐ์, ๋๊ตฌ ๋งค๊ฐ ์กฐ์ | ARNOLD, RoboGen, Open X-Embodiment | 3D ๊ณต๊ฐ ์ถ๋ก , ํ ์ ์ด, ์ด๊ฐ ํผ๋๋ฐฑ, ๋๊ตฌ-๋ฌผ์ฒด affordance |
| Long-horizon | ๋ค๋จ๊ณ ์ฌ๋ฐฐ์น, ๊ฐ์ฌ, ๋ชจ๋ฐ์ผ ์กฐ์ | CALVIN, LoHoRavens, LIBERO, Open X-Embodiment, DROID, Galaxea Open-world | ํ์คํฌ ๋ถํด, ์๋ธ๊ณจ ์ํ์ฑ, ๋ฉ๋ชจ๋ฆฌ, ํ๋ฃจํ ์ฌ๊ณํ, ์คํจ ๋ณต๊ตฌ |
์ ์๋ค์ ๊ฒฝ๊ณ ๊ฐ ์ค์ํ๋ค โ ์ด ์ ์ ์๊ฒฉํ ๋์ด๋ ์๊ณ๊ฐ ์๋๊ณ (๊ด์ ์ฒด ํ์คํฌ๊ฐ ์ฅ๊ธฐ ๊ณํ์ ์๊ตฌํ ์๋, ๋ณํ์ฒด ์กฐ์์ด ์งง์ ๋ค๋จ๊ณ ๊ฐ์ฒด ํ์คํฌ๋ณด๋ค ์ด๋ ค์ธ ์๋ ์๋ค), ์ํธ๋ฐฐํ์ ์ด์ง๋ ์๋ค. ๋ค๋ง ๋ณด๊ณ ๋ ์ฑ๊ณต๋ฅ ์ ํด์ํ๋ ๋ ์ฆ๋ก ์ธ ์ ์๋ค: object-centric ๋ฒค์น๋งํฌ์ ์ข์ ์ฑ์ ์ ์๊ฐ-์ธ์ด ๊ทธ๋ผ์ด๋ฉ๊ณผ ๋จ๊ธฐ ์ ์ด๋ฅผ ์ ์ฆํ ๋ฟ์ด๊ณ , ๋ฌผ๋ฆฌ ์ํธ์์ฉ ๋ชจ๋ธ๋งยท๋ฉ๋ชจ๋ฆฌยทํ๋ฃจํ ๊ฐ๊ฑด์ฑ์ ๋ค๋ฅธ ๊ณ์ด์์๋ง ๊ฒ์ฆ๋๋ค.
๋์์ ์๋ฒ ์ด๋ โ์ธ์ด ๊ทธ๋ผ์ด๋ฉ๊ณผ ๋งฅ๋ฝ ์ดํด๊ฐ ์ฑ๋ฅ์ ์ผ๋ง๋ ๊ธฐ์ฌํ๋์ง๋ฅผ ๊ณต์ ํ๊ฒ ์ ๋ํํ ํตํฉ ํ๊ฐ ํ๋กํ ์ฝ์ด ์์ง ์๋คโ ๊ณ ๋ช ์ํ๋ค. ํํ ๋ฒค์น๋งํฌ๊ฐ ํ์คํฌ ์ฑ๊ณต๋ฅ ์ ์ง์คํด ์๋ฏธ ์ดํด์ ํ์คํฌ ๊ฐ ์ง์ ์ ์ด๋ฅผ ๋์น๋ค๋ ์ง๋จ์ด๋ค.
๊ด๋ จ: ์๋ฎฌ๋ ์ดํฐยท๋ฐ์ดํฐ์ ยท๋ฒค์น๋งํฌ๋ฅผ ํ๋์ ํ๋ซํผ์ผ๋ก ํตํฉํ๋ ค๋ ์ต๊ทผ ์๋๋ RoboVerse ๋ฆฌ๋ทฐ์์ ๋ณผ ์ ์๋ค(์ด ์๋ฒ ์ด์ Table 7ยท8์๋ ํฌํจ๋ผ ์์ง ์๋ค).
8.5 Task specification โ ์ธ์ด vs ์ด๋ฏธ์ง/์์
์ด ์ ์ด ์ด ์๋ฒ ์ด์์ ๊ฐ์ฅ ๊ท ํ ์กํ ๋๋ชฉ์ด๋ค. ์ ์๋ค์ ์ธ์ด๋ฅผ ๊ฒฝ์ ๋ชจ๋ฌ๋ฆฌํฐ๊ฐ ์๋๋ผ ์๋ณด ๋ชจ๋ฌ๋ฆฌํฐ๋ก ๋๊ณ , ์ธ ๊ธฐ๋ฅ์ ์ญํ (state evaluation / policy condition / cognitive planning) ๊ฐ๊ฐ์์ ์ธ์ด์ ์๊ฐ ์กฐ๊ฑดํ๋ฅผ ๋๋ํ ๋น๊ตํ๋ค.
- ์ํ ํ๊ฐ: ์ด๋ฏธ์ง/์์์ ์๋ฌต์ ยท๋ฐ์ง ์งํ ์ ํธ๋ฅผ ์ค๋ค(XIRL์ด ์์์์ ์๊ฐ์ ์งํ๋๋ฅผ ๋ฐฐ์ด๋ค). ์ฑ๊ณต์ด โํ๊ทธ๊ฐ ์ฝ์ ๋๋๊ฐโ, โ๊ธฐ์ด๊ฐ ์ ๋ ฌ๋๋๊ฐโ์ฒ๋ผ ์ง๊ฐ ๊ฐ๋ฅํ ๋ฌผ๋ฆฌ ์ํ๋ก ์ ์๋ ๋ ๊ฐํ๋ค. ๋ฐ๋๋ก ์ธ์ด๋ ๋ช ์์ ์กฐํฉ ์๋ฏธ๋ก ์ผ๋ก ๋ชฉํ๋ฅผ ์ค๋ค โ ๋ถ์ ์ ์ฝ(โstay away from the yellow bottleโ), ์์ ํ๋กํ ์ฝ(โslowlyโ, โuprightโ ๊ฐ์ ์์์ด๋ฅผ ๊ถค์ ์ต์ ํ ํ๋ผ๋ฏธํฐ๋ก), ๊ด๊ณ์ ์ ํธ(โmove farther from the stoveโ) ๊ฐ์ ์๊ฐ ๋ชฉํ๋ง์ผ๋ก๋ ์ถ๋ก ํ ์ ์๋ ์ถ์ ์ ์ฝ์ ๊ฐ์ ํ๋ค. ๋์ ์ ํํ ์ฝ์ ๊ฐ๋ ๊ฐ์ ๊ธฐํ ๋ํ ์ผ์ ๋ณธ์ง์ ์ผ๋ก under-specify ํ๋ค.
- ์ ์ฑ ์กฐ๊ฑด: ์ด๋ฏธ์ง ์กฐ๊ฑด์ ๋ชฉํ๊ฐ ํน์ ๊ณต๊ฐ ๋ฐฐ์น๋ก ์ ์๋ ๋ ์ต์ ์ด๊ณ , ์์ ์กฐ๊ฑด์ ์ ๊ทผ ๊ถค์ ยท์ ์ด ํ์ด๋ฐยท์๋ ํ๋กํ์ผ ๊ฐ์ ์๊ณต๊ฐ ๋์ญํ์ ์๋ฌต์ ์ผ๋ก ์ ๋ฌํ๋ค. ์ธ์ด ์กฐ๊ฑด ์ ์ฑ ์ ์ค์ฉ์ ๊ฐ์ ์ : low-bandwidth specification(ํ์คํฌ ๋ณํ๋ง๋ค ์ ์์ฐ์ ๋ นํยท๋ ๋๋งํ ํ์ ์์), compositional generalization(์คํฌยท๋ฌผ์ฒดยท๊ณต๊ฐ ๊ด๊ณ์ ์ฒด๊ณ์ ์ฌ์กฐํฉ), interactive editability(์ค์๊ฐ ๋ชฉํ ์ ์ ์ ๊ตฌ๋ ์ ์ , ๋ํ ๊ธฐ๋ฐ ๋ช ํํ).
- ๊ณํ: ์์์ ๋ฐ์ง ์ด๋ํยท๊ตฌ์กฐ prior๋ฅผ ์ค๋ค(One-shot visual imitation์ด ์ฌ๋ณผ๋ฆญ ํ๋๋ ์์ด ๋ค๋จ๊ณ ์กฐ์ ๊ณํ์ ๋ฝ๋๋ค โ ์ท ์ ๊ธฐ์ฒ๋ผ ์ธ์ด๋ก ํํํ๊ธฐ ์ด๋ ค์ด ๋ฌผ๋ฆฌ ์กฐ์์ ํนํ ํจ๊ณผ์ ). ์ธ์ด ๊ณํ์ ๋ถ๊ธฐยท์ ์ฝ์ด ๋ง๊ฑฐ๋ ์ํธ์์ฉ์ ์ธ ์ํฉ์์ ๊ฐํ๋ค(โif the drawer is stuck, pull harder; otherwise, close it gentlyโ). ์ ์๋ค์ ์์ฝ์ด ์ข๋ค: ์๊ฐ ์์ฐ์ ๊ตฌ์ฒด์ ๋ฌผ๋ฆฌ ๊ฒฝ๋ก๋ฅผ ์ ์ํ๊ณ , ์ธ์ด๋ ๋ ผ๋ฆฌ ๊ตฌ์กฐ๋ฅผ ์กฐ์งํ๋ค.
๊ฒฐ๋ก ์ โhybridโ๋ค. ์ธ์ด๋ก ๋ฌด์์(๊ณ ์์ค ๋ชฉํยท๋ ผ๋ฆฌ ์ ์ฝยท์ฌ์ฉ์ ์ ํธ), ์ด๋ฏธ์ง/์์์ผ๋ก ์ ํํ ์ด๋ป๊ฒ(๊ณต๊ฐ ๊ธฐํยท์ด๋ํยท์ ์ด ๋์ญํ)๋ฅผ ์ง์ ํ๋ ๋ค์ค๋ชจ๋ฌ ๋ช ์ธ ํ๋ ์์ํฌ๋ก ์๋ ดํ๋ค๋ ๊ฒ.
๋ ผ์ 3์ (Sec. 9)
์๋ฒ ์ด ์ค๋ฐ ์ดํ์ ๋ฐฑ๋ฏธ๋ค. ์ ์๋ค์ ๊ฒฐ๋ก ์ ๋ด๋ฆฌ์ง ์๊ณ ์์ชฝ ๊ทผ๊ฑฐ๋ฅผ ์ ๋ฆฌํ๋ค.
9.1 VLA๊ฐ ์ณ์ ๊ธธ์ธ๊ฐ?
ํ์ ์ชฝ ๊ทผ๊ฑฐ๊ฐ ๊ตฌ์ฒด์ ์ด๋ค. ์์ ์ธ์ด ๋ชจ๋ธ๋ง์์ ์ค์ผ์ผ๋ง ๋ฒ์น์ด ํตํ ๊ฒ์ ๋ฐ์ดํฐ๊ฐ ์ฌ์ค์ ๋ฌดํํ๊ณ ๊ท ์งํ๋ฉฐ ๊ตฌ์กฐ์ ๊ท์น์ฑ์ด ๊ฐํ๊ธฐ ๋๋ฌธ์ด๋ค. ๋ก๋ด์ ๋ค๋ฅด๋ค โ ์ค๋์ LLM์ ๋ณดํต 100B ํ๋ผ๋ฏธํฐ๋ฅผ ๋๊ณ ์์กฐ ํ ํฐ์ผ๋ก ํ์ต๋์ง๋ง, ๋๋ถ๋ถ์ VLA๋ 7B ๋ฏธ๋ง์ด๊ณ ์๋ฐฑ๋ง ๊ฐ ์์ค์ ๋ก๋ด ๊ถค์ ์ ์์กดํ๋ค. ๊ฒ๋ค๊ฐ ๋ฌผ๋ฆฌ ์ธ๊ณ์์๋ ์์ ์ค๋ฅ๊ฐ ํ์คํฌ ์คํจ๋ก ์ง๊ฒฐ๋๊ณ (์ธ์ดยท๋น์ ํ์คํฌ์ ์ฌ์ํ ๋ชจํธ์ฑ๊ณผ ๋ฌ๋ฆฌ), ๋ก๋ด ๋ฐ์ดํฐ๋ ๋ค์ํ๊ณ ๋น์ธ๊ณ ์ฌํ์ด ์ด๋ ค์ ๊ทธ ํธํฅ์ ์ํ์ ๋ ๋ชจ์์ ๋ณด์ํ ์ ์๋ค.
๋์ ๋ฐฉํฅ์ผ๋ก ์ ์๋ค์ด ์ ์ํ๋ ๊ฒ์ โ์ ํ ๋ฐ์ดํฐ + ๊ฐํ ๊ตฌ์กฐ์ ์์กด์ฑโ ํจ๋ฌ๋ค์์ด๋ค. ๊ทธ๋ฆฌ๊ณ ํฅ๋ฏธ๋ก์ด ์ฌ์ ์๋ฅผ ํ๋ค โ ์ญ์ฌ์ ์ผ๋ก VLA์ ์ง๋ณด๋ ๋ชจ๋ธ ํฌ๊ธฐ๊ฐ ์๋๋ผ ํ์คํฌ ๋ณต์ก๋์ ํ์ฅ์์ ์๋ค: ๋จ์ผ ํ โ ์ํ, ๊ณ ์ ๋ฒ ์ด์ค โ ๋ชจ๋ฐ์ผ, ๊ฐ์ฒด โ ๋ณํ์ฒด, ๋ ๋ฆฝ ์กฐ์ โ ์ธ๊ฐ-๋ก๋ด ํ์ . โgenuine scaling in robotics lies in expanding the task manifold, namely the complexity, diversity, and structure of interactions, rather than merely increasing model parameters.โ
9.2 ์๋๋ชจ๋ธ์ด ์ณ์ ๊ธธ์ธ๊ฐ?
์ฐฌ์ฑ: ์์ ๋กค์์์ผ๋ก ์ํ ํจ์จ๊ณผ ์ฅ๊ธฐ ํ๋ ํ์ต์ ์ป๊ณ (DreamerV3 ๊ณ์ด), ์ธ์ด๋ก ์์์ ์กฐ๊ฑดํํ๋ฉด ์์ ํ ํ ์คํธ๊ฐ ๋ชฉํ ์ธ์ง์ ๋ฏธ๋๊ฐ ๋์ด ์กฐํฉ์ ์ผ๋ฐํ๋ฅผ ์ง์ํ๋ค(LIMT). ์์ ์ธก๋ฉด๋ ์๋ค โ ํ๋ณด ํ๋ ์ํ์ค๋ฅผ โ์์โ ์์์ ์คํ๋ผ์ธ ํ๊ฐํด ์ํํ๊ฑฐ๋ ์คํ ๋ถ๊ฐ๋ฅํ ๊ณํ์ ์ค์ ์๋ ์ ์ ๊ฑธ๋ฌ๋ผ ์ ์๋ค.
๋ฐ๋: ๋ชจ๋ธ ํธํฅ๊ณผ ๋ถํฌ ์ทจ์ฝ์ฑ. ์๋๋ชจ๋ธ์ ๊ทผ์ฌ ๋์ญํ์ด๋ฏ๋ก ์ ์ดยท๋ง์ฐฐยท๋ฌผ์ฑ์ ์์ ์ค์ฐจ๊ฐ ์์ ๋กค์์์์ ๋์ ๋๋ค. OOD ์ํฉ์์๋ ์๋ฏธ์ ์ผ๋ก๋ ๊ทธ๋ด๋ฏํ์ง๋ง ๋ฌผ๋ฆฌ์ ์ผ๋ก ๋ถ๊ฐ๋ฅํ(์ด๋ํยท์์ ์ฑยท์ ์ด ์ ์ฝ ์๋ฐ) ๊ณํ์ ๋ผ ์ ์๋ค. ์ฆ ์๋ฎฌ์์ ๋ฉ์ฉกํด ๋ณด์ด๋ ๊ณํ์ด ์ค๊ธฐ์์ ์คํจํ๋ค. ๊ฒ๋ค๊ฐ ์์ฑ ๋ชจ๋ธ์ ์ฐ์ฐ ๋ถ๋ด์ด ์ค์๊ฐ ์ ์ด ๋ฃจํ๋ฅผ ์๋ฐํ๋ค.
์ ์๋ค์ ์ ๋ฆฌ๋ ์ ์คํ๋ค โ โrather than definitive drawbacks, current limitations reflect an early methodological stage.โ ์ด๋ฆฐ ๋ฌธ์ ์ : (i) ํ์ต๋ ๋์ญํ์ ๊ตฌ์กฐ์ prior(๋ฌผ๋ฆฌยท๊ธฐํยทํ์คํฌ ์ ์ฝยท์์) ์ฃผ์ , (ii) ๋ชจ๋ธ ๋ถํ์ค์ฑ์ ์ ๋ํยท์ ํ, (iii) ์ฐ์ฐ ํจ์จ์ ๋ชจ๋ธ๋ก ์ค์๊ฐ ๋ง๊ฐ ๋ง์ถ๊ธฐ.
9.3 ์ค์๊ฐ ์ ์ฝ ์๋์ ์ค์ผ์ผ๋ง์ด ๋์์ด ๋๋๊ฐ?
๊ฐ์ฅ ์ค์ฉ์ ์ธ ๋ ผ์์ด๋ค. ์ ์ด ์ฃผ๊ธฐ๋ง๋ค ์ผ์ฑยท์ ์ฑ ์ถ๋ก ยท๊ตฌ๋์ด ๋๋์ผ ํ๋ ๊ณ ์ ๋ ์๊ฐ ์์ฐ์ด ์๋ค. ๋ชจ๋ธ์ ํค์ ์ถ๋ก ์๊ฐ์ด ์ด ์์ฐ์ ๋์ผ๋ฉด ์ ์ด ๋ฃจํ๊ฐ ๋ง๊ฐ์ ๋์ณ jitter์ ์์ ์ฑ ์ ํ๊ฐ ์๊ธฐ๊ณ , ์ ์ด์ด ๋ง์ ์ํธ์์ฉ์์ ํนํ ์น๋ช ์ ์ด๋ค. LLM/VLM์ ์์ฌ๊ฒฐ์ ์ ์ฐ๋ฉด (๊ณต๊ฒฉ์ ์ผ๋ก ์บ์ฑํ์ง ์๋ ํ) ์ด ๋จ์ ์ง์ฐ์ด ๋ถ๊ณ , ์์ ์ข ๋จ๊ฐ VLA๋ ์๋ฒ ๋๋ ํ๋์จ์ด์์ ์คํ ๋น ์ฐ์ฐยท๋ฉ๋ชจ๋ฆฌ๋ฅผ ์๊ตฌํ๋ค. ํ์ฐ ์ปจํธ๋กค๋ฌ๋ ๋ฐ๋ณต ์ํ๋ง์ โdenoising taxโ๋ฅผ ์ถ๊ฐ๋ก ๋ธ๋ค.
์ค๋ฌด์ ์ํ์ฑ ๋ค: ์์ถยท์ฆ๋ฅ, ์ ๋ ฅ ํ ํฐ ๊ฐ์ง์น๊ธฐ, ๋ชจ๋ธ ๋ฉ๋ชจ๋ฆฌ ์บ์ฑ, ๋ฌด๊ฑฐ์ด 3D ๋ณผ๋ฅ๋ฉํธ๋ฆญ ์ง๊ฐ ๋์ ๋ค์ค๋ทฐ 2D ์ธ์ฝ๋, ๊ทธ๋ฆฌ๊ณ ๋ถํ ์ํคํ ์ฒ(๊ฒฝ๋ ์จ๋ณด๋ ์ปจํธ๋กค๋ฌ๊ฐ ์ฆ๊ฐ ํผ๋๋ฐฑยท์์ ์ธํฐ๋ก์ ๋งก๊ณ , ๋ฌด๊ฑฐ์ด ์๊ณ โ๊ณ ์์ค ๊ณํยท์๋ธ๊ณจ ์์ฑโ๋ ๋น๋๊ธฐ ๋๋ ์คํ๋ณด๋๋ก). ํด๋ผ์ฐ๋ ์คํ๋ก๋ฉ์ ์ฒ๋ฆฌ๋์ ์ฃผ์ง๋ง ์์ธก ๋ถ๊ฐ๋ฅํ ๋คํธ์ํฌ ์ง์ฐ๊ณผ ์์ ์๊ณ ์ํฉ์์ ๊ฒฝ๊ณ ์ง๊ธฐ ์ด๋ ค์ด ์คํจ ๋ชจ๋๋ฅผ ๋ค์ฌ์จ๋ค. Sec. 10.2.3์ ์ฌ๊ธฐ์ ํต์ ๋ณด์๊น์ง ๋ง๋ถ์ธ๋ค โ ์ฐ์ ํ๊ฒฝ์์ ์๋ฐฑ ๋์ ๋ก๋ด์ด ๊ณต์ ํด๋ผ์ฐ๋ ๋ชจ๋ธ์ ๋์ ์ง์ํ๊ณ , ์์ด์ ํธ๋น 50 Hz๋ฅผ ๋๋ ์ ์ด ๊ฐฑ์ ์ด ํ์ํ๋ฉฐ(Belkhale et al. 2024), ๋ช ๋ น ํ์ด์ฌํน์ด๋ ๋ชจ๋ธ ๊ฐ์ค์น ์ค์ผ์ด ๋ฌผ๋ฆฌ์ ์์ ์ํ์ด ๋๋ค.
์ด๋ฆฐ ๋ฌธ์ ์ ๋ฏธ๋ ๋ฐฉํฅ (Sec. 10)
๋ ์ถ์ผ๋ก ์ ๋ฆฌ๋๋ค: ์ผ๋ฐํ ๋ฅ๋ ฅ๊ณผ ์ค์ธ๊ณ ์์ .
10.1 ์ผ๋ฐํ
๋ฐ์ดํฐ ๊ฐ์ฉ์ฑ๊ณผ ๊ทธ ํ๊ณ. play data๊ฐ ๋ผ๋ฒจ๋ง ๋น์ฉ์ ์ค์ด์ง๋ง, โrelying solely on play data and generative VLMs may not be sufficient to train a robust FM for robot manipulationโ. ๊ทธ๋ฆฌ๊ณ โbeyond web-scale dataโ ๋ผ๋ ๋๋ฐ์ ์ง๋ฌธ์ ๋์ง๋ค โ ์ธ๊ฐ์ ์กฐ์ ์๋ จ์ ํจ์ฌ ์ ๊ณ ๋งฅ๋ฝํ๋ ๊ฒฝํ์์ ๋์จ๋ค. ๋ฐ์ดํฐ๊ฐ ์ ํ์ ์ผ ๋ ๋ฅ๋ฌ๋ ๋ชจ๋ธ์ ํ์ต์ ์ ํ์ ์๊ด(shortcut) ์ ๊ณผ์ ํฉ๋๋ฏ๋ก, โ๋ฐ์ดํฐ๋ฅผ ๋ ๋ชจ์ผ๋ฉด ๋๋คโ๊ฐ ์ ์ผํ ๊ธธ์ด ์๋ ์ ์๋ค. ์ฌ๊ธฐ์ ๋ด๋ก์ฌ๋ณผ๋ฆญ์ด ๋ฐ์ดํฐ ํจ์จ ๋์์ผ๋ก ๋ค์ ํธ์ถ๋๋ค.
๋ฒค์น๋งํน์ ๋ฌธ์ ๋ ์ ์งํ๋ค โ ๋๋ถ๋ถ์ด ์๋ฎฌ๋ ์ดํฐ์์ ํ๊ฐํ๊ณ ํตํฉยทํ์คํ๋ ์ค๊ธฐ ํ๊ฐ ๋ฒค์น๋งํฌ๊ฐ ์๋ค. ์๋ฎฌ ์ฑ๋ฅ์ด ์ค๊ธฐ ์ฑ๊ณต์ผ๋ก ์ด์ด์ง์ง ์๋ ์ด์ ๋ ์๊ฐ ์ธํ, ์ผ์ ๋ ธ์ด์ฆ, ๋ฌผ๋ฆฌ ๋์ญํ, ๊ทธ๋ฆฌ๊ณ ์ธ์ด์ ๋งฅ๋ฝ์ ํด์์ด ๊ฐ๋ผ์ง๊ธฐ ๋๋ฌธ์ด๋ค. ์ ๋งํ ๋ฐฉํฅ์ผ๋ก real-to-sim-to-real(์ค๊ธฐ ์ํธ์์ฉ ๋ฐ์ดํฐ๋ก ์๋ฎฌ๋ ์ดํฐ๋ฅผ ์บ๋ฆฌ๋ธ๋ ์ด์ โ ์ ๋ ฌ๋ ์๋ฎฌ์์ ํ์ต โ ์ค๊ธฐ ์ฌ๋ฐฐ์น)์ ๋ ๋ค.
Lifelong learning๊ณผ cross-embodiment alignment. ํ์๋ taxonomy์ ์ฐ๊ฒฐํด ์ธ ์ธต์์์ ์ค๋ช ๋๋ค โ ์ง๊ฐ ์ธต(์ผ์ ๊ตฌ์ฑยท์นด๋ฉ๋ผ ๋ฐฐ์นยท์์ ๊ณต๊ฐ ๊ธฐํ๊ฐ ๋ฌ๋ผ ๊ฐ์ ์ง์๊ฐ ๋ค๋ฅธ ์๊ฐ ๊ทธ๋ผ์ด๋ฉ์ ๋ณ๋๋ค), ์ ์ด ์ธต(DoFยท๊ด์ ํ๊ณยท์๋์ดํํฐ๊ฐ ๋ค๋ฅด๋ฉด ํ์ต๋ ์ ์ฑ ์ด ์ ํจํ ํ๋์ ๋ชป ๋ธ๋ค), ๊ณํยท์ถ๋ก ์ธต(๊ฐ์ ๊ณํ์ด ๋ค๋ฅธ ๋ฅ๋ ฅ์ ๋ก๋ด์์ ์คํ ๊ฐ๋ฅํด์ผ ํ๋ค).
Zero-shot์ ์คํจ์ฑ(10.1.4) โ ์ด ์๋ฒ ์ด์์ ๊ฐ์ฅ ๊ฐ์ง ํ ์ ์ด๋ค. ์ ์๋ค์ zero-shot์ด ๊ท ์ผํ ์์ฑ์ด ์๋๋ผ ๋ฌด์์ ์ผ๋ฐํํ๋๋์ ๋ฌ๋ฆฐ ๊ฒ์ด๋ผ๊ณ ์๋ผ ๋งํ๋ค.
- ์๋ฏธยท๊ณํ ์ธต์์ ๊ฐ์ฅ ๊ฐํ๋ค: ZSRM์ด CLIP์ผ๋ก ๋ชฉํ ์ด๋ฏธ์ง-ํ ์คํธ๋ฅผ ๋งค์นญํด ํ์คํฌ ํนํ ์ฌํ์ต ์์ด ๋ณด์์ ๋ง๋ค๊ณ , SayCan์ด LLM ์ถ๋ก + affordance ์ ์๋ก ์คํฌ ์ํ์ค๋ฅผ ๋ง๋ค๊ณ , Code as Policies๊ฐ ๋ฏธํ์ต ๋ฌผ์ฒด์ ๋ํด API ํธ์ถ์ ์ฌ์กฐํฉํ๋ค. ๊ทธ๋ฌ๋ ์ฌ์ ํ ์ทจ์ฝํ๋ค โ SayCan์ ์คํฌ ์คํ์ด ๋ฌด๊ฒฐํ๋ค๊ณ ๊ฐ์ ํ๊ณ , Code as Policies๋ ์คํ ๋ถ๊ฐ๋ฅํ ๋จ๊ณ๋ ์กด์ฌํ์ง ์๋ ํจ์๋ฅผ ๋ผ ์ ์์ผ๋ฉฐ, ZSRM์ CLIP์ ์ฝํ ๊ณต๊ฐ ์ถ๋ก ์ด ์ํ์ด๋ค.
- ์ ์ฑ ์ธต์์๋ ๋ ์ ํ์ ์ด๋ค: ๋๊ฐ ๊ธฐ์กด ์คํฌ ์ฌ์กฐํฉ์ด๋ ๊ด๋ฒ์ํ ์ฌ์ ํ์ต ํํ์ ๊ธฐ๋๋ค. LanCon-Learn์ ๋ผ์ฐํ +์ ์ด ๊ณต๋ ํ์ต์ ์ทจ์ฝํ๊ณ ์ํ์ ๋ง์ด ๋จน์ผ๋ฉฐ, RT-2์ ์ด๋๋ ์ฌ์ ํ์ต ๋ถํฌ์ ์ปค๋ฒ๋ฆฌ์ง์ embodied ๋ก๋ด ๋ฐ์ดํฐ์ ๊ฐ์ฉ์ฑ์ ๊ฐํ๊ฒ ๋ฌถ์ฌ ์๋ค.
- ๋ฌผ๋ฆฌ ์คํ์ ๊ฐ๊น์์ง์๋ก ๋ ์ฝํด์ง๋ค: ์ฅ๊ธฐยท์ ์ด ๊ณผ๋คยท๋์ ยทcross-embodiment ํ์คํฌ์์ ๊ทธ๋ผ์ด๋ฉยท์ง๊ฐยท๋์ญํยทํผ๋๋ฐฑ์ ์ค์ฐจ ๋์ ์ด ์ง๋ฐฐํ๋ค.
๊ฒฐ๋ก ๋ฌธ์ฅ์ด ์ ํํ๋ค: ํ์ฌ ์์คํ ์ zero-shot์ โpartial and conditional rather than universalโ โ ์๋ฏธ ๋ช ์ธ์ ๊ณ ์์ค ๊ณํ์์ ๊ฐ์ฅ ๊ฐํ๊ณ , ์ ์ฑ ์ ์ด์์๋ ์ ๋งํ์ง๋ง ์ฌ์ ํ ์ทจ์ฝํ๋ฉฐ, ์๋นํ novelty ์๋์ ์ ๋ขฐ์ฑ ์๋ ์ค๊ธฐ ์กฐ์์์๋ ์ฌ์ ํ ์ ํ์ ์ด๋ค.
10.2 ์์
์ธ์ด์ ๋ชจํธ์ฑ(10.2.1). ์์๊ฐ ์ธ์์ ์ด๋ค โ โRemove the chemicals from the table.โ ์ฌ์ฉ์๋ ํํ๋ฌผ์ง ์ฉ๊ธฐ๋ฅผ ์ง์ ๋ ๋ณด๊ด ์ฅ์๋ก ์์ ํ๊ฒ ์ฎ๊ธฐ๊ธฐ๋ฅผ ์๋ํ์ ์ ์์ง๋ง, ๋ก๋ด์ ์ด๋ฅผ ๋ฌผ๋ฆฌ์ ์ผ๋ก ์น์ ์์ ๊ธฐ(์๊ฑฐ๋ ์๋ชป ๋ค๋ฃจ๊ธฐ)๋ก ํด์ํด ํํ๋ฌผ์ง ์ ์ถ๊ณผ ์ํ์ ๋ณ์ ์ ์๋ค. ์ํ์ฑ ์ ๋ฅ๋์ ๋ช ํํ ์ง์(โDo you want me to move the chemicals to storage, or should I dispose of them?โ)์ ํ๋ ์ ํด์ ํ์ธ ๋๋จน์(โI understood that I should carefully move the containers to the storage area. Is this correct?โ). ์ฌ๊ธฐ์ 3D ์ธ๊ณ ๊ทธ๋ผ์ด๋ฉ์ ๋์ ์ด ๊ฒน์น๋ค โ VLM์ ํ๊ฐํ๊ธฐ ์ฝ๊ณ , ๊ณต๊ฐ ํํ์ ํด์ํ ๋ ๊ด์ ์ทจํ๊ธฐ(taking spatial perspectives) ๋ฅผ ๋ชป ํ๋ค.
์คํจ ๋ณต๊ตฌ(10.2.2). ์ํํธ์จ์ด ์ธก(LLM ํ๊ฐ โ ์กด์ฌํ์ง ์๋ ๋ฌผ์ฒด ์ฐธ์กฐ, ๋ ผ๋ฆฌ์ ์ผ๋ก ๋ชจ์๋ ๊ณํ, ์์ ํ์ง ์์ ์ ์ด ์ฝ๋)๊ณผ ํ๋์จ์ด ์ธก(์ถ๋ก ์ง์ฐ์ผ๋ก ์ธํ ํ๋ ์ง์ฐ, ๊ณ ๋์ ๋ชจ์ ์์์ ๋ชจํฐ ๊ณผ์ด ์ ง๋ค์ด, ์กฐ๋ช ยท๋ฐ์ฌ๋ฉด์ ์ทจ์ฝํ ๊น์ด ์ผ์, ์ ํ๋ ๋ฐฐํฐ๋ฆฌ)์ ๋ชจ๋ ๋ ๋ค. ํ๋์จ์ด ์คํจ ์์๊น์ง ๊ตฌ์ฒด์ ์ผ๋ก ์ด๊ฑฐํ ์๋ฒ ์ด๋ ํ์น ์๋ค.
์ค์๊ฐ ์ฑ๋ฅ(10.2.3). ์์ถยท์์ํยท์ง์ ์ฆ๋ฅ, ๊ทธ๋ฆฌ๊ณ ์๊ฐ ์๊ณ ๊ฒฐ์ ์ ๊ฒฝ๋ ๋ก์ปฌ ๋ชจ๋ธ์ ์์ํ๊ณ ๋ณต์กํ ์ถ๋ก ์ ํฐ ๋ชจ๋ธ์ ์คํ๋ก๋ฉํ๋ ํ์ด๋ธ๋ฆฌ๋.
๋นํ์ ์ผ๋ก ๋ณด๋ฉด
๊ฐ์
- ๋ถ๋ฅ์ถ์ด ์ค์ ๋ก ์ผ์ ํ๋ค. โ์ธ์ด์ ๊ธฐ๋ฅ์ ์ญํ โ์ด๋ผ๋ ์ถ์ ๋จ์ํ ์ฌ๋ฐฐ์ด์ด ์๋๋ค. ์ด ์ถ์ผ๋ก ์๋ฅด๋ฉด ๊ฐ์ ๋ฐฉ์ ๋ชจ์ธ ์ฐ๊ตฌ๋ค์ด ๊ฐ์ ๋ณ๋ชฉ์ ๋ค๋ฅด๊ฒ ๊ณต๊ฒฉํ ๊ณ๋ณด๋ก ์ฝํ๋ค(Sec. 4์ โ๋ณด์ ์ค๊ณ ๋ ธ๋์ ๋๊ฐ ๋์ ํ๋๊ฐโ 3์ธ๋, Sec. 5์ โ์ ๊ณ์ด์ ํ๊ณ๋ฅผ ์ํํ๋คโ ์ฌ์ฌ, Sec. 6.1โ6.2์ โ์ฌ๋ณผ๋ฆญ์ 4๋ ํ๊ณ โ LLM์ด ์ฐํ โ LLM์ 3๋ ์ ๊ท ๋ฌธ์ โ). ์๋ฒ ์ด์ ๊ฐ์น๋ ๋ชฉ๋ก์ด ์๋๋ผ ์ด๋ฐ ์ธ๊ณผ ์์ฌ์ ์๊ณ , ์ด ๋ ผ๋ฌธ์ ๊ทธ๊ฑธ ๊ฐ์ท๋ค.
- ๊ฒฝ๊ณ๋ฅผ ๋ช ์์ ์ผ๋ก ๊ธ๋๋ค. VLA๋ฅผ ๋๊ฒ ์ ์ํ๋ฉด CLIPORT๋ VLA์ง๋ง, ์ด ์๋ฒ ์ด๋ โ์ก์ ์์ฑ์ด ์๊ฐ-์ธ์ด ํํ๊ณผ ๋ฐ๊ฒฐํฉํด ํ์ต๋๋๊ฐโ๋ก ์ขํ ์ก๊ณ ๊ทธ ์ด์ ๋ฅผ ๊ฐ์ฃผ๊น์ง ๋ฌ์ ์ค๋ช ํ๋ค. ์๋ฒ ์ด๊ฐ ์๊ธฐ ์ฉ์ด์ ๊ฒฝ๊ณ๋ฅผ ๋ฐฉ์ดํ๋ ๊ฒฝ์ฐ๋ ์๊ฐ๋ณด๋ค ๋๋ฌผ๋ค.
- ๋จ์ ์นธ์ ๋น์ฐ์ง ์๋๋ค. Table 2~5์ โKey Disadvantagesโ๋ ํ์์ ๋ฌธ๊ตฌ๊ฐ ์๋๋ผ ๊ตฌ์ฒด์ ์ด๋ค(โํน๊ถ ์๋ฎฌ๋ ์ดํฐ ์ํ ํ์โ, โ2D ์ ์ฌ์์์ ํคํฌ์ธํธ ๊ฐ๋ฆผโ, โํ์ ์ ์์ค ์ ์ฑ ์ด ์ํโ, โ๋ฉ๋ชจ๋ฆฌ ๋ฒํผ ๊ด๋ฆฌ ๋น์ฉโ).
- ์ง์ฐ์๊ฐ์ 1๊ธ ์งํ๋ก ๋ฐ์ด๋ถ์ธ๋ค. Table 6๊ณผ Sec. 9.3์ ๊ฒฐํฉ์ ์ด ์๋ฒ ์ด๊ฐ ์ปค๋ฎค๋ํฐ์ ๋จ๊ธฐ๋ ๊ฐ์ฅ ์ค์ฒ์ ์ธ ์๊ตฌ๋ค. ์ฌ์ง์ด ์๊ธฐ ํ์ ๋น์นธ(โโโ = ๋ฏธ๋ณด๊ณ )์ ๊ทผ๊ฑฐ๋ก ์ผ๋๋ค.
- ๋ ผ์์ ๋ดํฉํ์ง ์๋๋ค. Sec. 9๋ โVLA ์ค์ผ์ผ๋ง์ด ๋ต์ด๋คโ๋ผ๊ณ ๋งํ์ง ์๊ณ , ๋์ โ๋ก๋ด์ ์ง์ง ์ค์ผ์ผ๋ง์ ํ๋ผ๋ฏธํฐ๊ฐ ์๋๋ผ ํ์คํฌ ๋งค๋ํด๋์ ํ์ฅโ์ด๋ผ๋ ๋ฐ๋ ๋ช ์ ๋ฅผ ์ ์ํ ๋ค ์ด์ด ๋๋ค.
- ์ต์ ์ฑ์ด ์ค์ ๋ก ๋๋ค. v7(2026-06-22)์ ฯ0.5, FAST ํ ํฌ๋์ด์ , DreamVLA, MemoryVLA, ForceVLA, knowledge insulation, Discrete Diffusion VLA ๊ฐ์ 2025~2026๋ ํ๋ฆ์ ๋ฐ์ํ๋ค. ๋ถ๋ก Table 12์๋ 2026๋ ํญ๋ชฉ๋ ์๋ค. 2023๋ ์ดํ๋ง ๋ณด๊ณ โ๋ก์ ์๋ฒ ์ดโ๋ก ํ๋จํ๋ฉด ์ ๋๋ค.
์ฝ์ ยทํ๊ณ
- ์ ๋ ๋น๊ต๊ฐ ์ฌ์ค์ ์๋ค. 4๊ฐ์ ๋ํ๊ธฐ๋ฒ ํ๋ ๋ชจ๋ ์ ์ฑ ์์ (๋ฉ์ปค๋์ฆ/์ฅ์ /๋จ์ )์ด๊ณ , ์ฑ๊ณต๋ฅ ยทSRยท์ผ๋ฐํ ์ ์๋ฅผ ๋๋ํ ๋์ ํ๊ฐ ์๋ค. ์ ์๋ค์ ๋ฒค์น๋งํฌ๊ฐ ์ ๊ฐ๊ฐ์ด๋ผ ๊ณต์ ๋น๊ต๊ฐ ๋ถ๊ฐ๋ฅํ๋ค๊ณ Sec. 8.4์์ ๋ช ์ํ๊ณ , ๊ทธ ์ง๋จ ์์ฒด๋ ์ณ๋ค. ํ์ง๋ง ๊ทธ ๊ฒฐ๊ณผ ๋ ์๋ โ์ด๋ค ๊ณ์ด์ด ์ง๊ธ ์ผ๋ง๋ ๋๋๊ฐโ๋ฅผ ์ด ์๋ฒ ์ด๋ง์ผ๋ก๋ ์ ์ ์๋ค. Table 6์กฐ์ฐจ ์ ๋ฐ์ด ๋น์ด ์๋ค. ์ฆ ์ด ์๋ฒ ์ด๋ ์ง๋์ด์ง ์ฑ์ ํ๊ฐ ์๋๋ค.
- ๊น์ด๊ฐ ์ ๋ง๋ค ๊ณ ๋ฅด์ง ์๋ค. Sec. 4ยท5ยท6์ ๊ณ๋ณด ์์ฌ๊ฐ ์ด์ดํ๋ฐ, Sec. 7(VLA)์ ๋ฐฉ๋ฒ ๋์ด์ ๋ฐ๋๊ฐ ํจ์ฌ ๋์ โ์ด ๋ฐฉ๋ฒ์ ์ด๊ฑธ ํ๊ณ , ์ ๋ฐฉ๋ฒ์ ์ ๊ฑธ ํ๋คโ ์ ์์ ์ด ๊ธธ๊ฒ ์ด์ด์ง๋ค. ๋ถ์ผ๊ฐ ๋น ๋ฅด๊ฒ ์์ง์ฌ์์ผ ํ ๋ฐ, Sec. 7๋ง ๋ฐ๋ก ์ฝ์ผ๋ฉด ์ถ์ด ์ ์ ์กํ๋ค(Fig. 16๊ณผ Table 10์ ๋จผ์ ๋ณด๊ณ ๋ค์ด๊ฐ๋ ํธ์ด ๋ซ๋ค).
- ๋ถ๋ฅ์ถ์ด ์ค์ ์ฐ๊ตฌ๋ฅผ ๊น๋ํ ๊ฐ๋ฅด์ง ๋ชปํ๋ ์ง์ ์ด ์๋ค. ์ ์๋ค๋ Fig. 16 ๊ฐ์ฃผ์์ โwe focus on delineating the primary contribution of each method โฆ even though most methods involve multiple aspectsโ ๋ผ๊ณ ์ธ์ ํ๋ค. ฯ0.5๋ โ๊ณ ์์ค ์๋ธํ์คํฌ(ํ ์คํธ) ์์ธก ํ ์ฐ์ ๋ช ๋ น ์ ์ โ์ธ๋ฐ ์ด๊ฑด โธ(์ธ์ด๋ก ๊ณํ)๊ณผ โน(ํตํฉ VLA)์ ๊ฑธ์น๋ค. LoHoVLAยทDexVLA์ โ์๊ธฐ์์ฑ ์ธ์ด ์๋ธ๊ณจโ๋ ๋ง์ฐฌ๊ฐ์ง๋ค. โธ๊ณผ โน์ ๊ฒฝ๊ณ๋ ์ค์ ๋ก ํ๋ ค์ง๋ ์ค์ด๊ณ , ์๋ฒ ์ด์ ์ถ์ ์ด ์๋ ด์ ์ ๋ด์ง ๋ชปํ๋ค.
- ์ปค๋ฒ๋ฆฌ์ง์ ๊ตฌ๋ฉ์ด ์๋ค. ์๋ฎฌ๋ ์ดํฐ ํ(Table 7)์ Isaac Lab/Isaac Sim, Genesis, SAPIEN, ManiSkill์ด ์๋ค(SAPIENยทManiSkill์ ๋ถ๋ก Table 11ยท12์ ๊ฐ๋ณ ๋ ผ๋ฌธ ํ์๋ง ๋ฑ์ฅํ๋ค). ๋ฒค์น๋งํฌ ํ(Table 8)์๋ RoboCasa, BEHAVIOR, SIMPLER ๊ฐ์ ์ถ์ด ๋น ์ ธ ์๋ค. ๋ชจ๋ธ ์ชฝ์์๋ SmolVLAยทMolmoAct ๊ณ์ด(ํจ์จ ์งํฅ ์ํ VLA, ์ก์ ์ถ๋ก ๋ชจ๋ธ)์ด ๋ณธ๋ฌธ์ ์๋ค. ๋ถ๋ก Table 10์ ์ต์ ํญ๋ชฉ์ด 2025-09๋ผ๋ ์ ๋ ํจ๊ป ๋ณด๋ฉด, v7์ ์ค์ง์ ์ปค๋ฒ๋ฆฌ์ง ์ปท์คํ๋ 2025๋ ํ๋ฐ๊ธฐ๋ก ๋ณด๋ ๊ฒ์ด ์ ํํ๋ค(๋ณธ๋ฌธ ์ธ์ฉ ์ฐ๋๊ฐ 2026์ธ ํญ๋ชฉ๋ค๋ ๋๋ถ๋ถ 2025๋ arXiv ํ๋ฆฌํ๋ฆฐํธ์ ์ ์ ๊ฒ์ฌ๋ณธ์ด๋ค).
- ์ธ์ฉ ์ฐ๋ ํ๊ธฐ๊ฐ ๋ ๋ฒ๋ก ๋์๊ฐ๋ค. ๋ณธ๋ฌธ์ โLi et al. 2026b(BridgeVLA)โ์ธ๋ฐ Table 10์ Time ์ด์ โ2025-06โ์ด๋ค. ๋ ๊ฐ ๋ชจ๋ ๋ง์ง๋ง(๊ฒ์ฌ ์ฐ๋ vs arXiv ์ต์ด ๊ณต๊ฐ), ๊ฐ์ ๋ฌธ์ ์์์ ๋ ๊ธฐ์ค์ด ์์ด๋ฉด ๋ ์๊ฐ ์ด๋ค ๊ฒ์ด ์ต์ ์ธ์ง ํ๋จํ๊ธฐ ์ด๋ ต๋ค. ์ด ์๋ฒ ์ด๋ฅผ ์ธ์ฉํ ๋๋ Table 10ยท11ยท12์ Time/Years ์ด์ ๊ธฐ์ค์ผ๋ก ์ก๋ ํธ์ด ์์ ํ๋ค.
- ํธ์ง ํ์ง์ ์ ํ . Fig. 5์ โVLM-dirvenโ, Fig. 6์ โDiffuison-basedโ, Fig. 16 ์บก์ ์ โHierachicalโยทโfllowsโ, Table 5์ โAdaptatingโ, Table 8์ โFramka Pandaโ. ๋ด์ฉ์ ์ํฅ์ ์์ง๋ง IJRR ์น์ธ๋ณธ์ด๋ผ๋ ์ ์ ์๊ฐํ๋ฉด ์์ฝ๋ค.
- โ์์ โ ์ ์ด ์์ ์ ์ด๋ค. Sec. 10.2๋ ๋ฌธ์ ๋ฅผ ์ ์ด๊ฑฐํ์ง๋ง(๋ชจํธ์ฑ/์คํจ ๋ณต๊ตฌ/์ค์๊ฐ/ํต์ ๋ณด์), ์ ํ ๊ฒ์ฆยท๋ฐํ์ ๋ชจ๋ํฐยท์์ ํํฐ ๊ฐ์ ํ์์ ์์ ๊ธฐ๋ฒ์ ๊ณ๋ณด๋ ๊ฑฐ์ ๋ค๋ฃจ์ง ์๋๋ค. LTL์ ์ฐ๋ SELP, conformal prediction์ ์ฐ๋ KnowNo๊ฐ ๋จ๋ฐ๋ก ์ธ๊ธ๋ ๋ฟ, โ์์ โ์ taxonomy์ ํ ์ถ์ผ๋ก ์น๊ฒฉ์ํค์ง๋ ์๋๋ค.
2026๋ ์์ ์์ ์ ํจํ ๋ถ๋ถ / ๋ก์ ๋ถ๋ถ
์ฌ์ ํ ์ ํจํ ๋ถ๋ถ์ taxonomy ์์ฒด์ Sec. 8ยท9๋ค. โ์ธ์ด๊ฐ ๋ณด์์ธ๊ฐ ์กฐ๊ฑด์ธ๊ฐ ๊ณํ์ธ๊ฐ ํํ์ธ๊ฐโ๋ผ๋ ์ง๋ฌธ์ ๋ชจ๋ธ์ด ๋ช ๋ฒ ๋ ์ธ๋๊ต์ฒดํด๋ ์ ์ง๋๋ ์ถ์ด๊ณ , action granularityยทlatencyยทdata regime ๊ฐ์ ๊ณตํ ์ถ์ ์คํ๋ ค ์๊ฐ์ด ๊ฐ์๋ก ์ค์ํด์ง๋ค. Sec. 9.3(์ค์๊ฐ ์ ์ฝ)๊ณผ Sec. 10.1.4(zero-shot์ ์กฐ๊ฑด๋ถ ์ฑ๊ฒฉ)๋ ์ง๊ธ ์ฝ์ด๋ ๊ฐ์ฅ ์ ์งํ ์ง๋จ์ด๋ค. Sec. 4(๋ณด์/๋น์ฉ)์ Sec. 6.1(๋ด๋ก์ฌ๋ณผ๋ฆญ)์ ์ต๊ทผ ๋
ผ๋ฌธ์์ ์ ์ ๋ค๋ฃจ๋ ๊ณ๋ณด๋ฅผ ์ด์ดํ ๋จ๊ฒจ๋ ์์นด์ด๋ธ์ ๊ฐ์น๊ฐ ์๋ค.
๋น ๋ฅด๊ฒ ๋ก๋ ๋ถ๋ถ์ Sec. 7์ ๊ฐ๋ณ ๋ฐฉ๋ฒ ๋ชฉ๋ก๊ณผ Table 10์ด๋ค. ์ปค๋ฒ๋ฆฌ์ง ์ปท์คํ๊ฐ 2025๋ ํ๋ฐ๊ธฐ์ด๋ฏ๋ก, 2026๋ ์๋ฐ๊ธฐ ์ดํ์ VLA(๋๊ท๋ชจ co-training ์ ๋ต, ์ก์ ์ถ๋ก ๋ชจ๋ธ, ์ํยท์จ๋๋ฐ์ด์ค VLA)๋ ์ด ์๋ฒ ์ด ๋ฐ์์ ๋ฐ๋ก ๋ฐ๋ผ๊ฐ์ผ ํ๋ค. Table 7์ ์๋ฎฌ๋ ์ดํฐ ๊ตฌ์ฑ๋ ํ์ฌ ์ํ๊ณ์ ์ด๊ธ๋๋ค.
๊ฒฐ๋ก ์ ์ผ๋ก ์ด ์๋ฒ ์ด๋ฅผ ์ฝ์ ๊ฐ์ ์ด๋ ๋ค. โ ์ด ๋ถ์ผ์ ์ฒ์ ๋ค์ด์ค๋ ์ฌ๋์๊ฒ๋ Fig. 3 ํ ์ฅ + Sec. 3๋ง์ผ๋ก ์งํ์ด ์กํ๋ค. โก ํน์ ๊ณ์ด์ ํ๋ ์ฌ๋์๊ฒ๋ ํด๋น ์ (4/5/6/7)์ ๊ณ๋ณด ์์ฌ์ Table 2~5์ ๋จ์ ์นธ์ด โ๋ด ๋ฐฉ๋ฒ์ด ์ด๋ ๋ณ๋ชฉ์ ๊ณต๊ฒฉํ๋์งโ๋ฅผ ์ ํํ ์์น์์ผ ์ค๋ค. โข ์์คํ ์ ๋ง๋๋ ์ฌ๋์๊ฒ๋ Sec. 8(5์ถ)๊ณผ Table 6~9๊ฐ ๊ฐ์ฅ ์ค์ฉ์ ์ด๋ค โ ํนํ ์ง์ฐ์๊ฐ๊ณผ ํ์คํฌ ๊ณ์ด 3๋ถ๋ฅ๋ ์คํ ์ค๊ณ์ ๋ฐ๋ก ์ธ ์ ์๋ค. โฃ ๋ฐ๋๋ก โ์ด๋ค ๋ฐฉ๋ฒ์ด SOTA์ธ๊ฐโ๋ฅผ ์๊ณ ์ถ๋ค๋ฉด ์ด ์๋ฒ ์ด๋ ๋ตํ์ง ์๋๋ค.
๊ด๋ จ ์ฐ๊ตฌ์์ ์๋ฆฌ ๋งค๊น
์ด ๋ธ๋ก๊ทธ์ ๊ธฐ์กด ๋ฆฌ๋ทฐ๋ค๊ณผ ์ฎ์ผ๋ฉด ์ด ์๋ฒ ์ด๋ ํ๋ธ ๋ ธ๋๋ก ์ธ ์ ์๋ค.
- ๋ค๋ฅธ ์ถ์ ์๋ฒ ์ด: VLA for Embodied AI(๋ชจ๋ธ ์ข ๋ฅ ์ถ), Dexterous Imitation Learning(์กฐ์ ๋์ ์ถ). ์ธ ํธ์ ๊ฒน์ณ ์ฝ์ผ๋ฉด ๊ฐ์ ๋ฌธํ ์งํฉ์ ์๋ก ๋ค๋ฅธ ๋จ๋ฉด์ด ๋ณด์ธ๋ค.
- โถ ์ํ ํ๊ฐ ๊ณ์ด์ ์ ๋ ผ๋ฌธ: Eureka(LLM ๋ณด์ ์ฝ๋ ์งํ), Reward Engineering(๋ณด์ ์ค๊ณยทshaping ์ผ๋ฐ๋ก ), PWTF(VoxPoser/ReKep ๊ณ์ด์ ํ์ โ VLM์ด ๋ง๋ ๋น์ฉ์ ๋์งํธ ํธ์ MPC์ ๋ฃ๊ธฐ).
- โน VLA ๊ณ์ด์ ์ ๋ ผ๋ฌธ: ฯ0(flow matching action expert), Tactile-VLA(Sec. 7.2.3์ ์ง์ ์ธ์ฉ), CompliantVLA(์ ์์ค ์ปดํ๋ผ์ด์ธ์ค โ Sec. 8.1.3์ low-level control ์ถ), RL Token(Sec. 7.5 ํํ์ต ๊ณ์ด).
- ์๋ฒ ์ด ๋ฐ์ ์ต์ ํ๋ฆ: SmolVLA(์จ๋๋ฐ์ด์ค ์ํ VLA โ Sec. 9.3์ ์ค์๊ฐ ๋ ผ์์ ๋ํ ์ง์ ์ ์๋ต), MolmoAct2(์ก์ ์ถ๋ก ๋ชจ๋ธ), RoboVerse(Table 7ยท8์ ์๋ ํตํฉ ํ๋ซํผ), Semantic World Models(Sec. 9.2 ์๋๋ชจ๋ธ ๋ ผ์์ ๋์์ ์ ์ํ).
์์ฝ
- ํ ๋ฌธ์ฅ: ์ธ์ด ์กฐ๊ฑด ๋ก๋ด ์กฐ์์ โ์๊ณ ๋ฆฌ์ฆ ์ข ๋ฅโ๊ฐ ์๋๋ผ โ์ธ์ด๊ฐ ์ ์ด ๋ฃจํ์์ ๋งก๋ ๊ธฐ๋ฅ์ ์ญํ โ โ ์ํ ํ๊ฐ โถ / ์ ์ฑ ์กฐ๊ฑด โท / ์ธ์ง์ ๊ณํยท์ถ๋ก โธ / ํตํฉ VLA โน โ ๋ก ์๋ฅด๊ณ , ์ด์ ์ง๊ตํ๋ 5๊ฐ ๊ณตํ ์ถ(granularity, data/supervision, cost/latency, environments/evaluation, task specification)์ผ๋ก ๋ค์ ๊ฐ๋ก์ง๋ฅธ IJRR ์น์ธ ์๋ฒ ์ด(v7, 2026-06).
- ๋ฌด์์ ์ป๋๊ฐ: โ ์ด ๋ถ์ผ์ ์งํ๋ ํ ์ฅ(Fig. 3), โก ๋ค ๊ฐ๋ ๊ฐ๊ฐ์ ๊ณ๋ณด ์์ฌ(๋๊ฐ ์ด๋ค ๋ณ๋ชฉ์ ์ด๋ป๊ฒ ๋ฌผ๋ ค๋ฐ์ ๊ณต๊ฒฉํ๋๊ฐ), โข ๋ํ๊ธฐ๋ฒ์ ๋จ์ ๊น์ง ์ ํ ๋น๊ตํ 4์ฅ, โฃ ํ๋ผ๋ฏธํฐยทํ๋์จ์ดยท์ ์ด ์ฃผํ์ยทํด๋ผ์ฐ๋ ์์กด์ ๋ชจ์ ์ง์ฐ์๊ฐ ํ, โค ์๋ฎฌ๋ ์ดํฐ 6์ข ยท๋ฒค์น๋งํฌ 11์ข ยทํ์คํฌ ๊ณ์ด 3๋ถ๋ฅ, โฅ ๋ดํฉํ์ง ์์ ๋ ผ์ 3์ , โฆ 2018โ2026 ์ฐํ(๋ถ๋ก Table 11ยท12).
- ๋ฌด์์ ๋ชป ์ป๋๊ฐ: ๋ฐฉ๋ฒ ๊ฐ ์ ๋ ์ฑ๋ฅ ๋น๊ต, 2026๋ ์๋ฐ๊ธฐ ์ดํ VLA, Isaac/Genesis/ManiSkill ๊ณ์ด ์๋ฎฌ๋ ์ด์ ์ํ๊ณ, ํ์์ ์์ ๊ธฐ๋ฒ์ ๊ณ๋ณด.
- ์ฝ๋ ์์ ์ถ์ฒ: Sec. 3(๋ถ๋ฅ ์ ์) โ Fig. 3 โ ๊ด์ฌ ์๋ ๊ฐ๋ 1๊ฐ(Sec. 4~7 ์ค) โ Sec. 8(5์ถ) โ Sec. 9(๋ ผ์) โ Sec. 10.1.4(zero-shot์ ์กฐ๊ฑด๋ถ ์ฑ๊ฒฉ). ์๊ฐ์ด ์์ผ๋ฉด Sec. 3 + Sec. 8 + Sec. 9๋ง ์ฝ์ด๋ ์ด ์๋ฒ ์ด์ ๊ณ ์ ๊ธฐ์ฌ๋ ๋๋ถ๋ถ ํ์๋๋ค.