Curieux.JY
  • JungYeon Lee
  • Post
  • ๐Ÿ•ธ๏ธ Graph
  • Lecture
  • Note

On this page

  • ๐Ÿ” Ping Review
  • ๐Ÿ”” Ring Review
    • ํ•œ ์ค„๋กœ ์‹œ์ž‘ํ•˜๋ฉด
    • ์™œ ๋˜ ์„œ๋ฒ ์ด์ธ๊ฐ€ โ€” ๊ธฐ์กด ์„œ๋ฒ ์ด์™€์˜ ์ฐจ์ด (Sec. 1.2)
    • ๋ฐฐ๊ฒฝ: ์™œ ํ•˜ํ•„ ์–ธ์–ด์ธ๊ฐ€ (Sec. 1)
    • ๊ณตํ†ต ์–ธ์–ด: ์„œ๋ฒ ์ด๊ฐ€ ๊น”์•„๋‘๋Š” ์ˆ˜์‹ ๊ธฐ์ดˆ (Sec. 2)
    • ๋ถ„๋ฅ˜์ฒด๊ณ„ โ€” ์ถ•์ด ์‹ค์ œ๋กœ ๋ฌด์—‡์„ ๊ฐ€๋ฅด๋Š”๊ฐ€ (Sec. 3)
    • โถ ์–ธ์–ด๋กœ ์ƒํƒœ๋ฅผ ํ‰๊ฐ€ํ•œ๋‹ค (Sec. 4)
      • 4.1 ๋ณด์ƒ: ์ˆ˜์ž‘์—… ์„ค๊ณ„ โ†’ ๋ฐ์ดํ„ฐ ํ•™์Šต โ†’ ํŒŒ์šด๋ฐ์ด์…˜ ๋ชจ๋ธ ์ƒ์„ฑ
      • 4.2 ๋น„์šฉ: ๋ชจ์…˜ ํ”Œ๋ž˜๋„ˆ๋ฅผ ์œ„ํ•œ ์–ธ์–ดโ†’๋น„์šฉ ์ง€๋„
      • Table 2 โ€” Sec. 4 ๋Œ€ํ‘œ๊ธฐ๋ฒ• (์›๋ฌธ ํ‘œ ์žฌํ˜„)
    • โท ์–ธ์–ด๋ฅผ ์ •์ฑ…์˜ ์กฐ๊ฑด์œผ๋กœ (Sec. 5)
      • 5.1 RL ์•ˆ์˜ ์–ธ์–ด
      • 5.2 BC ์•ˆ์˜ ์–ธ์–ด
      • 5.3 ํ™•์‚ฐ ์ •์ฑ… ์•ˆ์˜ ์–ธ์–ด
      • Table 3 โ€” Sec. 5 ๋Œ€ํ‘œ๊ธฐ๋ฒ• (์›๋ฌธ ํ‘œ ์žฌํ˜„)
    • โธ ์–ธ์–ด๋กœ ๊ณ„ํšํ•˜๊ณ  ์ถ”๋ก ํ•œ๋‹ค (Sec. 6)
      • 6.1 ๊ณ ์ „ ๋‰ด๋กœ์‹ฌ๋ณผ๋ฆญ โ€” ๊ทธ๋ฆฌ๊ณ  ๊ทธ๊ฒƒ์ด ์™œ ๋ฉˆ์ท„๋Š”๊ฐ€
      • 6.2 LLM์ด ๋“ค์–ด์˜จ ๋’ค
      • 6.3 VLM์ด ๋“ค์–ด์˜จ ๋’ค
      • Table 4 โ€” Sec. 6 ๋Œ€ํ‘œ๊ธฐ๋ฒ• (์›๋ฌธ ํ‘œ ์žฌํ˜„, ์ผ๋ถ€)
    • โน ์–ธ์–ด๋ฅผ ์•ก์…˜๊ณผ ํ•œ ๋ชธ์œผ๋กœ โ€” ํ†ตํ•ฉ VLA (Sec. 7)
      • 7.2 Perception โ€” ๋ฐ์ดํ„ฐ, 3D, ๊ทธ๋ฆฌ๊ณ  ์ด‰๊ฐ
      • 7.3 Reasoning โ€” ๊ณ„ํš, ์ง€์‹ ๋ณด์กด, ์›”๋“œ๋ชจ๋ธ
      • 7.4 Action โ€” ์ด์‚ฐ ํ† ํฐ์—์„œ ์—ฐ์† ์ฒญํฌ๋กœ
      • 7.5 Adaptation โ€” ๋ฐฐํฌ ๊ฐ€๋Šฅ์„ฑ์˜ ๋ฌธ์ œ
      • Table 5 & Table 10 โ€” VLA ๊ณ„์—ด ์ •๋ฆฌ (์›๋ฌธ ํ‘œ ์žฌํ˜„)
    • ์ง๊ตํ•˜๋Š” 5์ถ• ๋น„๊ต ๋ถ„์„ (Sec. 8)
      • 8.1 Action granularity โ€” skill / trajectory / low-level
      • 8.2 Data and supervision regimes
      • 8.3 System cost and latency โ€” ์ด ์„œ๋ฒ ์ด์—์„œ ๊ฐ€์žฅ ์‹ค์šฉ์ ์ธ ํ‘œ
      • 8.4 Environments and evaluations
      • 8.5 Task specification โ€” ์–ธ์–ด vs ์ด๋ฏธ์ง€/์˜์ƒ
    • ๋…ผ์Ÿ 3์ œ (Sec. 9)
      • 9.1 VLA๊ฐ€ ์˜ณ์€ ๊ธธ์ธ๊ฐ€?
      • 9.2 ์›”๋“œ๋ชจ๋ธ์ด ์˜ณ์€ ๊ธธ์ธ๊ฐ€?
      • 9.3 ์‹ค์‹œ๊ฐ„ ์ œ์•ฝ ์•„๋ž˜์„œ ์Šค์ผ€์ผ๋ง์ด ๋„์›€์ด ๋˜๋Š”๊ฐ€?
    • ์—ด๋ฆฐ ๋ฌธ์ œ์™€ ๋ฏธ๋ž˜ ๋ฐฉํ–ฅ (Sec. 10)
      • 10.1 ์ผ๋ฐ˜ํ™”
      • 10.2 ์•ˆ์ „
    • ๋น„ํŒ์ ์œผ๋กœ ๋ณด๋ฉด
      • ๊ฐ•์ 
      • ์•ฝ์ ยทํ•œ๊ณ„
      • 2026๋…„ ์‹œ์ ์—์„œ ์œ ํšจํ•œ ๋ถ€๋ถ„ / ๋‚ก์€ ๋ถ€๋ถ„
    • ๊ด€๋ จ ์—ฐ๊ตฌ์™€์˜ ์ž๋ฆฌ ๋งค๊น€
    • ์š”์•ฝ

๐Ÿ“ƒBridging Language and Action ๋ฆฌ๋ทฐ

survey
manipulation
vla
llm
vlm
rl
il
diffusion
planning
benchmark
reward
neuro-symbolic
cross-embodiment
safety
Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation
Published

August 1, 2026

  • Paper Link (arXiv:2312.10807)

  • PDF (v7, 2026-06-22)

  • Xiangtong Yao, Hongkuan Zhou, Oier Mees, Yuan Meng (๊ณต๋™ 1์ €์ž), Ted Xiao, Yonatan Bisk, Jean Oh, Edward Johns, Mohit Shridhar, Dhruv Shah, Jesse Thomason, Kai Huang, Joyce Chai, Zhenshan Bing, Alois Knoll

  • TUM ยท Bosch ยท UC Berkeley ยท Microsoft ยท Google DeepMind ยท CMU ยท Imperial College London ยท Princeton ยท USC ยท Sun Yat-sen ยท Michigan ยท Stuttgart ยท Nanjing

  • International Journal of Robotics Research (IJRR) ๊ฒŒ์žฌ ์Šน์ธ๋ณธ (๋…ผ๋ฌธ ํ‘œ์ง€ ๋ช…์‹œ), arXiv v1 2023-12-17 โ†’ v7 2026-06-22, ๋ณธ๋ฌธ 50์ชฝ + ๋ถ€๋ก/์ฐธ๊ณ ๋ฌธํ—Œ ํฌํ•จ 70์ชฝ

  1. ๐Ÿ’ก ์–ธ์–ด๋กœ ๋กœ๋ด‡์„ ์กฐ์ข…ํ•˜๋Š” ์—ฐ๊ตฌ๋ฅผ โ€œ์•Œ๊ณ ๋ฆฌ์ฆ˜ ํŒจ๋Ÿฌ๋‹ค์ž„(RL/IL/planning)โ€์ด ์•„๋‹ˆ๋ผ โ€œ์–ธ์–ด๊ฐ€ ์ œ์–ด ๋ฃจํ”„ ์•ˆ์—์„œ ๋งก๋Š” ๊ธฐ๋Šฅ์  ์—ญํ• โ€ ๋กœ ๋‹ค์‹œ ์ž๋ฅธ ์„œ๋ฒ ์ด๋‹ค โ€” ๊ฐ™์€ RL์ด๋ผ๋„ ์–ธ์–ด๊ฐ€ ๋ณด์ƒ์„ ๋งŒ๋“œ๋Š” ๊ฒƒ๊ณผ ์ •์ฑ…์„ ์กฐ๊ฑดํ™”ํ•˜๋Š” ๊ฒƒ์€ ๊ทผ๋ณธ์ ์œผ๋กœ ๋‹ค๋ฅธ ์ผ์ด๋ผ๋Š” ๊ด€์ฐฐ์—์„œ ์ถœ๋ฐœํ•œ๋‹ค.
  2. โš™๏ธ ๊ทธ ์—ญํ• ์„ โถ ์ƒํƒœ ํ‰๊ฐ€(state evaluation) โท ์ •์ฑ… ์กฐ๊ฑด(policy condition) โธ ์ธ์ง€์  ๊ณ„ํšยท์ถ”๋ก (cognitive planning and reasoning) โน ํ†ตํ•ฉ VLA(unified vision-language-action models) ๋„ค ๊ฐˆ๋ž˜๋กœ ๋‚˜๋ˆ„๊ณ , ๊ฐ ๊ฐˆ๋ž˜๋ฅผ ๋‹ค์‹œ ์•Œ๊ณ ๋ฆฌ์ฆ˜ ๊ณ„๋ณด๋กœ ์„ธ๋ถ„ํ•œ ๋’ค, ์ด์™€ ์ง๊ตํ•˜๋Š” 5๊ฐœ ์ถ•(action granularity ยท data and supervision regimes ยท system cost and latency ยท environments and evaluations ยท task specification)์œผ๋กœ ๊ฐ€๋กœ์งˆ๋Ÿฌ ๋น„๊ตํ•œ๋‹ค.
  3. ๐ŸŽฏ 4๊ฐœ์˜ ๊ณ„์ธต์  taxonomy ๊ทธ๋ฆผ + 5๊ฐœ์˜ ๊ณ„์—ด๋ณ„ ๋Œ€ํ‘œ๊ธฐ๋ฒ• ๋น„๊ตํ‘œ + ๋ฒค์น˜๋งˆํฌยท์‹œ๋ฎฌ๋ ˆ์ดํ„ฐยท์ง€์—ฐ์‹œ๊ฐ„ ํ‘œ๋ฅผ ๊ฐ–์ท„๊ณ , 2018๋…„ ์ดˆ๊ธฐ ํŒŒ์„œ ๊ธฐ๋ฐ˜ ๊ธฐ๋ฒ•๋ถ€ํ„ฐ 2026๋…„ VLA๊นŒ์ง€๋ฅผ ๋ถ€๋ก ํ‘œ 2์žฅ์œผ๋กœ ์—ฐํ‘œํ™”ํ–ˆ์œผ๋ฉฐ, ๋งˆ์ง€๋ง‰์— โ€œVLA๊ฐ€ ์˜ณ์€ ๊ธธ์ธ๊ฐ€ / ์›”๋“œ๋ชจ๋ธ์ด ์˜ณ์€ ๊ธธ์ธ๊ฐ€ / ์‹ค์‹œ๊ฐ„ ์ œ์•ฝ ์•„๋ž˜์„œ ์Šค์ผ€์ผ๋ง์ด ๋„์›€์ด ๋˜๋Š”๊ฐ€โ€ ์„ธ ๋…ผ์Ÿ์„ ์ •๋ฉด์œผ๋กœ ๋‹ค๋ฃฌ๋‹ค.

๐Ÿ” Ping Review

๐Ÿ” Ping โ€” A light tap on the surface. Get the gist in seconds.

โ€œ์–ธ์–ด๋กœ ๋กœ๋ด‡ ํŒ”์„ ์‹œํ‚ค๋Š”โ€ ์—ฐ๊ตฌ๋Š” ์ง€๋‚œ 5๋…„๊ฐ„ ํญ๋ฐœํ–ˆ์ง€๋งŒ, ๊ทธ ์ง€ํ˜•๋„๋ฅผ ๊ทธ๋ฆฌ๋Š” ๋ฐฉ์‹์€ ๋Œ€์ฒด๋กœ ๋‘ ๊ฐ€์ง€์˜€๋‹ค. ํ•˜๋‚˜๋Š” ๋ชจ๋ธ ์ข…๋ฅ˜๋กœ ์ž๋ฅด๊ธฐ(LLM ๊ธฐ๋ฐ˜ / VLM ๊ธฐ๋ฐ˜ / VLA ๊ธฐ๋ฐ˜), ๋‹ค๋ฅธ ํ•˜๋‚˜๋Š” ๋กœ๋ด‡ ๋ชจ๋“ˆ๋กœ ์ž๋ฅด๊ธฐ(perception / planning / control). ์ด ์„œ๋ฒ ์ด๋Š” ๋‘˜ ๋‹ค ๊ฑฐ๋ถ€ํ•œ๋‹ค. ์ €์ž๋“ค์˜ ๊ด€์ฐฐ์€ ๋‹จ์ˆœํ•˜๊ณ  ๋‚ ์นด๋กญ๋‹ค โ€” RL ๋…ผ๋ฌธ ๋‘ ํŽธ์ด ์žˆ๋Š”๋ฐ ํ•˜๋‚˜๋Š” LLM์—๊ฒŒ ๋ณด์ƒ ํ•จ์ˆ˜ ์ฝ”๋“œ๋ฅผ ์“ฐ๊ฒŒ ํ•˜๊ณ  ๋‹ค๋ฅธ ํ•˜๋‚˜๋Š” ์–ธ์–ด ์ž„๋ฒ ๋”ฉ์„ ์ •์ฑ… ์ž…๋ ฅ์— ๋„ฃ๋Š”๋‹ค๋ฉด, โ€œ๋‘˜ ๋‹ค RLโ€์ด๋ผ๋Š” ๋ถ„๋ฅ˜๋Š” ์•„๋ฌด๊ฒƒ๋„ ์„ค๋ช…ํ•˜์ง€ ๋ชปํ•œ๋‹ค. ์–ธ์–ด๊ฐ€ ํ•˜๋Š” ์ผ์ด ๋‹ค๋ฅด๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. ๊ทธ๋ž˜์„œ ์ด ์„œ๋ฒ ์ด๋Š” โ€œ์–ธ์–ด๊ฐ€ ์กฐ์ž‘(manipulation) ์ œ์–ด ๋ฃจํ”„์˜ ์–ด๋””์— ๋“ค์–ด๊ฐ€๋Š”๊ฐ€โ€๋ฅผ ์œ ์ผํ•œ 1์ฐจ ๋ถ„๋ฅ˜์ถ•์œผ๋กœ ์‚ผ๋Š”๋‹ค.

๊ทธ ๊ฒฐ๊ณผ๊ฐ€ ์•„๋ž˜ ๊ทธ๋ฆผ์ด๋‹ค. ๋กœ๋ด‡ ์‹œ์Šคํ…œ์„ Language / Perception / Control ์„ธ ๋ชจ๋“ˆ๋กœ ๋‘๊ณ , ์–ธ์–ด๊ฐ€ ๋“ค์–ด๊ฐ€๋Š” ์ง€์ ์„ โถ~โน๋กœ ๋ฒˆํ˜ธ ๋งค๊ธด๋‹ค. โถ์€ language โ†’ perception(๊ด€์ธก์„ ์ ์ˆ˜๋กœ), โท๋Š” language โ†’ control(๊ด€์ธก+์ง€์‹œ๋ฅผ ํ–‰๋™์œผ๋กœ), โธ์€ among language(์–ธ์–ด ์•ˆ์—์„œ์˜ ์ถ”๋ก ), โน๋Š” ์„ธ ๋ชจ๋“ˆ์„ ํ•˜๋‚˜๋กœ ์ ‘๋Š” ๊ฒƒ์ด๋‹ค.


์„œ๋ฒ ์ด์˜ ๋ผˆ๋Œ€(Fig. 2) โ€” Language / Perception / Control ์„ธ ๋ชจ๋“ˆ๊ณผ, ์–ธ์–ด๊ฐ€ ๊ฐœ์ž…ํ•˜๋Š” ๋„ค ์ง€์  โถ state evaluation, โท policy condition, โธ cognitive planning & reasoning, โน unified VLA. ์™ผ์ชฝ ๋ฃจํ”„๋Š” ์‚ฌ๋žŒ-๋กœ๋ด‡ ๋Œ€ํ™”, ์˜ค๋ฅธ์ชฝ ๋ฃจํ”„๋Š” ์—์ด์ „ํŠธ-ํ™˜๊ฒฝ ์ œ์–ด ๋ฃจํ”„๋‹ค.

ํ•ต์‹ฌ ๋ฐฉ๋ฒ•๋ก :

๋„ค ๊ฐˆ๋ž˜๋Š” ๊ฐ๊ฐ ํ•˜๋‚˜์˜ โ€œํ•ต์‹ฌ ์งˆ๋ฌธโ€์œผ๋กœ ์ •์˜๋œ๋‹ค(์›๋ฌธ Sec. 3์˜ ์„œ์ˆ ์„ ๊ทธ๋Œ€๋กœ ๋”ฐ๋ฅธ๋‹ค).

# ๊ฐˆ๋ž˜ (์›๋ฌธ ์šฉ์–ด) ํ•ต์‹ฌ ์งˆ๋ฌธ ์–ธ์–ด์˜ ์ถœ๋ ฅ๋ฌผ ํ•˜์œ„ ๊ณ„๋ณด
โถ Language for state evaluation (Sec. 4) ์–ด๋–ค ์ƒํƒœยท๊ฒฐ๊ณผ๊ฐ€ ๋ฐ”๋žŒ์งํ•œ์ง€๋ฅผ ์–ธ์–ด๊ฐ€ ์–ด๋–ป๊ฒŒ ๊ทœ์ •ํ•˜๋Š”๊ฐ€ (์ง„ํ–‰๋„ ํ”ผ๋“œ๋ฐฑ) ์Šค์นผ๋ผ ๋ณด์ƒ / ๋น„์šฉ(3D value map) Reward designing(sparseยทdense) โ†’ Reward learning(IRL ๋“ฑ) โ†’ FM-driven generation ยท Cost mapping(specific textโ†’cost, FM-driven)
โท Language as a policy condition (Sec. 5) ์–ธ์–ด๊ฐ€ ์ •์ฑ…์„ ์–ด๋–ป๊ฒŒ ์กฐ๊ฑดํ™”ํ•ด ์˜ฌ๋ฐ”๋ฅธ ํ–‰๋™์„ ๋‚ด๊ฒŒ ํ•˜๋Š”๊ฐ€ ํ–‰๋™ a_t RL โ†’ Behavioral Cloning โ†’ Diffusion-based Policy
โธ Language for cognitive planning and reasoning (Sec. 6) ๋กœ๋ด‡์ด ์–ธ์–ด ๊ณต๊ฐ„์—์„œ ์–ด๋–ป๊ฒŒ โ€œ์ƒ๊ฐโ€ํ•ด ์ž๊ธฐ ํ–‰๋™์„ ๊ตฌ์กฐํ™”ํ•˜๋Š”๊ฐ€ ์„œ๋ธŒ๊ณจ / ๊ณ„ํš / ์ฝ”๋“œ / ์‹ฌ๋ณผ Classic neuro-symbolic โ†’ Empowered by LLMs โ†’ Empowered by VLMs
โน Language in unified VLA models (Sec. 7) ๋น„์ „ยท์–ธ์–ดยทํ–‰๋™์„ ํ•˜๋‚˜์˜ ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ๋ชจ๋ธ๋กœ ์–ด๋–ป๊ฒŒ ํ†ตํ•ฉํ•˜๋Š”๊ฐ€ ์•ก์…˜ ํ† ํฐ / ์—ฐ์† ์•ก์…˜ ์ฒญํฌ Perception โ†’ Reasoning โ†’ Action โ†’ Adaptation

์—ฌ๊ธฐ์— ์ง๊ตํ•˜๋Š” 5์ถ•(Sec. 8)์ด ์–นํžŒ๋‹ค: action granularity(skill-level / trajectory-level / low-level control), data and supervision regimes, system cost and latency, environments and evaluations, task specification(์–ธ์–ด vs. ์ด๋ฏธ์ง€/์˜์ƒ). ์ด 5์ถ•์€ โ€œ์–ธ์–ด๊ฐ€ ์–ด๋”” ๋“ค์–ด๊ฐ€๋Š”๊ฐ€โ€์™€ ๋ฌด๊ด€ํ•˜๊ฒŒ ์‹ค์ œ ๋ฐฐ์น˜ ๊ฐ€๋Šฅ์„ฑ์„ ๊ฒฐ์ •ํ•˜๋Š” ๊ณตํ•™์  ์„ ํƒ์„ ๋น„๊ตํ•˜๊ธฐ ์œ„ํ•œ ์žฅ์น˜๋‹ค.

์ˆ˜์‹์ ์œผ๋กœ๋Š” โท๊ฐ€ ๊ฐ€์žฅ ๋ช…๋ฃŒํ•˜๋‹ค. ๋ชฉํ‘œ ์กฐ๊ฑด IL(GCIL)์—์„œ ๋ชฉํ‘œ g ์ž๋ฆฌ์— ์–ธ์–ด ์ง€์‹œ l์„ ๋ผ์›Œ ๋„ฃ๋Š” ๊ฒƒ์ด ์ถœ๋ฐœ์ ์ด๊ณ ,

\mathcal{L}_{\text{BC}}(\theta, D) = \mathbb{E}_{(s_t^j,\,a_t^j,\,g^j)\sim D}\Big[\big\|\pi_\theta(s_t^j, g^j) - a_t^j\big\|_2^2\Big] \quad\Longrightarrow\quad \pi_\theta(a_t \mid s_t, l)

์ด ์ˆœ๊ฐ„ ์–ธ์–ด์˜ ์ง€์œ„๊ฐ€ goal specifier์—์„œ behavior specifier๋กœ ๋ฐ”๋€๋‹ค๋Š” ๊ฒƒ์ด Sec. 5์˜ ํ•œ ์ค„ ์š”์•ฝ์ด๋‹ค. ๊ทธ๋ฆฌ๊ณ  Sec. 8์€ ์„ธ ๊ณ„์—ด์˜ ํ•™์Šต ์‹ ํ˜ธ๋ฅผ ํ•˜๋‚˜์˜ ๋ชฉ์ ํ•จ์ˆ˜๋กœ ๋ฌถ๋Š”๋‹ค:

\mathcal{L}_{\text{final}} = \lambda_1 \mathcal{L}_{\text{targets}} + \lambda_2 \mathcal{L}_{\text{evaluations}} + \lambda_3 \mathcal{L}_{\text{auxiliary}}

\mathcal{L}_{\text{targets}}๋Š” per-sample ์ •๋‹ต(ํ–‰๋™ยท์„œ๋ธŒ๊ณจยท์„ฑ๊ณต ๋ผ๋ฒจ) ๋ชจ์‚ฌ, \mathcal{L}_{\text{evaluations}}๋Š” ์‹คํ–‰์—์„œ ๋‚˜์˜จ ์Šค์นผ๋ผ ํ‰๊ฐ€(๋ณด์ƒยท์„ ํ˜ธยท์„ฑ๊ณต), \mathcal{L}_{\text{auxiliary}}๋Š” ์ž๊ธฐ์ง€๋„(visual attention / reconstruction / future prediction). ์ €์ž๋“ค์ด ์ œ์‹œํ•˜๋Š” ํ”ํ•œ ์ปค๋ฆฌํ˜๋Ÿผ์€ โ€œ\lambda_1์„ ํฌ๊ฒŒ ๋‘๊ณ  ๋ชจ๋ฐฉ์œผ๋กœ warm-start โ†’ \lambda_2๋ฅผ ์˜ฌ๋ฆฌ๋ฉฐ \lambda_1์„ ๋‚ฎ์ถฐ ๊ฒฐ๊ณผ ํ‰๊ฐ€๋กœ ๊ฐ•๊ฑดํ™” โ†’ \lambda_3๋Š” ์ž‘์ง€๋งŒ 0์ด ์•„๋‹ˆ๊ฒŒ ๊ณ„์†โ€์ด๋‹ค.

์ฃผ์š” ๊ฒฐ๊ณผ(์„œ๋ฒ ์ด์ด๋ฏ€๋กœ โ€œ์ •๋ฆฌ๋ฌผ์˜ ๊ทœ๋ชจโ€๋กœ ์ฝ๋Š”๋‹ค):

  • ๋ถ„๋ฅ˜ ๊ทธ๋ฆผ 4์žฅ: Sec. 4ยท5ยท6ยท7 ๊ฐ๊ฐ์— ์ „์šฉ taxonomy ๊ทธ๋ฆผ(Fig. 5, 6, 9, 16)์ด ๋ถ™๋Š”๋‹ค. ๊ณ„์—ด๋ณ„ โ€œ์ฝ”์–ด ์•„์ด๋””์–ดโ€ ํ•œ ์ค„์ด ๊ทธ๋ฆผ ์•ˆ์— ๋ฐ•ํ˜€ ์žˆ์–ด(์˜ˆ: Sec. 5๋Š” โ€œlanguage instructs how to doโ€) ์ถ•์ด ๋ฌด์—‡์„ ๊ฐ€๋ฅด๋Š”์ง€ ํ—ท๊ฐˆ๋ฆฌ์ง€ ์•Š๋Š”๋‹ค.
  • ๋Œ€ํ‘œ๊ธฐ๋ฒ• ๋น„๊ตํ‘œ 4์žฅ: Table 2~5๋Š” ๊ฐ ๊ฐˆ๋ž˜์—์„œ ๋Œ€ํ‘œ ๊ธฐ๋ฒ• 5~8๊ฐœ๋ฅผ ๋ฝ‘์•„ ํ•ต์‹ฌ ๋ฉ”์ปค๋‹ˆ์ฆ˜ / ์ฃผ์š” ์žฅ์  / ์ฃผ์š” ๋‹จ์ ์„ ๋‚˜๋ž€ํžˆ ๋†“๋Š”๋‹ค. ๋‹จ์  ์นธ์ด ๋น„์–ด ์žˆ์ง€ ์•Š๋‹ค๋Š” ์ ์ด ์ด ์„œ๋ฒ ์ด์˜ ๋ฏธ๋•์ด๋‹ค.
  • ์‹ค์ธก ์ง€ํ–ฅ ํ‘œ: Table 6์€ ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜ยทํ•˜๋“œ์›จ์–ดยท์ œ์–ด ์ฃผํŒŒ์ˆ˜ยทํด๋ผ์šฐ๋“œ ์˜์กด ์—ฌ๋ถ€๋ฅผ ํ•œ ํ‘œ์— ๋ชจ์€๋‹ค(RT-1 35M ~3Hz, OpenVLA 7B/RTX4090 3โ€“6Hz, Diffusion Policy ~200M* ~1Hz, ManiCM ~200M*/RTX4090 ~50โ€“60Hz ๋“ฑ). Table 7์€ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ 6์ข…, Table 8์€ ๋ฒค์น˜๋งˆํฌ 11์ข…์„ ๊ด€์ธก ๋ชจ๋‹ฌ๋ฆฌํ‹ฐยท๋ฐ์ดํ„ฐ ๊ทœ๋ชจ๊นŒ์ง€ ํฌํ•จํ•ด ๋น„๊ตํ•œ๋‹ค.
  • ์—ฐํ‘œ: ๋ถ€๋ก Table 11ยท12๊ฐ€ 2018๋…„(IPRO, exePlan ๋“ฑ ํŒŒ์„œ/LSTM ์‹œ๋Œ€)๋ถ€ํ„ฐ 2026๋…„(AffordanceGrasp-R1)๊นŒ์ง€ 100ํŽธ ์ด์ƒ์„ ์—ฐ๋„ / ๋ฒค์น˜๋งˆํฌ / ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ / ์–ธ์–ด ๋ชจ๋“ˆ / ์ธ์‹ ๋ชจ๋“ˆ / ์‹ค๊ธฐ ์‹คํ—˜ ์—ฌ๋ถ€ / FMยทRLยทILยทMP ์‚ฌ์šฉ ์—ฌ๋ถ€๋กœ ํ‘œ์ค€ํ™”ํ•ด ๋‚˜์—ดํ•œ๋‹ค.
  • ๋…ผ์Ÿ 3์ œ(Sec. 9): VLA ์Šค์ผ€์ผ๋ง, ์›”๋“œ๋ชจ๋ธ, ์‹ค์‹œ๊ฐ„ ์ œ์•ฝ โ€” ๊ฐ๊ฐ์— ๋Œ€ํ•ด ์ฐฌ๋ฐ˜ ๊ทผ๊ฑฐ๋ฅผ ๋ชจ๋‘ ์ ๊ณ  ๊ฒฐ๋ก ์„ ์œ ๋ณดํ•œ๋‹ค.

๊ฒฐ๋ก :

์ด ์„œ๋ฒ ์ด์˜ ๊ฐ’์€ โ€œ๋…ผ๋ฌธ ๋ชฉ๋กโ€์ด ์•„๋‹ˆ๋ผ ์ž๋ฅด๋Š” ์นผ์— ์žˆ๋‹ค. ์–ธ์–ด๊ฐ€ ๋ณด์ƒ์ด ๋˜๋Š”๊ฐ€, ์กฐ๊ฑด์ด ๋˜๋Š”๊ฐ€, ๊ณ„ํš์ด ๋˜๋Š”๊ฐ€, ์•„๋‹ˆ๋ฉด ์•„์˜ˆ ์•ก์…˜๊ณผ ํ•œ ๋ชธ์ด ๋˜๋Š”๊ฐ€ โ€” ์ด ๋„ค ์งˆ๋ฌธ์€ ์‹ค์ œ๋กœ ์„œ๋กœ ๋‹ค๋ฅธ ๋ณ‘๋ชฉ๊ณผ ๋‹ค๋ฅธ ์‹คํŒจ ์–‘์ƒ์„ ๊ฐ–๋Š”๋‹ค(โถ์€ ๋ณด์ƒ ์ฝ”๋“œ์˜ ์ทจ์•ฝ์„ฑ, โท๋Š” ์ƒ˜ํ”Œ ๋น„ํšจ์œจ๊ณผ ์ถ”๋ก  ์ง€์—ฐ, โธ์€ ํ™˜๊ฐ๊ณผ ๊ทธ๋ผ์šด๋”ฉ, โน๋Š” ๋ฐ์ดํ„ฐ ๊ทœ๋ชจ์™€ catastrophic forgetting). ๋ฐ˜๋Œ€๋กœ ์ด ์„œ๋ฒ ์ด๋Š” โ€œ์–ด๋–ค ๋ฐฉ๋ฒ•์ด ์–ผ๋งˆ๋‚˜ ์ž˜ํ•˜๋Š”๊ฐ€โ€์— ๋Œ€ํ•ด์„œ๋Š” ์ •๋Ÿ‰ ๋น„๊ต๋ฅผ ๊ฑฐ์˜ ์ œ๊ณตํ•˜์ง€ ์•Š๋Š”๋‹ค โ€” ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์ œ๊ฐ๊ฐ์ด๋ผ ๊ทธ๋Ÿด ์ˆ˜ ์—†๋‹ค๋Š” ๊ฒƒ์ด ์ €์ž๋“ค์˜ ์ž…์žฅ์ด๊ณ , ๊ทธ ์ž์ฒด๊ฐ€ ์ด ๋ถ„์•ผ์˜ ์ง„๋‹จ์ด๊ธฐ๋„ ํ•˜๋‹ค.


๐Ÿ”” Ring Review

๐Ÿ”” Ring โ€” An idea that echoes. Grasp the core and its value.

ํ•œ ์ค„๋กœ ์‹œ์ž‘ํ•˜๋ฉด

โ€œlanguage-conditioned manipulation์€ ํ•˜๋‚˜์˜ ๋ฌธ์ œ๊ฐ€ ์•„๋‹ˆ๋ผ ๋„ค ๊ฐœ์˜ ๋ฌธ์ œ๋‹คโ€ โ€” ์ด๊ฒƒ์ด ์ด ์„œ๋ฒ ์ด๊ฐ€ ํ•˜๋Š” ์œ ์ผํ•˜๊ณ ๋„ ์ถฉ๋ถ„ํ•œ ์ฃผ์žฅ์ด๋‹ค.

๊ธฐ์กด ์„œ๋ฒ ์ด๋“ค์€ ๋Œ€์ฒด๋กœ โ€œ๋ฌด์—‡์œผ๋กœ ๋งŒ๋“ค์—ˆ๋Š”๊ฐ€โ€(LLM/VLM/VLA)๋‚˜ โ€œ์–ด๋А ๋ชจ๋“ˆ์ธ๊ฐ€โ€(perception/planning/control)๋กœ ์ •๋ฆฌํ–ˆ๋‹ค. ๊ทธ๋Ÿฌ๋ฉด SayCan๊ณผ Text2Reward๊ฐ€ โ€œ๋‘˜ ๋‹ค LLM ํ™œ์šฉโ€์œผ๋กœ ๋ฌถ์ด๊ณ , PerAct์™€ ฯ€0๊ฐ€ โ€œ๋‘˜ ๋‹ค policyโ€๋กœ ๋ฌถ์ธ๋‹ค. ์‹ค์ œ๋กœ ์ด ์กฐํ•ฉ๋“ค์€ ์„œ๋กœ ๋ฐฐ์šธ ๊ฒƒ์ด ๊ฑฐ์˜ ์—†๋‹ค. ๋ฐ˜๋Œ€๋กœ ์ด ์„œ๋ฒ ์ด์˜ ์ถ•์œผ๋กœ ์ž๋ฅด๋ฉด Text2Reward๋Š” EUREKAยทVoxPoser์™€ ํ•œ ๋ฐฉ์— ๋“ค์–ด๊ฐ€๊ณ (๋ชจ๋‘ โ€œ์–ธ์–ดโ†’์ •๋Ÿ‰ ํ•จ์ˆ˜โ€), SayCan์€ SayPlanยทCode as Policies์™€ ํ•œ ๋ฐฉ์— ๋“ค์–ด๊ฐ„๋‹ค(๋ชจ๋‘ โ€œ์–ธ์–ด ์•ˆ์—์„œ์˜ ๊ณ„ํšโ€). ๊ฐ ๋ฐฉ ์•ˆ์—์„œ๋Š” ์‹ค์ œ๋กœ ๊ฐ™์€ ๋ณ‘๋ชฉ์„ ๋‹ค๋ฅด๊ฒŒ ๊ณต๊ฒฉํ•œ ๊ณ„๋ณด๊ฐ€ ๋ณด์ธ๋‹ค. ์ด ์„œ๋ฒ ์ด๋ฅผ ์ฝ๋Š” ๊ฐ’์€ ๊ทธ ๊ณ„๋ณด๋ฅผ ๋”ฐ๋ผ๊ฐ€๋Š” ๋ฐ ์žˆ๋‹ค.

์™œ ๋˜ ์„œ๋ฒ ์ด์ธ๊ฐ€ โ€” ๊ธฐ์กด ์„œ๋ฒ ์ด์™€์˜ ์ฐจ์ด (Sec. 1.2)

์ €์ž๋“ค์€ ์ž๊ธฐ ์ž๋ฆฌ๋ฅผ ๋ช…์‹œ์ ์œผ๋กœ ์žก๋Š”๋‹ค. LLM ์ด์ „์—๋Š” Tellex et al. (2020)์ด โ€œlexically groundedโ€ vs โ€œlearning methodsโ€ ๊ฐ™์€ ๊ธฐ์ˆ ์  ํ† ๋Œ€๋กœ ์–ธ์–ด ๊ทธ๋ผ์šด๋”ฉ์„ ์ •๋ฆฌํ–ˆ๋‹ค. LLM ์ดํ›„์˜ ์„œ๋ฒ ์ด๋“ค(Hu et al. 2023; Li et al. 2024a; Xiao et al. 2025)์€ ํŒŒ์šด๋ฐ์ด์…˜ ๋ชจ๋ธ์„ ๋ชจ๋ธ ์ข…๋ฅ˜์™€ ๋Œ€์ฒด๋˜๋Š” ๋กœ๋ด‡ ๋ชจ๋“ˆ๋กœ ์กฐ์งํ–ˆ๊ณ , Firoozi et al. (2025)์€ โ€œPerception / Decision-making / Controlโ€์ด๋ผ๋Š” ์ผ๋ฐ˜ ๋กœ๋ณดํ‹ฑ์Šค ๋Šฅ๋ ฅ์œผ๋กœ ์กฐ์งํ–ˆ๋‹ค.

์ด ์„œ๋ฒ ์ด๋Š” ์ž๊ธฐ ๊ด€์ ์„ โ€œdistinct and orthogonalโ€ํ•˜๋‹ค๊ณ  ํ‘œํ˜„ํ•œ๋‹ค. ์ฆ‰ ๊ธฐ์กด ์ถ•์„ ๋ถ€์ •ํ•˜๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ ์ง๊ตํ•˜๋Š” ์ถ•์„ ํ•˜๋‚˜ ๋” ๋†“๋Š”๋‹ค๋Š” ์ฃผ์žฅ์ด๋‹ค. ์‹ค์ œ๋กœ ๊ทธ ์ง๊ต์„ฑ ๋•Œ๋ฌธ์— Sec. 8์ด ํ•„์š”ํ•ด์ง„๋‹ค โ€” ๊ธฐ๋Šฅ์  ์—ญํ• ๋กœ ์ž๋ฅธ ๋’ค, ๊ณตํ•™์  ์ถ•(granularity/data/cost/eval/spec)์œผ๋กœ ๋‹ค์‹œ ๊ฐ€๋กœ์ง€๋ฅด๋Š” ๊ตฌ์กฐ๋‹ค.

๐Ÿ’ก ์ฐธ๊ณ ๋กœ ์ด ๋ธ”๋กœ๊ทธ์—๋Š” ๋ชจ๋ธ ์ข…๋ฅ˜ ์ถ•์œผ๋กœ ์ •๋ฆฌํ•œ VLA for Embodied AI ์„œ๋ฒ ์ด ๋ฆฌ๋ทฐ์™€, ์กฐ์ž‘ ๋Œ€์ƒ ์ถ•์œผ๋กœ ์ •๋ฆฌํ•œ Dexterous Imitation Learning ์„œ๋ฒ ์ด ๋ฆฌ๋ทฐ๊ฐ€ ์ด๋ฏธ ์žˆ๋‹ค. ์ด ์„ธ ํŽธ์€ ๊ฒน์น˜๊ธฐ๋ณด๋‹ค ์„œ๋กœ ๋‹ค๋ฅธ ์นผ๋กœ ๊ฐ™์€ ๋ฉ์–ด๋ฆฌ๋ฅผ ์ž๋ฅธ ๊ฒƒ์— ๊ฐ€๊น๋‹ค.

๋ฐฐ๊ฒฝ: ์™œ ํ•˜ํ•„ ์–ธ์–ด์ธ๊ฐ€ (Sec. 1)

Sec. 1์€ โ€œ์–ธ์–ด ์กฐ๊ฑดํ™”โ€์˜ ๊ทผ๊ฑฐ๋ฅผ ์„ธ ๊ฐ€์ง€๋กœ ์ •๋ฆฌํ•œ๋‹ค. ํฅ๋ฏธ๋กœ์šด ๊ฒƒ์€ ์ €์ž๋“ค์ด ์–ธ์–ด๋ฅผ ์ด๋ฏธ์ง€/์˜์ƒ ์กฐ๊ฑดํ™”์™€ ๊ฒฝ์Ÿ ๊ด€๊ณ„๊ฐ€ ์•„๋‹ˆ๋ผ ์ƒ๋ณด ๊ด€๊ณ„๋กœ ๋‘๊ณ  ์‹œ์ž‘ํ•œ๋‹ค๋Š” ์ ์ด๋‹ค(์ด ์ „์ œ๋Š” Sec. 8.5์—์„œ ๋‹ค์‹œ ํšŒ์ˆ˜๋œ๋‹ค).

  1. Accessibility and usability โ€” Tellex et al. (2020)์˜ ํ‘œํ˜„์„ ์ธ์šฉํ•œ๋‹ค: โ€œmost future robot users will not be programmers.โ€ ์–ธ์–ด๋Š” GUI๋‚˜ ์Šคํฌ๋ฆฝํŠธ ์—†์ด ๋ชฉํ‘œ๋ฅผ ์ง€์ •ํ•˜๊ฒŒ ํ•˜๋Š” โ€œzero-learningโ€ ์ธํ„ฐํŽ˜์ด์Šค๋‹ค.
  2. Trust through bidirectional communication โ€” ๋ช…๋ น์„ ์ฃผ๋Š” ์ฑ„๋„์ด ๊ณง ์ •์ •ยทํ•ด๋ช…์„ ๋ฐ›๋Š” ์ฑ„๋„์ด ๋œ๋‹ค. ์‚ฌ์šฉ์ž๊ฐ€ โ€œI have a trach and have to eat slowlyโ€ ๋ผ๊ณ  ๋งํ•˜๋ฉด ๋กœ๋ด‡์ด ๊ทผ๊ฑฐ๋ฅผ ๋˜๋Œ๋ ค์ค„ ์ˆ˜ ์žˆ๋‹ค๋Š” ๊ฒƒ.
  3. Transferring textual knowledge to robotics โ€” โ€œstack the two lightest boxesโ€ ๊ฐ™์€ ๋ช…๋ น์€ ์ง€๊ฐ ์งˆ์˜ + ๊ด€๊ณ„ ์ถ”๋ก  + ์Šคํ‚ฌ ์‹œํ€€์Šค๋กœ ๋ถ„ํ•ด๋œ๋‹ค. ์–ธ์–ด๋Š” ๋ฌผ์„ฑยท์ ˆ์ฐจยท์•ˆ์ „ ๊ทœ์น™ ๊ฐ™์€ ์ƒ์‹์„ ์ œ์–ด๊ณ„๋กœ ์ˆ˜์ž…ํ•˜๋Š” ์••์ถ• ์ธํ„ฐํŽ˜์ด์Šค๋‹ค.

๊ทธ๋ฆฌ๊ณ  ์ด ์„œ๋ฒ ์ด์˜ ํ•ต์‹ฌ ํ”„๋ ˆ์ด๋ฐ์ด ๋‚˜์˜จ๋‹ค: ์–ธ์–ด๋Š” ์™ธ๋ถ€ ํƒœ์Šคํฌ ๋ช…์„ธ์ผ ๋ฟ ์•„๋‹ˆ๋ผ ๋กœ๋ด‡ ์ถ”๋ก ์˜ ๋‚ด๋ถ€ ์ธ์ง€ ๋งค์ฒด์ด๊ธฐ๋„ ํ•˜๋‹ค. โธ์ด ๋ณ„๋„ ๊ฐˆ๋ž˜๋กœ ์กด์žฌํ•˜๋Š” ์ด์œ ๊ฐ€ ์—ฌ๊ธฐ ์žˆ๋‹ค.

๊ณตํ†ต ์–ธ์–ด: ์„œ๋ฒ ์ด๊ฐ€ ๊น”์•„๋‘๋Š” ์ˆ˜์‹ ๊ธฐ์ดˆ (Sec. 2)

Sec. 2๋Š” MDP โ†’ RL(๊ฐ€์น˜ํ•จ์ˆ˜, ๋ฒจ๋งŒ) โ†’ IL(BC / GCIL / IRL) โ†’ diffusion policy โ†’ KBยทKGยทKGE โ†’ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์œตํ•ฉ โ†’ ์–ธ์–ด๋ชจ๋ธ ๊ณ„๋ณด(NLM โ†’ PLM โ†’ LLM โ†’ VLM โ†’ VLA)๋ฅผ ์••์ถ•ํ•ด ๊น๋‹ค. ์„œ๋ฒ ์ด ์น˜๊ณ  ์ˆ˜์‹์„ ์„ฑ์‹คํžˆ ์ ์–ด๋‘” ํŽธ์ด๊ณ , ๋’ค ์ ˆ๋“ค์ด ์ด ๊ธฐํ˜ธ๋ฅผ ์žฌ์‚ฌ์šฉํ•˜๋ฏ€๋กœ ๊ฑด๋„ˆ๋›ฐ๋ฉด ์†ํ•ด๋‹ค. ํŠนํžˆ ์„ธ ๋Œ€๋ชฉ์ด ๋’ค์—์„œ ๊ณ„์† ์“ฐ์ธ๋‹ค.

(a) GCIL๊ณผ hindsight relabeling. ๋ชฉํ‘œ ์กฐ๊ฑด ์„ค์ •์—์„œ ๋ณด์ƒ์€ ์ง€์‹œํ•จ์ˆ˜๋กœ ์ •์˜๋œ๋‹ค.

r(s_t, a_t, s_{t+1}, g) = \mathbb{1}\big[s_{t+1} = g\big]

๊ทธ๋ฆฌ๊ณ  ์ „์ด (s_t^j, a_t^j, s_{t+1}^j, g^j)๋Š” (s_t^j, a_t^j, s_{t+1}^j,\, g'=s_{t+k}^j)๋กœ ์žฌ๋ผ๋ฒจ๋ง๋  ์ˆ˜ ์žˆ๋‹ค. HER(Andrychowicz et al. 2017)๊ณผ ๊ฐ™์€ ์›๋ฆฌ๋‹ค. ์ด ๊ด€์ ์ด ๋’ค์—์„œ โ€œplay data๋ฅผ ์‚ฌํ›„์— ์–ธ์–ด๋กœ ๋ผ๋ฒจ๋งํ•ด ์“ด๋‹คโ€(Learning from Play, MCIL)๋กœ ์ด์–ด์ง„๋‹ค.

(b) ํ™•์‚ฐ ์ •์ฑ…์˜ ๋‘ ๋‹จ๊ณ„. ์—ญ๋ฐฉํ–ฅ(denoising) ๊ฐฑ์‹ ๊ณผ ํ•™์Šต ๋ชฉ์ :

\boldsymbol{A}_t^{k-1} = \alpha\big(\boldsymbol{A}_t^{k} - \gamma\,\varepsilon_\theta(\boldsymbol{O}_t, \boldsymbol{A}_t^k, k)\big) + \mathcal{N}(0, \sigma^2 I)

\mathcal{L} = \mathbb{E}_{k,\varepsilon}\Big[\big\|\varepsilon - \varepsilon_\theta(\boldsymbol{O}_t,\ \boldsymbol{A}_t^0 + \varepsilon,\ k)\big\|_2^2\Big]

์—ฌ๊ธฐ์„œ k๊ฐ€ ๋ฐ˜๋ณต ํšŸ์ˆ˜๋ผ๋Š” ์‚ฌ์‹ค์ด Sec. 5.3ยท8.3์˜ โ€œinference latencyโ€ ๋…ผ์˜์™€ Table 6์˜ Diffusion Policy ~1Hz ์ˆ˜์น˜๋กœ ์ง๊ฒฐ๋œ๋‹ค.

(c) ์ง€์‹ ๊ทธ๋ž˜ํ”„. \mathcal{G} \subseteq \mathcal{E} \times \mathcal{R} \times \mathcal{E}, ์ž„๋ฒ ๋”ฉ์€ M_\theta:\mathcal{E}\cup\mathcal{R}\to\mathbb{R}^d. Sec. 6.1(neuro-symbolic)์˜ ์ „์ œ์ด์ž, ๊ทธ ๊ณ„์—ด์ด ์™œ ํ™•์žฅ๋˜์ง€ ์•Š๋Š”์ง€(KG ๊ตฌ์ถ• ๋น„์šฉ)์˜ ๊ทผ๊ฑฐ๋‹ค.

๋ถ„๋ฅ˜์ฒด๊ณ„ โ€” ์ถ•์ด ์‹ค์ œ๋กœ ๋ฌด์—‡์„ ๊ฐ€๋ฅด๋Š”๊ฐ€ (Sec. 3)

Sec. 3์€ ์งง์ง€๋งŒ ์ด ์„œ๋ฒ ์ด์—์„œ ๊ฐ€์žฅ ์ค‘์š”ํ•œ ์ ˆ์ด๋‹ค. ์ €์ž๋“ค์˜ ๋ฌธ์žฅ์„ ๊ทธ๋Œ€๋กœ ์˜ฎ๊ธฐ๋ฉด: โ€œan RL agent might use language to shape its reward function or, in a completely different manner, to directly condition its policy learning. Although both involve RL methods, the function of language is fundamentally different.โ€

๊ทธ๋ฆฌ๊ณ  ์•„๋ž˜ ๊ทธ๋ฆผ์ด ์ „์ฒด ์ง€๋„๋‹ค. ์™ผ์ชฝ๋ถ€ํ„ฐ โถโทโธ์ด ๋†“์ด๊ณ , โธ์˜ โ€œEmpowered by VLMsโ€ ๋ฐ•์Šค์—์„œ ์•„๋ž˜๋กœ ํ™”์‚ดํ‘œ๊ฐ€ ๋‚ด๋ ค์™€ โน๋กœ ์—ฐ๊ฒฐ๋œ๋‹ค(โ€œVLMs drivenโ€). ์ฆ‰ ์ €์ž๋“ค์€ VLA๋ฅผ ๊ฐ‘์ž๊ธฐ ๋“ฑ์žฅํ•œ ๋ณ„์ข…์ด ์•„๋‹ˆ๋ผ VLM ๊ธฐ๋ฐ˜ ๊ณ„ํšยท์ถ”๋ก  ๊ณ„์—ด์˜ ์—ฐ์žฅ์„ ์œผ๋กœ ๋ฐฐ์น˜ํ•œ๋‹ค.


์ „์ฒด ์ง€๋„(Fig. 3) โ€” ๋„ค ๊ฐˆ๋ž˜์™€ ๊ทธ ์•„๋ž˜ ๊ณ„๋ณด, ๊ทธ๋ฆฌ๊ณ  ๊ฐ ์นธ์— ๋ฐฐ์น˜๋œ ๋Œ€ํ‘œ ์—ฐ๊ตฌ๋“ค. ์ขŒํ•˜๋‹จ ๋ฒ”๋ก€์˜ ์•„์ด์ฝ˜(Expert Designed / Demonstrations / Knowledge Base)์€ ๊ฐ ๊ณ„์—ด์ด ๋ฌด์—‡์— ์˜์กดํ•˜๋Š”์ง€๋ฅผ ํ‘œ์‹œํ•œ๋‹ค. โน ๋ฐ•์Šค ์•ˆ์˜ 4๊ฐœ ๋ถˆ๋ฆฟ(Perception / Reasoning / Action / Adaptation)์ด Sec. 7์˜ ํ•˜์œ„ ์ถ•์ด๋‹ค.

์ด ๊ทธ๋ฆผ ํ•œ ์žฅ์ด ์„œ๋ฒ ์ด ๋ณธ๋ฌธ 40์ชฝ์˜ ๋ชฉ์ฐจ๋‹ค. ๋‚˜์—ด๋œ ์ด๋ฆ„์„ ๋‹ค ์•Œ ํ•„์š”๋Š” ์—†๊ณ , ์นธ์˜ ๊ตฌ์กฐ๋ฅผ ๋ณด๋ฉด ๋œ๋‹ค. ์˜ˆ๋ฅผ ๋“ค์–ด โถ์€ Reward Design/Learning๊ณผ Cost Functions Mapping ๋‘˜๋กœ ๊ฐˆ๋ฆฌ๋Š”๋ฐ, ์ „์ž๋Š” ํ•™์Šต ๊ธฐ๋ฐ˜ ์—์ด์ „ํŠธ(RL)๋ฅผ, ํ›„์ž๋Š” ์ตœ์ ํ™” ๊ธฐ๋ฐ˜ ๋ชจ์…˜ ํ”Œ๋ž˜๋„ˆ๋ฅผ ๊ฒจ๋ƒฅํ•œ๋‹ค. ๊ฐ™์€ โ€œ์–ธ์–ดโ†’์ˆซ์žโ€์ธ๋ฐ ์†Œ๋น„์ž๊ฐ€ ๋‹ค๋ฅด๋‹ค.


โถ ์–ธ์–ด๋กœ ์ƒํƒœ๋ฅผ ํ‰๊ฐ€ํ•œ๋‹ค (Sec. 4)

ํ•ต์‹ฌ ์งˆ๋ฌธ: ์–ธ์–ด๋ฅผ ์–ด๋–ป๊ฒŒ โ€œํƒœ์Šคํฌ ์ง„ํ–‰๋„โ€์˜ ์ •๋Ÿ‰ ํ•จ์ˆ˜๋กœ ๋ฐ”๊ฟ€ ๊ฒƒ์ธ๊ฐ€.


Sec. 4์˜ taxonomy(Fig. 5) โ€” Reward Functions(4.1: Reward Design / Reward Learning / FM-driven Learning)์™€ Cost Functions(4.2: Specific Text2value Mapping / FM-driven Cost Mapping). ๊ทธ๋ฆผ ํ•˜๋‹จ์— ์ฝ”์–ด ์•„์ด๋””์–ด๊ฐ€ ๋ช…์‹œ๋ผ ์žˆ๋‹ค: โ€œLanguage to quantify task progress.โ€

4.1 ๋ณด์ƒ: ์ˆ˜์ž‘์—… ์„ค๊ณ„ โ†’ ๋ฐ์ดํ„ฐ ํ•™์Šต โ†’ ํŒŒ์šด๋ฐ์ด์…˜ ๋ชจ๋ธ ์ƒ์„ฑ

์ด ์ ˆ์˜ ์„œ์‚ฌ๋Š” โ€œ๋ณด์ƒ ์„ค๊ณ„ ๋…ธ๋™์„ ๋ˆ„๊ฐ€ ๋Œ€์‹ ํ•˜๋Š”๊ฐ€โ€์˜ 3์„ธ๋Œ€ ๊ต์ฒด๋‹ค.

  • 1์„ธ๋Œ€ โ€” ์–ธ์–ดโ†’๋ณด์ƒ ์‹ ํ˜ธ ์„ค๊ณ„. ZSRM(Mahmoudieh et al. 2022)์€ ์นด๋ฉ”๋ผ ์ด๋ฏธ์ง€์™€ ๋ชฉํ‘œ ํ…์ŠคํŠธ๋ฅผ CLIP ์ธ์ฝ”๋”๋กœ ์ธ์ฝ”๋”ฉํ•ด ์œ ์‚ฌ๋„๋ฅผ ๋ณด์ƒ์œผ๋กœ ์“ด๋‹ค. ์ถ”๊ฐ€ ํ•™์Šต ์—†์ด ์ƒˆ ๋ชฉํ‘œ๋ฅผ ์ง€์ •ํ•  ์ˆ˜ ์žˆ์ง€๋งŒ, CLIP์˜ ๊ณต๊ฐ„ ์ถ”๋ก  ๋Šฅ๋ ฅ์ด ์ƒํ•œ์ด ๋œ๋‹ค. ๋ฐ€์ง‘ ๋ณด์ƒ ์ชฝ์—์„œ๋Š” PixL2R(Goyal et al. 2021)์ด (์–ธ์–ด, ๊ถค์ ) ์Œ์—์„œ relatedness ๋ชจ๋ธ์„ ํ•™์Šตํ•ด ๋งค ์Šคํ… shaping ๋ณด์ƒ์„ ๋งŒ๋“ ๋‹ค โ€” ํ•™์Šต ํšจ์œจ์€ ํฌ๊ฒŒ ์˜ค๋ฅด์ง€๋งŒ ์ ˆ๋Œ€ ์ ์ˆ˜๋ฅผ ์ •๋‹ต์œผ๋กœ ์‚ผ๋Š” ํšŒ๊ท€/๋ถ„๋ฅ˜ ๋ชฉ์ ์ด๋ผ ํƒœ์Šคํฌ ์ง„ํ–‰์„ ์˜จ์ „ํžˆ ๋‹ด์ง€ ๋ชปํ•œ๋‹ค.
  • 2์„ธ๋Œ€ โ€” ๋ณด์ƒ ํ•จ์ˆ˜ ํ•™์Šต. LOREL(Nair et al. 2022)์€ ์ดˆ๊ธฐ ์ƒํƒœ s_0, ํ˜„์žฌ ์ƒํƒœ s, ์ง€์‹œ l์„ ๋ฐ›์•„ โ€œ์ด ๊ถค์ ์ด ์ง€์‹œ๋ฅผ ๋งŒ์กฑํ•˜๋Š”๊ฐ€โ€๋ฅผ ํŒ๋ณ„ํ•˜๋Š” ์ด์ง„ ๋ถ„๋ฅ˜๊ธฐ R(s_0, s, l)์„ ์˜คํ”„๋ผ์ธ ์‹œ์—ฐ์œผ๋กœ ํ•™์Šตํ•œ๋‹ค. IRL ๊ณ„์—ด(Fu et al. 2019; MacGlashan et al. 2015)์€ ์‹œ์—ฐ์—์„œ ๋ณด์ƒ ๊ตฌ์กฐ๋ฅผ ์—ญ์ถ”๋ก ํ•œ๋‹ค. ์„œ๋ฒ ์ด๊ฐ€ ์งš๋Š” ํ•œ๊ณ„๊ฐ€ ๊ตฌ์ฒด์ ์ด๋‹ค โ€” โ€œsort out the kitchen table and wiping a stainโ€ ๊ฐ™์€ ๋ณตํ•ฉ ํƒœ์Šคํฌ์—์„œ๋Š” ์ „๋ฌธ๊ฐ€ ์‹œ์—ฐ์˜ ๊ถค์  ๋ถ„ํฌ ์ž์ฒด๊ฐ€ ํฌ๊ฒŒ ๊ฐˆ๋ผ์ ธ์„œ ์ง„์งœ ๋ชฉํ‘œ์™€ ํ—ˆ์œ„ ์ƒ๊ด€์„ ๊ตฌ๋ถ„ํ•  ๋ณด์ƒ์„ ๋ฐฐ์šฐ๊ธฐ ์–ด๋ ต๋‹ค.
  • 3์„ธ๋Œ€ โ€” FM์ด ๋ณด์ƒ์„ ๋งŒ๋“ ๋‹ค. Kwon et al. (2023)์€ GPT-3์„ ํ”„๋ก์‹œ ๋ณด์ƒ์œผ๋กœ ๊ทธ๋Œ€๋กœ ์“ด๋‹ค(๊ถค์  ์š”์•ฝ์„ ๋„ฃ๊ณ  โ€œ๋ชฉํ‘œ๋ฅผ ๋งŒ์กฑํ–ˆ๋Š”๊ฐ€โ€๋ฅผ ๋ฌป๋Š”๋‹ค). Language2Reward(Yu et al. 2023c)์™€ Text2Reward(Xie et al. 2024)๋Š” LLM์—๊ฒŒ ์‹คํ–‰ ๊ฐ€๋Šฅํ•œ Pythonic ๋ณด์ƒ ์ฝ”๋“œ๋ฅผ ์“ฐ๊ฒŒ ํ•œ๋‹ค. EUREKA(Ma et al. 2024)๋Š” RL ์„ฑ๋Šฅ์„ fitness๋กœ ์‚ผ์•„ ๋ณด์ƒ ํ”„๋กœ๊ทธ๋žจ ์ง‘๋‹จ์„ ์ง„ํ™”์ ์œผ๋กœ ๊ฐœ์„ ํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ ์„œ๋ฒ ์ด๊ฐ€ ์ž˜ ์žก์•„๋‚ธ ์ง€์ : ์ฝ”๋“œ ์ƒ์„ฑ์€ ๋ฌธ์ œ๋ฅผ ์˜ฎ๊ฒผ์„ ๋ฟ ์—†์• ์ง€ ์•Š์•˜๋‹ค. ์ƒ์„ฑ๋œ ๋ณด์ƒ ์ฝ”๋“œ๋Š” Reward = 0.8ร—grasp_success โˆ’ 0.2ร—dist_to_cube ์ฒ˜๋Ÿผ ์ •์ ์ธ ์ˆ˜์น˜ ๊ฐ€์ค‘์น˜๋ฅผ ๊ฐ–๊ณ , ์ดˆ์•ˆ์ด ์ทจ์•ฝํ•œ ํ”ผ์ฒ˜๋ฅผ ๊ณ ๋ฅด๋ฉด RL์ด ์•„์˜ˆ ํ•™์Šตํ•˜์ง€ ๋ชปํ•œ๋‹ค. ๊ทธ๋ž˜์„œ ๋‹ค์Œ ์„ธ๋Œ€๊ฐ€ ๋‚˜์˜จ๋‹ค โ€” Reward-Self-Align(Zeng et al. 2024)์€ LLM์ด ํ”ผ์ฒ˜ ํ…œํ”Œ๋ฆฟ์„ ์“ฐ๊ฒŒ ํ•˜๊ณ  ์‹ค์ œ ๋กค์•„์›ƒ์˜ ์Œ๋Œ€ ๋žญํ‚น์œผ๋กœ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ์ •๋ ฌํ•˜๋ฉฐ, R*(Li et al. 2025a)๋Š” ๊ตฌ์กฐ ์ง„ํ™”์™€ ๊ฐ€์ค‘์น˜ ์ •๋ ฌ์„ ๋ถ„๋ฆฌํ•ด ํฌ๋ฆฌํ‹ฑ์ด ๋ณด์ƒ ๊ฐ€์ค‘์น˜๋ฅผ ์‚ฌ๋žŒ ์„ ํ˜ธ์— ๋งž์ถ˜๋‹ค.

๋˜ ํ•˜๋‚˜์˜ ์ถ•์€ ํŠน๊ถŒ ์ •๋ณด ์˜์กด์ด๋‹ค. LLM ์ฝ”๋“œ ๊ณ„์—ด์€ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ์ƒํƒœ์— ์ ‘๊ทผํ•ด์•ผ ํ•œ๋‹ค. ์ด๊ฑธ ๋ฒ—์–ด๋‚˜๋ ค๋Š” ๊ฒƒ์ด VLM ๊ธฐ๋ฐ˜ ๋ณด์ƒ์ด๋‹ค โ€” Video-Language Critic(Alakuijala et al. 2025)์€ Open X-Embodiment ์˜์ƒ์œผ๋กœ ์‹œ๊ฐ„ ๋Œ€์กฐ VLM์„ ๋žญํ‚น ์†์‹ค๋กœ ํ•™์Šตํ•ด ํ”ฝ์…€-์ง€์‹œ ์Œ๋งŒ์œผ๋กœ ๋ฐ€์ง‘ยท๋‹จ์กฐ ์ฆ๊ฐ€ ๋ณด์ƒ์„ ๋งŒ๋“ค๊ณ , ReWiND(Zhang et al. 2025b)๋Š” ์†Œ์ˆ˜์˜ ์–ธ์–ด ์ฃผ์„ ์‹œ์—ฐ + โ€œvideo-rewindโ€๋กœ ๋งŒ๋“  ์‹คํŒจ ์˜ˆ์‹œ๋กœ ์ง„ํ–‰๋„ ์˜ˆ์ธก ๋ณด์ƒ์„ ํ•™์Šตํ•œ๋‹ค. ReWiND์˜ ์„ฑ๊ณต๋ฅ ์€ Meta-World ์‹œ๋ฎฌ๋ ˆ์ด์…˜์—์„œ ๋ฒ ์ด์Šค๋ผ์ธ ๋Œ€๋น„ 2ร—, ์‹ค์ œ ์–‘ํŒ” ์…‹์—…์—์„œ 5ร— ๋ผ๋Š” ๊ฒƒ์ด ์„œ๋ฒ ์ด๊ฐ€ ์ธ์šฉํ•˜๋Š” ์ˆ˜์น˜๋‹ค.

4.2 ๋น„์šฉ: ๋ชจ์…˜ ํ”Œ๋ž˜๋„ˆ๋ฅผ ์œ„ํ•œ ์–ธ์–ดโ†’๋น„์šฉ ์ง€๋„

๊ฐ™์€ โ€œ์–ธ์–ดโ†’์ˆซ์žโ€์ด์ง€๋งŒ ์†Œ๋น„์ž๊ฐ€ ์ตœ์ ํ™” ๊ธฐ๋ฐ˜ ํ”Œ๋ž˜๋„ˆ์ผ ๋•Œ๋Š” ์ด์•ผ๊ธฐ๊ฐ€ ๋‹ค๋ฅด๋‹ค. ์ดˆ๊ธฐ์—๋Š” Park et al. (2019)์ด CRF๋กœ ๋ช…์‚ฌ๊ตฌยท๋ถ€์‚ฌ(โ€œuprightโ€, โ€œslowlyโ€)๋ฅผ ๊ถค์  ์ตœ์ ํ™”๊ธฐ์˜ ์—ฐ์† ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ ๋งคํ•‘ํ–ˆ๊ณ , Sharma et al. (2022)์€ โ€œstay away from the yellow bottleโ€ ๊ฐ™์€ ๊ตฌ์–ด ์ •์ •์„ ์ž”์ฐจ ๋น„์šฉ ํ•จ์ˆ˜๋กœ ํ•™์Šตํ–ˆ๋‹ค(๋‹จ 2D ๋น„์šฉ ์ง€๋„์— ํ•œ์ •).

3D๋กœ ๋„˜์–ด๊ฐ€๋Š” ๋ถ„๊ธฐ์ ์ด VoxPoser(Huang et al. 2023b)๋‹ค. GPT-4๊ฐ€ OWL-ViT๋ฅผ ์งˆ์˜ํ•˜๋Š” Python ์ฝ”๋“œ๋ฅผ ์“ฐ๊ณ , ๊ทธ ๊ฒฐ๊ณผ๋กœ ๋ฐ€์ง‘ 3D value map์„ ํ•ฉ์„ฑํ•ด ํ‘œ์ค€ ๋ชจ์…˜ ํ”Œ๋ž˜๋„ˆ๊ฐ€ ๊ทธ๋Œ€๋กœ ๊ถค์ ์„ ๋ฝ‘๋Š”๋‹ค. ํ”Œ๋ž˜๋„ˆ ์žฌํ•™์Šต์ด ํ•„์š” ์—†๋‹ค๋Š” ๊ฒƒ์ด ๊ฐ•์ ์ด๊ณ , ์ธ์‹ ๋ชจ๋“ˆ(OWL-ViT/SAM/XMEM)์ด ํ‹€๋ฆฌ๋ฉด ๋น„์šฉ ์ง€๋„๊ฐ€ ํ†ต์งธ๋กœ ํ‹€๋ฆฐ๋‹ค๋Š” ๊ฒƒ์ด ์•ฝ์ ์ด๋‹ค. ReKep(Huang et al. 2025b)์€ value map ๋Œ€์‹  DINOv2 ํ‚คํฌ์ธํŠธ ์œ„์˜ ๊ธฐํ˜ธ์  ์ œ์•ฝ ์ฝ”๋“œ๋ฅผ VLM์—๊ฒŒ ์“ฐ๊ฒŒ ํ•ด, ์–ด๋ ค์šด ๊ธฐํ•˜ ๊ณ„์‚ฐ์€ ์ˆ˜์น˜ ์†”๋ฒ„์— ๋„˜๊ธฐ๊ณ  VLM์€ 3D ์  ๊ด€๊ณ„๋งŒ ์ถ”๋ก ํ•˜๊ฒŒ ํ•œ๋‹ค. IMPACT(Ling et al. 2025)๋Š” ๋‹ค์ค‘๋ทฐ RGBD๋ฅผ GPT-4o์— ๋„ฃ์–ด ๋ฌผ์ฒด๋ณ„ โ€œcontact toleranceโ€๋ฅผ 0โ€“10 ์ฒ™๋„๋กœ ๋งค๊ธฐ๊ณ  ์ด๋ฅผ 3D ๋น„์šฉ ์ง€๋„๋กœ ๋ฐ”๊ฟ” RRT*์— ๋„ฃ๋Š”๋‹ค โ€” ๋ช…์‹œ์  ์ง€์‹œ ์—†์ด๋„ ๋ถ€๋“œ๋Ÿฌ์šด ๋ฌผ์ฒด์—” ์ ‘์ด‰์„ ํ—ˆ์šฉํ•˜๊ณ  ๊นจ์ง€๊ธฐ ์‰ฌ์šด ๊ฒƒ์€ ํ”ผํ•˜๊ฒŒ ๋งŒ๋“œ๋Š”, ๊ฝค ์‹ค์šฉ์ ์ธ ์•„์ด๋””์–ด๋‹ค(๋Œ€์‹  ์ •์  ์žฅ๋ฉด๊ณผ ์™„๋ฒฝํ•œ ๋ถ„ํ• ์„ ๊ฐ€์ •ํ•œ๋‹ค).

๊ด€๋ จ: ์ด ๊ณ„์—ด์˜ ์ตœ์‹  ํ๋ฆ„(VLM์ด ๋งŒ๋“  ๋น„์šฉ/์ œ์•ฝ์„ ๋””์ง€ํ„ธ ํŠธ์œˆ ์œ„ MPC์— ๋„ฃ๊ธฐ)์€ PWTF ๋ฆฌ๋ทฐ์—์„œ, LLM ๊ธฐ๋ฐ˜ ๋ณด์ƒ ์ฝ”๋“œ ์ƒ์„ฑ์˜ ์›์กฐ ๊ฒฉ์€ Eureka ๋ฆฌ๋ทฐ์—์„œ, ๋ณด์ƒ ์„ค๊ณ„ยทshaping ์ผ๋ฐ˜๋ก ์€ Reward Engineering ๋ฆฌ๋ทฐ์—์„œ ๋” ๊นŠ๊ฒŒ ๋ณผ ์ˆ˜ ์žˆ๋‹ค.

Table 2 โ€” Sec. 4 ๋Œ€ํ‘œ๊ธฐ๋ฒ• (์›๋ฌธ ํ‘œ ์žฌํ˜„)

Method Signal Category ํ•ต์‹ฌ ๋ฉ”์ปค๋‹ˆ์ฆ˜ ์žฅ์  ๋‹จ์ 
ZSRM (Mahmoudieh et al. 2022) Sparse Reward Design CLIP์œผ๋กœ ์นด๋ฉ”๋ผ ์ด๋ฏธ์ง€์™€ ๋ชฉํ‘œ ํ…์ŠคํŠธ์˜ ์œ ์‚ฌ๋„๋ฅผ ๋ณด์ƒ์œผ๋กœ ์ถ”๊ฐ€ ๋ณด์ƒ๋ชจ๋ธ ํ•™์Šต ์—†์ด ์ผ๋ถ€ ์ƒˆ ๋ชฉํ‘œ ์ง€์ • ๊ฐ€๋Šฅ CLIP์˜ ๊ณต๊ฐ„ ์ถ”๋ก  ๋Šฅ๋ ฅ์ด ๊ทผ๋ณธ ์ƒํ•œ
PixL2R (Goyal et al. 2021) Dense Reward Design (์–ธ์–ด, ๊ถค์ ) ์Œ์—์„œ relatedness ๋ชจ๋ธ ํ•™์Šต โ†’ ๋ฐ€์ง‘ shaping ๋ณด์ƒ ์—ฐ์† ๊ฐ€์ด๋“œ๋กœ ์ •์ฑ… ํ•™์Šต ํšจ์œจ ํฌ๊ฒŒ ๊ฐœ์„  ์ ˆ๋Œ€ ์ ์ˆ˜๋ฅผ ์ •๋‹ต์œผ๋กœ ์˜์กด, ๋‹ค์–‘ํ•œ ์–ธ์–ด ๋ฐ์ดํ„ฐ์…‹ ํ•„์š”
LOREL (Nair et al. 2022) Reward Learning ์˜คํ”„๋ผ์ธ ์ „๋ฌธ๊ฐ€ ์‹œ์—ฐ์œผ๋กœ ์ด์ง„ ๋ถ„๋ฅ˜๊ธฐ ํ•™์Šต ์‹œ๊ฐ ๊ด€์ธก+์ง€์‹œ โ†’ ๋ณด์ƒ ์‹ ํ˜ธ ๋ณ€ํ™˜์„ ์ž๋™ํ™” ์„ธ๋ฐ€ํ•œ ํ–‰๋™/๋‹ค๋ฌผ์ฒด๊ฐ€ ์–ฝํžŒ ๋ณต์žก ์กฐ์ž‘์—์„œ ์ทจ์•ฝ
Text2Reward (Xie et al. 2024) FM-driven Reward Generation LLM์ด ์ž์—ฐ์–ด ๋ชฉํ‘œ์—์„œ ๋ฐ€์ง‘ Pythonic ๋ณด์ƒ ํ•จ์ˆ˜๋ฅผ ์ง์ ‘ ์ž‘์„ฑ ์ž์œจ์  ๋ณด์ƒ ์ƒ์„ฑ, ์‹œ๋ฎฌ ํƒœ์Šคํฌ์—์„œ ์ „๋ฌธ๊ฐ€ ๋ณด์ƒ์— ํ•„์  ์ƒ์„ฑ ์ฝ”๋“œ์˜ ์ •ํ™•์„ฑ์— ํฌ๊ฒŒ ์˜์กด, ํŠน๊ถŒ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ์ƒํƒœ ํ•„์š”
ReWiND (Zhang et al. 2025b) VLM-driven Reward Learning ์–ธ์–ด ์ฃผ์„ ์‹œ์—ฐ + ์ƒ์„ฑ๋œ ์‹คํŒจ์—์„œ ์ง„ํ–‰๋„ ์˜ˆ์ธก ๋ณด์ƒ ํ•™์Šต ์‹œ๋ฎฌยท์‹ค์ œ ์–‘ํŒ” ์…‹์—… ๋ชจ๋‘์—์„œ ์„ฑ๊ณต๋ฅ  ์œ ์˜๋ฏธ ๊ฐœ์„  ์ผ๋ฐ˜ ๋ณด์ƒ์„ ๋ฐฐ์šฐ๋ ค๋ฉด ์†Œ์ˆ˜์˜ ์‹œ์—ฐ์ด ์—ฌ์ „ํžˆ ํ•„์š”

โท ์–ธ์–ด๋ฅผ ์ •์ฑ…์˜ ์กฐ๊ฑด์œผ๋กœ (Sec. 5)

ํ•ต์‹ฌ ์งˆ๋ฌธ: ์–ธ์–ด๊ฐ€ ์–ด๋–ป๊ฒŒ ์ •์ฑ…์„ ์กฐ๊ฑดํ™”ํ•ด ์˜ฌ๋ฐ”๋ฅธ ํ–‰๋™์„ ๋‚ด๊ฒŒ ํ•˜๋Š”๊ฐ€. ์–ธ์–ด์˜ ์ง€์œ„๊ฐ€ goal specifier โ†’ behavior specifier๋กœ ๋ฐ”๋€๋‹ค.


Sec. 5์˜ taxonomy(Fig. 6) โ€” RL(5.1) โ†’ BC(5.2) โ†’ Diffusion-based Policy(5.3). ์„ธ ๊ณ„์—ด์„ ์ž‡๋Š” ํ™”์‚ดํ‘œ์— โ€œaddresses limitations ofโ€๋ผ๊ณ  ์ ํ˜€ ์žˆ๊ณ , ๊ฐ ํ™”์‚ดํ‘œ ์˜†์— ๊ทน๋ณต ๋Œ€์ƒ์ด ๋ช…์‹œ๋œ๋‹ค(RL์˜ ๋ณด์ƒ ์—”์ง€๋‹ˆ์–ด๋งยท๋น„ํšจ์œจยท์•ฝํ•œ ๊ทธ๋ผ์šด๋”ฉ โ†’ BC์˜ ์ค€์ตœ์  ํ–‰๋™ ๋ชจ์‚ฌ โ†’ DP์˜ ์ถ”๋ก  ์ง€์—ฐ). ์บก์…˜์€ ์ด๊ฒƒ์ด โ€œ์—„๊ฒฉํ•œ ๊ณ„์ธต์ด๋‚˜ ์™„์ „ํ•œ ๋Œ€์ฒด๊ฐ€ ์•„๋‹ˆ๋‹คโ€๋ผ๊ณ  ๋ชป ๋ฐ•๋Š”๋‹ค. (์›๋ฌธ ๊ทธ๋ฆผ ๋ผ๋ฒจ์˜ โ€œDiffuisonโ€ ํ‘œ๊ธฐ๋Š” ์˜คํƒ€)

์ด ๊ทธ๋ฆผ์˜ ํ™”์‚ดํ‘œ๋Š” ์ด ์„œ๋ฒ ์ด์—์„œ ๊ฐ€์žฅ ์ •์งํ•œ ์žฅ์น˜๋‹ค. ๋ณดํ†ต ์„œ๋ฒ ์ด์˜ ๊ณ„๋ณด๋„๋Š” ์•”๋ฌต์ ์œผ๋กœ โ€œ๋’ค์— ๋‚˜์˜จ ๊ฒƒ์ด ๋‚ซ๋‹คโ€๋ฅผ ์‹œ์‚ฌํ•˜๋Š”๋ฐ, ์—ฌ๊ธฐ์„œ๋Š” โ€œ์•ž ๊ณ„์—ด์˜ ์‹ค์šฉ์  ํ•œ๊ณ„๋ฅผ ์™„ํ™”ํ•œ๋‹คโ€๋Š” ๊ด€๊ณ„๋กœ๋งŒ ์ •์˜ํ•˜๊ณ  ์บก์…˜์—์„œ ๊ทธ ์ ์„ ๋ช…์‹œํ•œ๋‹ค.

5.1 RL ์•ˆ์˜ ์–ธ์–ด

์ดˆ๊ธฐ ์–ธ์–ด ์กฐ๊ฑด RL์€ ์‚ฌ์‹ค ๊ฒŒ์ž„ ๋„๋ฉ”์ธ์ด์—ˆ๋‹ค(๊ทœ์น™์ด ๋ช…ํ™•ํ•˜๊ณ  ์žฌํ˜„์ด ์‰ฌ์›Œ์„œ). ์กฐ์ž‘์œผ๋กœ ๋„˜์–ด์˜ค๋ฉด์„œ ์ฒซ ํ•ด๋ฒ•์€ ๋ถ„๋ฆฌ(decoupling) ์˜€๋‹ค โ€” LCGG(Colas et al. 2020)๋Š” ์–ธ์–ด๋กœ goal generator๋ฅผ ์กฐ๊ฑดํ™”ํ•˜๊ณ  ๊ทธ ๋ชฉํ‘œ๋ฅผ ์‚ฌ์ „ํ•™์Šต๋œ goal-conditioned ์ •์ฑ…์— ๋„˜๊ธด๋‹ค. ์–ด๋–ค RL ์ปจํŠธ๋กค๋Ÿฌ๋“  ๊ฝ‚์„ ์ˆ˜ ์žˆ์–ด ๋ชจ๋“ˆ์ ์ด์ง€๋งŒ, ์–ธ์–ด๊ฐ€ ์ •์ฑ…๋ง์— ์ง์ ‘ ๋‹ฟ์ง€ ์•Š์•„์„œ ์ €์ˆ˜์ค€ ํ–‰๋™์„ ์–ธ์–ด ์˜๋„์— ๋งž๊ฒŒ ์กฐ์ •ํ•  ์ˆ˜ ์—†๊ณ  ์ƒ‰๊น”๋งŒ ๋ฐ”๋€Œ๋Š” pick-and-place์— ๋จธ๋ฌธ๋‹ค.

๊ทธ๋ž˜์„œ ์–ธ์–ด๋ฅผ ๋ฃจํ”„ ์•ˆ์œผ๋กœ ๋ฐ€์–ด ๋„ฃ๋Š” ํ๋ฆ„์ด ์ด์–ด์ง„๋‹ค. LanCon-Learn(Silva et al. 2021)์€ ์–ธ์–ด ์ž„๋ฒ ๋”ฉ์„ attention router์— ๋„ฃ์–ด ๊ณต์œ  actor-critic ์•ˆ์˜ ์—ฌ๋Ÿฌ ์Šคํ‚ฌ ๋ชจ๋“ˆ์„ ๋งค ์Šคํ… ์žฌ๊ฐ€์ค‘ํ•œ๋‹ค โ€” ํ‘œํ˜„๋ ฅ์€ ์–ป์ง€๋งŒ ๋ผ์šฐํ„ฐ์™€ ์ œ์–ด ์ •์ฑ…์„ ๋™์‹œ์— ๋ฐฐ์šฐ๋Š” ๊ฒƒ์ด ๋ถˆ์•ˆ์ •ํ•˜๊ณ  ์ƒ˜ํ”Œ์„ ๋งŽ์ด ๋จน๋Š”๋‹ค. MILLION(Bing et al. 2023a)์€ Gated Transformer-XL ๊ธฐ๋ฐ˜ ๋ฉ”๋ชจ๋ฆฌ ๋ฉ”ํƒ€๋Ÿฌ๋‹์œผ๋กœ โ€œ์ฝ๊ธฐ ๋‹จ๊ณ„โ€์™€ โ€œํ–‰๋™ ๋‹จ๊ณ„โ€๋ฅผ ๋ถ„๋ฆฌํ•ด ์ ์‘์„ ๊ฐ€์†ํ•˜๊ณ , Yao et al. (2023)์€ ์ง€์‹œ๊ฐ€ โ€œopen left drawerโ€ / โ€œopen right drawerโ€ ์ฒ˜๋Ÿผ ๋Œ€์นญ ์Œ์œผ๋กœ ์˜ค๋Š” ์„ฑ์งˆ์„ ์ด์šฉํ•ด ๋ฐ˜์˜์–ด ๊ทœ์น™์œผ๋กœ ์ง€์‹œ๋ฅผ ์ž๋™ ์ƒ์„ฑยท๊ณต๋™ํ•™์Šตํ•œ๋‹ค(๋‹ค๋งŒ ์ˆ˜์ž‘์—… ๋Œ€์นญ ๊ทœ์น™์ด ํ•ญ์ƒ ํ†ตํ•˜์ง„ ์•Š๋Š”๋‹ค).

๋˜ ๋‹ค๋ฅธ ๊ฐˆ๋ž˜๋Š” ์ž์œ ํ˜• ์–ธ์–ด๋ฅผ ๊ตฌ์กฐํ™”๋œ ํ‘œํ˜„์œผ๋กœ ์••์ถ•ํ•˜๋Š” ๊ฒƒ์ด๋‹ค. TALAR(Pang et al. 2023)๋Š” VAE ๊ธฐ๋ฐ˜ ๋ฒˆ์—ญ๊ธฐ๋กœ ์ž์œ ํ˜• ํ…์ŠคํŠธ๋ฅผ ์ด์‚ฐ Task-Language ์ˆ ์–ด ์ง‘ํ•ฉ์œผ๋กœ ๋ฐ”๊พธ๊ณ  RL ์ •์ฑ…์€ ๊ทธ ์œ„์—์„œ๋งŒ ํ•™์Šตํ•œ๋‹ค. LOVM(Ye et al. 2024)์€ FiLM์œผ๋กœ ์ด๋ฏธ์ง€ ํ”ผ์ฒ˜๋ฅผ ์ง€์‹œ์— ๋”ฐ๋ผ ๋ณ€์กฐํ•ด ๋‹ค์šด์ŠคํŠธ๋ฆผ DQN์˜ ๋ฌผ์ฒด ๋งˆ์Šคํฌ๋ฅผ ์˜ˆ์ธกํ•œ๋‹ค(ํ”ฝ์…€ ์ˆ˜์ค€ ๋งˆ์Šคํฌ ๊ฐ๋…์ด ํ•„์š”).

์ตœ๊ทผ ํ๋ฆ„์€ ๋Œ€๊ทœ๋ชจ ์‚ฌ์ „ํ•™์Šต ์ •์ฑ…์„ ๋ฏธ์„ธ์กฐ์ •ํ•˜๋Š” ์ชฝ์ด๋‹ค. FLaRe(Hu et al. 2025a)๋Š” ์‚ฌ์ „ํ•™์Šต๋œ ๋น„์ „-์–ธ์–ด ํŠธ๋žœ์Šคํฌ๋จธ BC ์ •์ฑ…์„ ํฌ์†Œ ์–ธ์–ด ๋ณด์ƒ์œผ๋กœ PPO ๋ฏธ์„ธ์กฐ์ •ํ•ด ๋ฐ€์ง‘ ๋ณด์ƒ ๋ฒ ์ด์Šค๋ผ์ธ ๋Œ€๋น„ 15๋ฐฐ ๋น ๋ฅธ ํ•™์Šต๊ณผ ๋น ๋ฅธ embodiment ์ „์ด๋ฅผ ๋ณด๊ณ ํ•œ๋‹ค โ€” ๋Œ€์‹  ์‚ฌ์ „ํ•™์Šต BC ๋ชจ๋ธ์˜ ๋ฐ์ดํ„ฐ ๋ถ„ํฌ๋ฅผ ๊ทธ๋Œ€๋กœ ์ƒ์†ํ•œ๋‹ค. V-GPS(Nakamoto et al. 2025)๋Š” ์˜คํ”„๋ผ์ธ RL๋กœ ์–ธ์–ด ์กฐ๊ฑด ๊ฐ€์น˜ํ•จ์ˆ˜๋ฅผ ๋ฐฐ์›Œ ๋ฐฐํฌ ์‹œ์ ์— ์ •์ฑ…์˜ ํ–‰๋™์„ ์žฌ๋žญํ‚นํ•œ๋‹ค(์ •์ฑ… ๊ฐ€์ค‘์น˜์— ์†๋Œ€์ง€ ์•Š๋Š”๋‹ค). LIMT(Aljalbout et al. 2025)๋Š” Dreamer ํŒŒ์ดํ”„๋ผ์ธ ์•ˆ์—์„œ ์–ธ์–ด๋กœ ์›”๋“œ๋ชจ๋ธ์˜ latent dynamics๋ฅผ ์กฐ๊ฑดํ™”ํ•ด, ์ƒ์ƒ ์† ๋ฏธ๋ž˜์—๊นŒ์ง€ ์–ธ์–ด ์ •๋ณด๊ฐ€ ๋“ค์–ด๊ฐ€๊ฒŒ ํ•œ๋‹ค.

5.2 BC ์•ˆ์˜ ์–ธ์–ด

BC ์ชฝ ์„œ์‚ฌ๋Š” โ€œ3D ๊ตฌ์กฐ๋ฅผ ์–ด๋–ป๊ฒŒ ์‹ธ๊ฒŒ ์–ป์„ ๊ฒƒ์ธ๊ฐ€โ€ ์™€ โ€œ์–ธ์–ด ์ฃผ์„์„ ์–ด๋–ป๊ฒŒ ์•„๋‚„ ๊ฒƒ์ธ๊ฐ€โ€ ๋‘ ์ถ•์œผ๋กœ ์ฝํžŒ๋‹ค.

  • ๋ฐ์ดํ„ฐ ์ ˆ์•ฝ: MCIL(Lynch and Sermanet 2021)์€ ํƒœ์Šคํฌ IDยท์ด๋ฏธ์ง€ยท์–ธ์–ด๋ฅผ ํ•จ๊ป˜ ํ•™์Šตํ•ด ์‹œ์—ฐ์˜ 1% ๋ฏธ๋งŒ๋งŒ ์–ธ์–ด ์ฃผ์„์ด์–ด๋„ ํ•™์Šต์ด ๋œ๋‹ค๋Š” ๊ฒƒ์„ ๋ณด์˜€๋‹ค. BC-Z(Jang et al. 2022)๋Š” ์ „๋ฌธ๊ฐ€ ์‹œ์—ฐ + ์ €๋ ดํ•œ ๋ถˆ์™„์ „ ๊ฐœ์ž…์„ ์„ž๊ณ , MimicPlay(Wang et al. 2023a)๋Š” ์‚ฌ๋žŒ์ด ๋ฌผ์ฒด์™€ ์ž์œ ๋กญ๊ฒŒ ์ƒํ˜ธ์ž‘์šฉํ•œ ์˜์ƒ์—์„œ ๋ฐฐ์šด๋‹ค.
  • ์•„ํ‚คํ…์ฒ˜: CLIPORT(Shridhar et al. 2022)๊ฐ€ CLIP์˜ ๋„“์€ ์˜๋ฏธ ์ดํ•ด + Transporter์˜ ๊ณต๊ฐ„ ์ •๋ฐ€๋„๋ฅผ ๊ฒฐํ•ฉํ•œ ์ดํ›„, HiveFormer(Guhur et al. 2023)๋Š” ๊ณผ๊ฑฐ ์‹œ๊ฐ-๊ณ ์œ ์ˆ˜์šฉ ํ† ํฐ์„ ๋ชจ๋‘ ์ด์–ด๋ถ™์—ฌ ๋ถ€๋ถ„๊ด€์ธก์„ฑ์„ ๋‹ค๋ฃจ๊ณ  74๊ฐœ RLBench ํƒœ์Šคํฌ์—์„œ ์žฅ๊ธฐ ์„ฑ๊ณต๋ฅ ์„ ์˜ฌ๋ ธ๋‹ค. PerAct(Shridhar et al. 2023)๋Š” ๋ฌธ์ œ๋ฅผ โ€œdetecting the next best voxel actionโ€ ์œผ๋กœ ์žฌ์ •์˜ํ•ด RGB-D์™€ 6-DoF ํ–‰๋™ ๊ณต๊ฐ„์„ ๋ชจ๋‘ ๋ณต์…€ํ™”ํ•œ๋‹ค โ€” ๊ฐ•ํ•œ 3D ๊ท€๋‚ฉ ํŽธํ–ฅ์„ ์–ป๋Š” ๋Œ€์‹  ๊ณ ํ•ด์ƒ๋„ ๊ฒฉ์ž์˜ ์—ฐ์‚ฐ ๋น„์šฉ์„ ์น˜๋ฅธ๋‹ค.
  • ๋ณต์…€ ๋น„์šฉ ์ค„์ด๊ธฐ: Act3D(Gervet et al. 2023)๋Š” 3D feature field์— coarse-to-fine attention์„, GNFactor(Ze et al. 2023)๋Š” ์‚ฌ์ „ํ•™์Šต 2D VLM ํ”ผ์ฒ˜๋ฅผ 3D ํ•„๋“œ์— ์ฆ๋ฅ˜ํ•ด ์˜๋ฏธ๋ฅผ ์ฃผ์ž…ํ•œ๋‹ค(100 ์‹œ์—ฐ์œผ๋กœ ์–ธ์–ด ์กฐ๊ฑด ์‹ค์ œ ์ฃผ๋ฐฉ ํƒœ์Šคํฌ ์ „์ด). RVT(Goyal et al. 2023)๋Š” ์•„์˜ˆ ๋ณต์…€์„ ๋ฒ„๋ฆฌ๊ณ  8โ€“16๊ฐœ ๊ฐ€์ƒ ์นด๋ฉ”๋ผ๋กœ ํฌ์ธํŠธํด๋ผ์šฐ๋“œ๋ฅผ ์žฌ๋ Œ๋”๋งํ•ด ๋ฉ€ํ‹ฐ๋ทฐ ViT๋ฅผ ์“ด๋‹ค โ€” PerAct ๋Œ€๋น„ 36๋ฐฐ ๋น ๋ฅธ ํ•™์Šต์— ๋™๋“ฑ ์„ฑ๋Šฅ. ฮฃ-agent(Ma et al. 2025)๋Š” ์—ฌ๊ธฐ์— ๋Œ€์กฐ IL ์†์‹ค์„ ๋”ํ•œ๋‹ค.
  • ์žฅ๊ธฐ ํƒœ์Šคํฌ: HULC(Mees et al. 2022a) โ†’ HULC++(Mees et al. 2023, ์‹œ๊ฐ affordance + LLM ๊ณ„ํš) โ†’ SPIL(Zhou et al. 2024a, ์‚ฌ์ „ํ•™์Šต ์Šคํ‚ฌ prior). ๋‹ค๋ฅธ ๋ฐฉํ–ฅ์œผ๋กœ ACT(Zhao et al. 2023a)์˜ action chunking๊ณผ ์‹œ๊ฐ„์  ์•™์ƒ๋ธ”, MT-ACT(Bharadhwaj et al. 2024)์˜ ๋ฉ€ํ‹ฐํƒœ์Šคํฌ ํ™•์žฅ, ์ˆ˜์ˆ  ๋„๋ฉ”์ธ์˜ SRT-H(Kim et al. 2025a, ๊ณ ์ˆ˜์ค€ ํŠธ๋žœ์Šคํฌ๋จธ๊ฐ€ ์–ธ์–ด ์ง€์‹œ๋ฅผ ์ƒ์„ฑํ•ด ์ €์ˆ˜์ค€ ์ •์ฑ…์„ ์œ ๋„).

BC ๊ณ„์—ด์˜ ๊ณ ์œ  ๋ณ‘๋ชฉ์œผ๋กœ ์„œ๋ฒ ์ด๊ฐ€ ๋ฐ˜๋ณตํ•ด ์งš๋Š” ๊ฒƒ์€ compounding error๋‹ค. ์ด๊ฒƒ์ด ๋‹ค์Œ ์ ˆ์˜ ๋™๊ธฐ๊ฐ€ ๋œ๋‹ค.

5.3 ํ™•์‚ฐ ์ •์ฑ… ์•ˆ์˜ ์–ธ์–ด

ํšŒ๊ท€ ๊ธฐ๋ฐ˜ BC๋Š” ๋‹ค์ค‘๋ชจ๋“œ ํ–‰๋™ ๋ถ„ํฌ๋ฅผ ํ‰๊ท  ๋‚ด๋ฒ„๋ ค โ€œ๋ณด์ˆ˜์ ์ด๊ฑฐ๋‚˜ ์•„์˜ˆ ์œ ํšจํ•˜์ง€ ์•Š์€โ€ ํ–‰๋™์„ ๋‚ธ๋‹ค. ํ™•์‚ฐ ์ •์ฑ…์ด ์ด๋ฅผ ํ‘ผ๋‹ค. ์–ธ์–ด๊ฐ€ ๋“ค์–ด๊ฐ€๋Š” ๋ฐฉ์‹์€ ๋„ค ๊ฐ€์ง€๋กœ ์ •๋ฆฌ๋œ๋‹ค.

  1. ๋‹จ์ผ ์Šคํ… ๋ชฉํ‘œ ์ƒ˜ํ”Œ๋ง โ€” StructDiffusion(Liu et al. 2023c)์€ โ€œSet the table in the center left, relative to youโ€ ๋ฅผ ๊ณ ์ˆ˜์ค€ ์ œ์•ฝ์œผ๋กœ ์‚ผ์•„ ๋ฌผ์ฒด ์ค‘์‹ฌ ํ™•์‚ฐ ๋ชจ๋ธ์ด ๋ฌผ๋ฆฌ์ ์œผ๋กœ ํƒ€๋‹นํ•˜๊ณ  ์ถฉ๋Œ ์—†๋Š” ๋ชฉํ‘œ ์ž์„ธ๋ฅผ ๋‹ค๋ฌผ์ฒด์— ๋Œ€ํ•ด ์ƒ˜ํ”Œ๋งํ•œ๋‹ค. ์ดํ›„ ์ €์ˆ˜์ค€ ์ •์ฑ…์˜ ๋Šฅ๋ ฅ์ด ์ƒํ•œ์ด ๋œ๋‹ค.
  2. ์ž๊ธฐ์ง€๋„ ๋ฐ์ดํ„ฐ ํ๋ ˆ์ด์…˜ โ€” Scaling&Distilling(Ha et al. 2023)์€ LLM์ด ์„œ๋ธŒํƒœ์Šคํฌ๋ฅผ ์ œ์•ˆํ•˜๊ณ  ์‹œ๋ฎฌ๋ ˆ์ด์…˜์—์„œ ์‹คํ–‰ํ•œ ๋’ค ์„ฑ๊ณต ๊ถค์ ๋งŒ ์–ธ์–ด ์กฐ๊ฑด ํ™•์‚ฐ ์ •์ฑ…์— ์ฆ๋ฅ˜ํ•œ๋‹ค.
  3. ์Šคํ‚ฌ ๋ฐœ๊ฒฌยท์กฐํ•ฉ โ€” PlayFusion(Chen et al. 2023b)์€ ์–ธ์–ด ์ฃผ์„ play๋ฅผ ์•ฝํ•œ ๊ฐ๋…์œผ๋กœ ์‚ผ์•„ ์ž์œ  ๊ถค์ ์„ ์ด์‚ฐ ์ฝ”๋“œ๋ถ ์œ„์˜ latent skill๋กœ ๋ถ„ํ•ดํ•œ๋‹ค. Ju et al. (2024), Wu et al. (2025a)๋Š” VQ๋กœ ์—ฐ์† ํ–‰๋™์„ ์ด์‚ฐ latent skill ๊ณต๊ฐ„์— ๋งคํ•‘ํ•œ๋‹ค.
  4. ์žฅ๊ธฐ ๊ณ„ํš ๋ถ„ํ•ด โ€” ChainedDiffuser(Xian et al. 2023)๋Š” ์ „์—ญ ํŠธ๋žœ์Šคํฌ๋จธ๊ฐ€ ์ด์‚ฐ ํ‚คํฌ์ฆˆ ์‹œํ€€์Šค๋ฅผ ์˜ˆ์ธกํ•˜๊ณ  ์ง€์—ญ ๊ถค์  ํ™•์‚ฐ๊ธฐ๊ฐ€ ๊ทธ ์‚ฌ์ด๋ฅผ ๋งค๋„๋Ÿฝ๊ฒŒ ์ž‡๋Š”๋‹ค. LCD(Zhang et al. 2024a)๋Š” ํ™•์‚ฐ ๋ชจ๋ธ์„ ์ €์ฐจ์› latent ๊ณต๊ฐ„์˜ ๊ณ ์ˆ˜์ค€ ํ”Œ๋ž˜๋„ˆ๋กœ ์“ด๋‹ค.

๋ฐฐ์น˜๋ฅผ ๊ฐ€๋กœ๋ง‰๋Š” ๋‘ ๋ฌธ์ œ๋„ ์ •๋ฆฌ๋œ๋‹ค. ๋ฐ์ดํ„ฐ ์ด์งˆ์„ฑ(์‹œ๋ฎฌ/์‹ค์ œ ๋กœ๋ด‡/์‚ฌ๋žŒ ์˜์ƒ)์— ๋Œ€ํ•ด PoCo(Wang et al. 2024c)๋Š” ์ •์ฑ… ํ•ฉ์„ฑ์„ ์กฐ๊ฑด๋ถ€ ํ™•์‚ฐ ํ•ฉ์„ฑ ๋ฌธ์ œ๋กœ ์ •์‹ํ™”ํ•ด ์‚ฌ์ „ํ•™์Šต๋œ ์—ฌ๋Ÿฌ ์ •์ฑ…์„ ์–ธ์–ด๋กœ ์กฐํ•ฉํ•˜๊ณ , RoLD(Tan et al. 2024)๋Š” ํƒœ์Šคํฌ ๋ฌด๊ด€ ์˜คํ† ์ธ์ฝ”๋”๋กœ ํ†ตํ•ฉ latent action ๊ณต๊ฐ„์„ ๋งŒ๋“  ๋’ค ๊ทธ ์•ˆ์—์„œ ํ™•์‚ฐ ์ •์ฑ…์„ ํ•™์Šตํ•ด cross-embodiment ์ „์ด๋ฅผ ๋…ธ๋ฆฐ๋‹ค. ๋ˆ„๋ฝ๋œ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ์— ๋Œ€ํ•ด์„œ๋Š” MDT(Reuss et al. 2024)์™€ GR-MG(Li et al. 2025b)๊ฐ€ ์–ธ์–ด/์ด๋ฏธ์ง€ ์–ด๋А ์ชฝ์ด๋“  ๋ฐ›๋„๋ก ์„ค๊ณ„๋œ๋‹ค(GR-MG๋Š” ์–ธ์–ด ์ง€์‹œ๋กœ ๋ชฉํ‘œ ์ด๋ฏธ์ง€๋ฅผ ํ™•์‚ฐ ์ƒ์„ฑํ•œ ๋’ค ๋‘ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ ๋ชจ๋‘๋กœ ์ •์ฑ…์„ ์กฐ๊ฑดํ™”).

๊ทธ๋ฆฌ๊ณ  ๋‚จ๋Š” ๋ณ‘๋ชฉ์€ ํ•˜๋‚˜๋กœ ์ˆ˜๋ ดํ•œ๋‹ค: ๋ฐ˜๋ณต์  denoising์˜ ์ถ”๋ก  ์ง€์—ฐ. ์„œ๋ฒ ์ด๋Š” (์–ธ์–ด ์กฐ๊ฑด์€ ์•„๋‹ˆ์ง€๋งŒ) ์ผ๊ด€์„ฑ ์ œ์•ฝ์œผ๋กœ ์ €์ง€์—ฐ ์ƒ˜ํ”Œ๋ง์„ ๋งŒ๋“œ๋Š” ๋ฐฉํ–ฅ(Lu et al. 2024; Prasad et al. 2024)์„ ์œ ๋งํ•œ ๋Œ€์•ˆ์œผ๋กœ ์ œ์‹œํ•œ๋‹ค.

Table 3 โ€” Sec. 5 ๋Œ€ํ‘œ๊ธฐ๋ฒ• (์›๋ฌธ ํ‘œ ์žฌํ˜„)

Method ํ•™์Šต ํŒจ๋Ÿฌ๋‹ค์ž„ ๊ฒจ๋ƒฅํ•œ ๋ณ‘๋ชฉ ์žฅ์  ๋‹จ์ 
MILLION (Bing et al. 2023a) RL ํƒ์ƒ‰ ์ค‘ ์ƒ˜ํ”Œ ๋น„ํšจ์œจ ๋ฉ”๋ชจ๋ฆฌ ๊ธฐ๋ฐ˜ ๋ฉ”ํƒ€๋Ÿฌ๋‹์œผ๋กœ ๋ฏธํ•™์Šต ํƒœ์Šคํฌ์— ๋น ๋ฅด๊ฒŒ ์ ์‘ ์ฝ๊ธฐ ๋‹จ๊ณ„์™€ ํ–‰๋™ ๋‹จ๊ณ„๋ฅผ ๋ถ„๋ฆฌํ•ด์•ผ ํ•จ
FLaRe (Hu et al. 2025a) RL ๋ฉ€ํ‹ฐํƒœ์Šคํฌ ํ–‰๋™์„ ์ฒ˜์Œ๋ถ€ํ„ฐ ๋ฐฐ์šฐ๋Š” ๋น„ํšจ์œจ ๋ฏธ์„ธ์กฐ์ •์œผ๋กœ ๋ฐ€์ง‘ ๋ณด์ƒ ๋ฒ ์ด์Šค๋ผ์ธ ๋Œ€๋น„ 15ร— ๋น ๋ฅธ ํ•™์Šต ์‚ฌ์ „ํ•™์Šต BC ๋ชจ๋ธ์˜ ๋ฐ์ดํ„ฐ ๋ถ„ํฌ ํ•œ๊ณ„๋ฅผ ์ƒ์†
PerAct (Shridhar et al. 2023) BC 2D ํˆฌ์˜์—์„œ 3D ๊ณต๊ฐ„ ๊ด€๊ณ„ ํ•™์Šต ๊ด€์ธกยทํ–‰๋™ ๊ณต๊ฐ„์„ ๋ชจ๋‘ ๋ณต์…€ํ™”ํ•ด ๊ฐ•ํ•œ 3D ๊ตฌ์กฐ prior ์กฐ๋ฐ€ยท๊ณ ํ•ด์ƒ๋„ ๋ณต์…€ํ™”๋กœ ์—ฐ์‚ฐ ๋น„์šฉ ํผ
HULC (Mees et al. 2022a) BC ์žฅ๊ธฐ ํƒœ์Šคํฌ ํ•™์Šต๊ณผ ์ผ๋ฐ˜ํ™” ํŠธ๋žœ์Šคํฌ๋จธ ๊ธฐ๋ฐ˜์œผ๋กœ ๊ฐ•๊ฑดํ•œ ์–ธ์–ด ์กฐ๊ฑด ํ‘œํ˜„ ํ•™์Šต ํ‘œ์ค€ BC์˜ ์žฅ๊ธฐ ๊ตฌ๊ฐ„ compounding error๋ฅผ ๊ทธ๋Œ€๋กœ ์•ˆ์Œ
StructDiffusion (Liu et al. 2023c) Diffusion Policy ๋ฌผ๋ฆฌ์ ์œผ๋กœ ํƒ€๋‹นํ•œ ์žฅ๋ฉด ๋ฐฐ์น˜์— ์–ธ์–ด ๊ทธ๋ผ์šด๋”ฉ ๋ฏธํ•™์Šต ๋ฌผ์ฒด์—๋„ ๋‹ค์–‘ยท๋ฌด์ถฉ๋Œ ๋ชฉํ‘œ ์ž์„ธ ์ƒ˜ํ”Œ๋ง ํ›„์† ์ €์ˆ˜์ค€ ์ •์ฑ…์˜ ๋Šฅ๋ ฅ์ด ์„ฑ๋Šฅ ์ƒํ•œ
ChainedDiffuser (Xian et al. 2023) Diffusion Policy ์žฅ๊ธฐ ์—ฐ์† ๊ถค์  ์ƒ์„ฑ ์ด์‚ฐ ํ‚คํฌ์ฆˆ ์˜ˆ์ธก + ์ง€์—ญ ๊ถค์  ํ™•์‚ฐ์œผ๋กœ ๋งค๋„๋Ÿฌ์šด ๋ชจ์…˜ ๋ฐ˜๋ณต denoising์˜ ๋†’์€ ์ถ”๋ก  ์ง€์—ฐ์„ ๊ทธ๋Œ€๋กœ ์ƒ์†

โธ ์–ธ์–ด๋กœ ๊ณ„ํšํ•˜๊ณ  ์ถ”๋ก ํ•œ๋‹ค (Sec. 6)

ํ•ต์‹ฌ ์งˆ๋ฌธ: ๋กœ๋ด‡์ด ์–ธ์–ด ๊ณต๊ฐ„์—์„œ ์–ด๋–ป๊ฒŒ โ€œ์ƒ๊ฐโ€ํ•ด ์ž๊ธฐ ํ–‰๋™์„ ๊ตฌ์กฐํ™”ํ•˜๋Š”๊ฐ€. ์—ฌ๊ธฐ์„œ ์–ธ์–ด๋Š” ์™ธ๋ถ€ ์ง€์‹œ๊ฐ€ ์•„๋‹ˆ๋ผ ๋‚ด๋ถ€ ์ถ”๋ก  ๋งค์ฒด๋‹ค.


Sec. 6์˜ taxonomy(Fig. 9) โ€” 6.1 Classic Neuro-symbolic(learning for reasoning / reasoning for learning / learning-reasoning), 6.2 Empowered by LLMs(Planning / Reasoning / Structured Planning), 6.3 Empowered by VLMs(Contrastive / Generative / Autoregressive). 6.1์˜ Reasoning-Learning์—์„œ 6.2์˜ Structured Planning์œผ๋กœ โ€œenhanceโ€ ํ™”์‚ดํ‘œ๊ฐ€ ์ด์–ด์ง„๋‹ค.

6.1 ๊ณ ์ „ ๋‰ด๋กœ์‹ฌ๋ณผ๋ฆญ โ€” ๊ทธ๋ฆฌ๊ณ  ๊ทธ๊ฒƒ์ด ์™œ ๋ฉˆ์ท„๋Š”๊ฐ€

Yu et al. (2023a)์˜ ํ‹€์„ ๋”ฐ๋ผ ์„ธ ๊ฐˆ๋ž˜๋กœ ๋‚˜๋ˆˆ๋‹ค. Learning for reasoning(์‹ ๊ฒฝ๋ง์ด ์ง€๊ฐยทํŠน์ง• ์ถ”์ถœ์„ ๋งก๊ณ  ์‹ฌ๋ณผ๋ฆญ์ด ๊ณ„ํš: Tenorth et al. 2010์˜ wikiHow ํŒŒ์‹ฑ + WordNet/Cyc โ†’ STRIPS ๊ณ„ํš, She et al. 2014์˜ โ€œGrounded Action Frameโ€, HiTUT, DANLI), Reasoning for learning(์‹ฌ๋ณผ๋ฆญ์ด ๊ตฌ์กฐยท๊ทœ์น™์„ ์ œ๊ณตํ•ด ์‹ ๊ฒฝ ํ•™์Šต์„ ์œ ๋„: Misra et al. 2016์˜ verb clause CRF, Silver et al. 2023์˜ ์‚ฌ์ „ ์ •์˜ ์‹ฌ๋ณผ ์ˆ ์–ด), Learning-reasoning(๋‘˜์ด ๋ฐ€๊ฒฐํ•ฉ ๋ฃจํ”„๋กœ ๊ณต์ง„ํ™”: Chai et al. 2018์˜ ๋Œ€ํ™”ํ˜• ํƒœ์Šคํฌ ํ•™์Šต, K et al. 2023์˜ ์‹ฌ๋ณผ๋ฆญ ํŒŒ์„œ + ์‹ ๊ฒฝ ์‹œ๊ฐ ์ถ”๋ก ๊ธฐ + ์‹ ๊ฒฝ ์•ก์…˜ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ).

์„œ๋ฒ ์ด๊ฐ€ ์ด ๊ณ„์—ด์˜ ํ•œ๊ณ„๋ฅผ ๋„ค ๊ฐœ๋กœ ์ •๋ฆฌํ•œ ๋ถ€๋ถ„์ด ์ข‹๋‹ค. (i) ๋…ธ๋™์ง‘์•ฝ์  KG ๊ตฌ์ถ• โ€” DANLI๋‚˜ KGE ๊ธฐ๋ฐ˜ ์ง€์†ํ•™์Šต์€ ํƒœ์Šคํฌ๋ณ„ KG๋ฅผ ์ „์ œํ•˜๋Š”๋ฐ, ์—ด๋ฆฐ ์„ธ๊ณ„์—์„œ๋Š” ์ƒˆ ๋ฌผ์ฒดยท๊ด€๊ณ„๊ฐ€ ๊ณ„์† ๋‚˜์™€ ์œ ์ง€๊ฐ€ ๋ณ‘๋ชฉ์ด ๋œ๋‹ค. (ii) ์ˆ˜์ž‘์—… ์‹ฌ๋ณผ ๊ณตํ•™๊ณผ ์˜จํ†จ๋กœ์ง€ ํ‘œ๋ฅ˜ โ€” ์ƒˆ ๋„๋ฉ”์ธ์œผ๋กœ ํ™•์žฅํ•˜๋ ค๋ฉด ์‚ฌ๋žŒ์ด ์˜จํ†จ๋กœ์ง€๋ฅผ ํ๋ ˆ์ด์…˜ํ•˜๊ณ  ์ธ์‹ ๋ชจ๋“ˆ์„ ์žฌํ•™์Šตํ•ด์•ผ ํ•œ๋‹ค. (iii) ์ƒ์‹ยท์‹ค์„ธ๊ณ„ ์ง€์‹ ์ปค๋ฒ„๋ฆฌ์ง€ ๋ถ€์กฑ โ€” ์‹ฌ๋ณผ ๊ทœ์น™์€ ๋ช…์‹œ์ ์œผ๋กœ ์ธ์ฝ”๋”ฉ๋œ ๊ฒƒ๋งŒ ๋‹ด๋Š”๋‹ค. (iv) ์žฅ๊ธฐ ํƒœ์Šคํฌ์—์„œ์˜ ํ™•์žฅ์„ฑ โ€” ๊ณ„ํš ๊ธธ์ด๊ฐ€ ๋Š˜๋ฉด ์ด์‚ฐ ์—ฐ์‚ฐ์ž์™€ ๊ทธ๋ผ์šด๋”ฉ ์„ ํƒ ์œ„์˜ ํƒ์ƒ‰์ด ์กฐํ•ฉ์ ์œผ๋กœ ํญ๋ฐœํ•œ๋‹ค.

์ด ๋„ค ๊ฐ€์ง€๊ฐ€ ๊ทธ๋Œ€๋กœ โ€œ์™œ LLM์ด ์ด ์ž๋ฆฌ๋ฅผ ๋Œ€์ฒดํ–ˆ๋Š”๊ฐ€โ€์˜ ๋‹ต์ด๋‹ค.

6.2 LLM์ด ๋“ค์–ด์˜จ ๋’ค

LLM์€ ์œ„์˜ (i)(ii)(iii)๋ฅผ ํ”„๋กฌํ”„ํŠธ ํ•˜๋‚˜๋กœ ์šฐํšŒํ•œ๋‹ค. ๋Œ€์‹  ์ž๊ธฐ ๊ณ ์œ ์˜ ๋ฌธ์ œ ์…‹์„ ๋“ค์—ฌ์˜จ๋‹ค. ์„œ๋ฒ ์ด๋Š” ์…‹์œผ๋กœ ์ •๋ฆฌํ•œ๋‹ค: grounding problem(ํ™˜๊ฒฝ์— ์—†๋Š” ๋ฌผ์ฒด๋ฅผ ์“ฐ๋Š” ๊ทธ๋Ÿด๋“ฏํ•˜์ง€๋งŒ ์‹คํ–‰ ๋ถˆ๊ฐ€๋Šฅํ•œ ๊ณ„ํš), ambiguity in language(โ€œmoving fasterโ€, โ€œplacing objects slightly leftโ€ ๊ฐ™์€ ๊ณต๊ฐ„ยท๊ธฐํ•˜ ํ‘œํ˜„), lack of feedback and reactivity(๊ฐœ๋ฃจํ”„ ํ”Œ๋ž˜๋„ˆ๋Š” ์‹คํŒจ๋ฅผ ๋ชจ๋ฅด๊ณ , ์ „์ž๋ ˆ์ธ์ง€์— ๊ธˆ์†์„ ๋„ฃ๋Š” ๊ณ„ํš์„ ๋‚ผ ์ˆ˜ ์žˆ๋‹ค).

๊ณ„ํš(6.2.1) ์€ ๊ฐœ๋ฃจํ”„์™€ ํ๋ฃจํ”„๋กœ ๊ฐˆ๋ฆฐ๋‹ค.

  • ๊ฐœ๋ฃจํ”„: SayCan(Brohan et al. 2023b)์ด affordance ํ•จ์ˆ˜๋กœ ๊ฐ ํ–‰๋™์˜ ํ˜„์žฌ ์ƒํƒœ ์„ฑ๊ณต๋ฅ ์„ ์ •๋Ÿ‰ํ™”ํ•ด LLM์˜ ์˜ˆ์ธก์„ ์žฌ์ •๋ ฌํ•œ๋‹ค. KnowNo(Ren et al. 2023a)๋Š” conformal prediction์œผ๋กœ ๊ณ„ํš์„ ๋‹ค์ง€์„ ๋‹ค QA๋กœ ๋งŒ๋“ค๊ณ , ์‚ฌ์šฉ์ž๊ฐ€ ์ •ํ•œ ์„ฑ๊ณต๋ฅ ๋กœ ์ž„๊ณ„๊ฐ’์„ ์žก์•„ ํ™•์‹ ์ด ์—†์œผ๋ฉด ์‚ฌ๋žŒ์—๊ฒŒ ๋ฌป๋Š”๋‹ค(โ€œPut a plastic bowl in the microwaveโ€ vs โ€œmetal bowlโ€). Huang et al. (2022)์€ ์ธ๊ณผ LLM์ด ๊ณ ์ˆ˜์ค€ ๋ชฉํ‘œ๋ฅผ ์ค‘๊ฐ„ ๊ณ„ํš์œผ๋กœ ๋ถ„ํ•ดํ•˜๊ณ  ๋งˆ์Šคํฌ๋“œ LLM์ด ๊ทธ๊ฒƒ์„ ์‹คํ–‰ ๊ฐ€๋Šฅํ•œ ํ•™์Šต๋œ ํ–‰๋™์œผ๋กœ ๋ฒˆ์—ญํ•˜๊ฒŒ ํ•œ๋‹ค(โ€œsqueeze out a glob of lotionโ€ โ†’ โ€œpour the lotion into right handโ€).
  • ํ๋ฃจํ”„: SayPlan(Rana et al. 2023)์€ ๊ณ„์ธต์  3D scene graph๋กœ ํ™˜๊ฒฝ์„ ํ‘œํ˜„ํ•ด ์ˆ ์–ดยทํ˜„์žฌ ์ƒํƒœยทaffordance๋ฅผ ํ…์ŠคํŠธ ํ”ผ๋“œ๋ฐฑ์œผ๋กœ ๋˜๋จน์ธ๋‹ค(์‚ฌ๋ฌด์‹ค ๊ทœ๋ชจ๊นŒ์ง€ ํ™•์žฅ). Text2Motion(Lin et al. 2023)์€ STAP์„ ๊ธฐํ•˜ ํƒ€๋‹น์„ฑ ๊ฒ€์‚ฌ๋กœ ์“ฐ๊ณ  ์‹คํŒจํ•˜๋ฉด ๋‹ค์‹œ ๊ณ„ํšํ•œ๋‹ค. SELP(Wu et al. 2025b)๋Š” ์„ ํ˜•์‹œ์ œ๋…ผ๋ฆฌ(LTL) ๋ฅผ ๋„ฃ์–ด LLM์˜ ์œ„ํ—˜ํ•œ ๊ณ„ํš์„ ๊ฐ€์ง€์น˜๊ธฐํ•œ๋‹ค(๋Œ€์‹  ํ™˜๊ฒฝ๋ณ„ LTL ๋ช…์„ธ๋ฅผ ๋ฏธ๋ฆฌ ๋งŒ๋“ค์–ด์•ผ ํ•œ๋‹ค).

์ถ”๋ก (6.2.2) ์€ ๋„ค ๊ฐˆ๋ž˜๋‹ค. ์š”์•ฝ(Tidybot์ด few-shot ํ”„๋กฌํ”„ํŠธ๋กœ โ€œyellow shirts go in the drawerโ€ + โ€œwhite socks go in the drawerโ€ ์—์„œ โ€œlighter-colored clothes go in the drawerโ€ ๋ผ๋Š” ์ผ๋ฐ˜ ์ „๋žต์„ ๋ฝ‘๋Š”๋‹ค โ€” ๋‹ค๋งŒ LLM์˜ ํƒœ์Šคํฌ ๋ฌด๊ด€ ์ง€์‹์ด ์„ž์—ฌ ์™„์ „ํžˆ ๋งž๋Š” ์š”์•ฝ์„ ๋ชป ๋งŒ๋“ค๊ธฐ๋„ ํ•œ๋‹ค), ํ”„๋กฌํ”„ํŠธ ์—”์ง€๋‹ˆ์–ด๋ง(CoT, Socratic Models, ECoT), ์ฝ”๋“œ ์ƒ์„ฑ(Code as Policies, ProgPrompt, VOYAGER์˜ ์Šคํ‚ฌ ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ ์ถ•์ ), ๋ฐ˜๋ณต์  ์ถ”๋ก (Inner Monologue์˜ ์„ฑ๊ณต ๊ฐ์ง€๊ธฐ + ์žฅ๋ฉด ์„œ์ˆ ์ž ๋˜๋จน์ž„, REFLECT์˜ ์‹คํŒจ ์„ค๋ช… ์ƒ์„ฑ, HiCRISP์˜ ๊ณ„์ธต์  ์˜ค๋ฅ˜ ์ •์ •, DAHLIA์˜ โ€œplanner + reporterโ€ ์ด์ค‘ ๋ฃจํ”„, LYRA์˜ human-in-the-loop ์Šคํ‚ฌ ์ถ•์ ).

์—ฌ๊ธฐ์„œ ์„œ๋ฒ ์ด๊ฐ€ ์ธ์šฉํ•œ ๊ฐ€์žฅ ๊ตฌ์ฒด์ ์ธ ๊ทผ๊ฑฐ ํ•˜๋‚˜: Mialon et al. (2023)์— ๋”ฐ๋ฅด๋ฉด GSM8K ๋ฒค์น˜๋งˆํฌ์—์„œ ์ฝ”๋“œ ์ตœ์ ํ™”๋œ code-davinci-002๊ฐ€ ํ…์ŠคํŠธ ์ตœ์ ํ™”๋œ text-davinci-002๋ฅผ ๋Šฅ๊ฐ€ํ•œ๋‹ค โ€” code-as-policy ๊ณ„์—ด์˜ ์„ฑ๋Šฅ์ด ๊ฒฐ๊ตญ ์–ด๋–ค ํŒŒ์šด๋ฐ์ด์…˜ ๋ชจ๋ธ์„ ๊ณจ๋ž๋Š”๊ฐ€์— ์˜ํ•ด ์ƒํ•œ์ด ์ •ํ•ด์ง„๋‹ค๋Š” ๋œป์ด๋‹ค.

๊ตฌ์กฐํ™”๋œ ๊ณ„ํš(6.2.3) ์€ LLM์„ ํ˜•์‹ ์ฒด๊ณ„์™€ ๊ฒฐํ•ฉํ•œ๋‹ค. PDDL ๊ฒฐํ•ฉ์˜ ์„ธ ๋‚œ์ (์‹ฌ๋ณผ๋ฆญ ํƒ์ƒ‰ ์†๋„, ์‹ฌ๋ณผ ๊ทธ๋ผ์šด๋”ฉ, ๋ณต์žกํ•œ ์ƒํ˜ธ์ž‘์šฉ ํ‘œํ˜„)์— ๋Œ€ํ•ด ๊ฐ๊ฐ ๋„๋ฉ”์ธ ํŠนํ™” ๋ฏธ์„ธ์กฐ์ •(Capitanelli and Mastrogiovanni 2024), ์‹ค์‹œ๊ฐ„ ์„ผ์„œ ํ”ผ๋“œ๋ฐฑ์œผ๋กœ ์ˆ ์–ด๋ฅผ ๊ฒ€์‚ฌํ•˜๋Š” IALP(Wang et al. 2025a), ์ด‰๊ฐยทํž˜ํ† ํฌ ์‹œ์—ฐ์„ ๋„ฃ์–ด โ€œ์ผ€์ด๋ธ” ์žฅ๋ ฅโ€ ๊ฐ™์€ ๋ˆˆ์— ์•ˆ ๋ณด์ด๋Š” ์‚ฌ๊ฑด๊นŒ์ง€ ์ˆ ์–ด๋กœ ์ •์˜ํ•˜๋Š” LEMMo-Plan(Chen et al. 2025b)์ด ๋Œ€์‘ํ•œ๋‹ค. ํ–‰๋™ํŠธ๋ฆฌ(BT) ๊ฒฐํ•ฉ์€ LLM-bt(๋Ÿฐํƒ€์ž„ ๊ณ„ํš ์ ์‘) โ†’ LLM-OBTEA(1์ฐจ ๋…ผ๋ฆฌ ๋ชฉํ‘œ๋กœ ๋ฒˆ์—ญ ํ›„ Optimal BT Expansion์œผ๋กœ ์ตœ์†Œ๋น„์šฉ BT๋ฅผ ๋ณด์žฅ) โ†’ BETR-XP-LLM(LLM์„ โ€œrepair agentโ€๋กœ ์จ์„œ ์‹คํŒจ๋งˆ๋‹ค ์ตœ์†Œ ์ „์ œ์กฐ๊ฑด๊ณผ ์„œ๋ธŒํŠธ๋ฆฌ๋ฅผ ์ œ์•ˆํ•˜๊ณ  ๊ฒ€์ฆ ๊ฐ€๋Šฅํ•œ ์ˆ˜์ •์„ ์ •์ฑ…์— ์˜๊ตฌ ํ†ตํ•ฉ)์œผ๋กœ ์ด์–ด์ง„๋‹ค.

6.3 VLM์ด ๋“ค์–ด์˜จ ๋’ค

LLM์˜ ๊ทผ๋ณธ ํ•œ๊ณ„๋Š” ํ•˜๋‚˜๋‹ค: disembodied. ํ…์ŠคํŠธ๋งŒ ๋‹ค๋ฃจ๋ฏ€๋กœ ํ™˜๊ฒฝ์„ ์ง์ ‘ ๋ณผ ์ˆ˜ ์—†๊ณ , ๋ฌผ์ฒด ๊ฒ€์ถœ๊ธฐ ๊ฐ™์€ ์ค‘๊ฐ„ ๋ชจ๋“ˆ์ด ์ •๋ณด๋ฅผ ์žƒ๋Š”๋‹ค. VLM์€ ์ด ๋‹ค๋ฆฌ๋ฅผ ์—†์•ค๋‹ค.

  • ๋Œ€์กฐ ํ•™์Šต ๊ณ„์—ด: CLIPORT, Dream2Real(CLIP์œผ๋กœ ๊ฐ€์ƒ ๋ชฉํ‘œ ์ƒํƒœ๋ฅผ โ€œ์ƒ์ƒโ€ํ•ด ํ‰๊ฐ€), CLIP-Fields, EmbCLIP, MOO(OWL-ViT์—๊ฒŒ โ€œAn image of an Xโ€ ๋กœ ๊ด€์‹ฌ ๋ฌผ์ฒด์˜ ๋ฐ”์šด๋”ฉ๋ฐ•์Šค๋ฅผ ์š”์ฒญ), LATTE, R+X(Gemini๋กœ ์‚ฌ๋žŒ ์‹œ์—ฐ ์˜์ƒ ์ค‘ ๊ด€๋ จ ๊ตฌ๊ฐ„์„ ๊ฒ€์ƒ‰ํ•ด ์ •์ฑ…์„ ์กฐ๊ฑดํ™”).
  • ์ƒ์„ฑ ๊ณ„์—ด: ํ…์ŠคํŠธ ์ƒ์„ฑ(PaLM-E 562B๊ฐ€ ๋‹จ์ผ ๊ฑฐ๋Œ€ ๋ชจ๋ธ๋กœ ๋กœ๋ด‡ ํƒœ์Šคํฌ ํŠนํ™” ๋ฏธ์„ธ์กฐ์ • ๊ฑฐ์˜ ์—†์ด ์‹คํ–‰ ๊ฐ€๋Šฅ ๊ณ„ํš์„ ๋งŒ๋“ ๋‹ค; Socratic Models๊ฐ€ ์ „๋ฌธ ๋ชจ๋ธ๋“ค์„ ์–ธ์–ด๋กœ ๋Œ€ํ™”์‹œํ‚จ๋‹ค; PIVOT์ด ์กฐ์ž‘์„ VLM๊ณผ์˜ ๋ฐ˜๋ณต์  ์‹œ๊ฐ ๋Œ€ํ™”๋กœ ์žฌ๊ตฌ์„ฑ), ์ด๋ฏธ์ง€ ์ƒ์„ฑ(SuSIE๊ฐ€ ์ด๋ฏธ์ง€ ํŽธ์ง‘ ๋ชจ๋ธ๋กœ ์„œ๋ธŒ๊ณจ ์‹œํ€€์Šค๋ฅผ ๋งŒ๋“ค์–ด ์ €์ˆ˜์ค€ ์ปจํŠธ๋กค๋Ÿฌ์— ๋„˜๊ธด๋‹ค; Dall-E-Bot; ๋ฐ์ดํ„ฐ ์ฆ๊ฐ•; GR-MG์˜ ๋ชฉํ‘œ ์ด๋ฏธ์ง€ ์ƒ์„ฑ; ๋ฏธ๋ž˜ ํ”„๋ ˆ์ž„ ์˜ˆ์ธก์œผ๋กœ ์—ญ๋™์—ญํ•™์„ ๋ฐฐ์šฐ๋Š” ์›”๋“œ๋ชจ๋ธ ์šฉ๋ฒ•).

Table 4 โ€” Sec. 6 ๋Œ€ํ‘œ๊ธฐ๋ฒ• (์›๋ฌธ ํ‘œ ์žฌํ˜„, ์ผ๋ถ€)

Method ์ธ์ง€ ์ฒด๊ณ„ ์ถ”๋ก  ๋ฉ”์ปค๋‹ˆ์ฆ˜ ์žฅ์  ๋‹จ์ 
DANLI (Zhang et al. 2022) Classic Neuro-symbolic ๋Œ€ํ™” ์ด๋ ฅ๊ณผ ์‹ฌ๋ณผ๋ฆญ ์„œ๋ธŒ๊ณจ์„ ํ†ตํ•œ learning-for-reasoning ์ง„ํ–‰ ์ƒํ™ฉ์„ ์ถ”๋ก ํ•˜๊ณ  ์˜ค๋ฅ˜์—์„œ ๋™์ ์œผ๋กœ ๋ณต๊ตฌ ๋…ธ๋™์ง‘์•ฝ์ ยทํƒœ์Šคํฌ ํŠนํ™” KG ๊ตฌ์ถ•์— ์˜์กด
SayCan (Brohan et al. 2023b) LLM-Empowered affordance ํ•จ์ˆ˜์™€ ๊ฒฐํ•ฉ๋œ ๊ฐœ๋ฃจํ”„ ๊ณ„ํš ์ž์—ฐ์–ด๋ฅผ ์˜๋ฏธ์ƒ ํƒ€๋‹นํ•˜๊ณ  ๋ฌผ๋ฆฌ์ ์œผ๋กœ ์‹คํ–‰ ๊ฐ€๋Šฅํ•œ ์‹œํ€€์Šค๋กœ ์Šคํ‚ฌ ์‹คํ–‰์ด ๋ฌด๊ฒฐํ•˜๋‹ค๊ณ  ๊ฐ€์ •, ์žฌ๊ณ„ํš์šฉ ์‹ค์‹œ๊ฐ„ ํ”ผ๋“œ๋ฐฑ ์—†์Œ
SayPlan (Rana et al. 2023) LLM-Empowered 3D scene graph + ์˜๋ฏธ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ๊ธฐ๋ฐ˜ ํ๋ฃจํ”„ ๊ณ„ํš ์ง€์†์  ํ…์ŠคํŠธ ํ”ผ๋“œ๋ฐฑ์œผ๋กœ ๋Œ€๊ทœ๋ชจ ํ™˜๊ฒฝ์—์„œ ๋™์ž‘ ์„ฑ๋Šฅ์ด ๊ธฐ๋ฐ˜ LLM์˜ ์ถ”๋ก  ๋Šฅ๋ ฅ์— ๊ฐ‡ํžˆ๊ณ  ์ง€์—ฐ ๊ฐ€๋Šฅ์„ฑ
Code as Policies (Liang et al. 2023) LLM-Empowered ์ •์ฑ… ๋กœ์ง์„ ์กฐ์œจํ•˜๋Š” ์ž๊ธฐํšŒ๊ท€ ์ฝ”๋“œ ์ƒ์„ฑ API ํ˜ธ์ถœ์„ ์œ ์—ฐํ•˜๊ฒŒ ์žฌ์กฐํ•ฉํ•ด ๋ฏธํ•™์Šต ๋ฌผ์ฒด์— ์ผ๋ฐ˜ํ™” ๋ณต์žกํ•œ ๋ช…๋ น์— ์ทจ์•ฝ, ์กด์žฌํ•˜์ง€ ์•Š๋Š” ํ•จ์ˆ˜๋ฅผ ํ˜ธ์ถœํ•˜๊ธฐ๋„
PaLM-E (Driess et al. 2023) VLM-Empowered ๊ฑฐ๋Œ€ ๋‹จ์ผ embodied ์ถ”๋ก  ๋ชจ๋ธ์˜ ํ…์ŠคํŠธ ์ƒ์„ฑ ์ผ๋ถ€ ํ‰๊ฐ€ ์„ค์ •์—์„œ ๋กœ๋ด‡ ํƒœ์Šคํฌ ํŠนํ™” ๋ฏธ์„ธ์กฐ์ • ์—†์ด ์‹คํ–‰ ๊ฐ€๋Šฅ ๊ณ„ํš ๋ฐฐํฌยท๊ตฌ๋™์— ๋งค์šฐ ํฐ ์ž์› ์†Œ์š”
SuSIE (Black et al. 2024) VLM-Empowered ์ˆœ์ฐจ ์„œ๋ธŒ๊ณจ ์‹œ๊ฐํ™”๋ฅผ ์œ„ํ•œ ์ด๋ฏธ์ง€ ์ƒ์„ฑ ๊ณ ์ˆ˜์ค€ ์˜๋ฏธ ์ดํ•ด์™€ ์ €์ˆ˜์ค€ ์ œ์–ด ์ตœ์ ํ™”๋ฅผ ๋ถ„๋ฆฌ ์ƒ์„ฑ ์ด๋ฏธ์ง€์˜ ๋ฌผ๋ฆฌ์  ๋น„ํ˜„์‹ค ๋””ํ…Œ์ผ์ด ์ œ์–ด ์‹ ํ˜ธ๋ฅผ ์˜ค์—ผ
LEMMo-Plan (Chen et al. 2025b) LLM-driven ๊ตฌ์กฐํ™” ๊ณ„ํš (Symbolic) ์ด‰๊ฐยทํž˜ํ† ํฌ ์‹œ์—ฐ์„ PDDL ์‹ฌ๋ณผ๋ฆญ ๊ณ„ํš์— ํ†ตํ•ฉ ์ผ€์ด๋ธ” ์žฅ๋ ฅ ๊ฐ™์€ โ€œ๋ณด์ด์ง€ ์•Š๋Š”โ€ ์‚ฌ๊ฑด์„ ํž˜ ๊ธฐ๋ฐ˜ ์Šคํ‚ฌ ์กฐ๊ฑด์œผ๋กœ ์ •์˜ PDDL ๊ฒฐํ•ฉ์ด ์‹ฌ๋ณผ๋ฆญ ํƒ์ƒ‰์„ ๋А๋ฆฌ๊ฒŒ ํ•ด ํ–‰๋™์„ ์ง€์—ฐ
BETR-XP-LLM (Styrud et al. 2025) LLM-driven ๊ตฌ์กฐํ™” ๊ณ„ํš (Behavior Trees) LLM์„ โ€œrepair agentโ€๋กœ ์‚ผ์•„ ์ตœ์†Œ ์ „์ œ์กฐ๊ฑดยท์„œ๋ธŒํŠธ๋ฆฌ ์ œ์•ˆ ๊ฒ€์ฆ ๊ฐ€๋Šฅํ•œ ์ˆ˜์ •์„ ์ •์ฑ…์— ์˜๊ตฌ ํ†ตํ•ฉ, ์‹คํŒจํ• ์ˆ˜๋ก ๊ฐ•๊ฑดํ•ด์ง ๋Ÿฐํƒ€์ž„ ํ”ผ๋“œ๋ฐฑยท์žฌ๊ณ„ํš์— LLM์„ ์“ฐ๋ฉด ํ† ํฐยท์ง€์—ฐ ๋น„์šฉ ์ฆ๊ฐ€

โน ์–ธ์–ด๋ฅผ ์•ก์…˜๊ณผ ํ•œ ๋ชธ์œผ๋กœ โ€” ํ†ตํ•ฉ VLA (Sec. 7)

์—ฌ๊ธฐ์„œ ์–ธ์–ด๋Š” ๋” ์ด์ƒ ์™ธ๋ถ€ ์กฐ๊ฑด์ด ์•„๋‹ˆ๋ผ ๋ชจ๋ธ์˜ ํ•ต์‹ฌ ํ‘œํ˜„๊ณผ ํ•™์Šต ๋ชฉ์  ์•ˆ์— ํ•จ๊ป˜ ๋ชจ๋ธ๋ง๋œ๋‹ค.

์ฃผ๋ชฉํ•  ์ ์€ ์ €์ž๋“ค์ด VLA์˜ ๊ฒฝ๊ณ„๋ฅผ ์ข๊ฒŒ ์ •์˜ํ•œ๋‹ค๋Š” ๊ฒƒ์ด๋‹ค. ๋„“์€ ์ž…์ถœ๋ ฅ ์ •์˜(โ€œ์‹œ๊ฐ ๊ด€์ธก + ์–ธ์–ด ์ง€์‹œ๋ฅผ ๋ฐ›์•„ ๋กœ๋ด‡ ํ–‰๋™์„ ๋‚ธ๋‹คโ€)๋กœ๋Š” CLIPORT๋„ ์ดˆ๊ธฐ VLA๋กœ ๋ณผ ์ˆ˜ ์žˆ์ง€๋งŒ, ์ด ์„œ๋ฒ ์ด๋Š” CLIPORT๋ฅผ VLM-empowered ์ •์ฑ…์œผ๋กœ ๋ถ„๋ฅ˜ํ•œ๋‹ค โ€” CLIP์ด ๊ณ ์ •๋œ ์˜๋ฏธ ๊ทธ๋ผ์šด๋”ฉ ๋ชจ๋“ˆ์ด๊ณ  ํ–‰๋™ ์ƒ์„ฑ์€ Transporter ์Šคํƒ€์ผ ์ •์ฑ…์ด ๋”ฐ๋กœ ํ•˜๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. ์ด ์„œ๋ฒ ์ด๊ฐ€ ๋งํ•˜๋Š” VLA๋Š” ์•ก์…˜ ์ƒ์„ฑ์ด ์‹œ๊ฐ-์–ธ์–ด ํ‘œํ˜„๊ณผ ๋ฐ€๊ฒฐํ•ฉํ•ด ํ•™์Šต๋˜๋Š” ๊ฒƒ(์ด์‚ฐ ์•ก์…˜ ํ† ํฐ์˜ ๋””ํ† ํฌ๋‚˜์ด์ฆˆ, ์—ฐ์† ์•ก์…˜ ํ—ค๋“œ, ํ™•์‚ฐ ๊ธฐ๋ฐ˜ ์ƒ์„ฑ, flow-matching ์ปจํŠธ๋กค๋Ÿฌ, VLM ๋ฐฑ๋ณธ์— ๋ถ™์€ action expert)์„ ๋œปํ•œ๋‹ค. ๊ฒฝ๊ณ„๋ฅผ ๋ช…์‹œ์ ์œผ๋กœ ๊ทธ์€ ์„œ๋ฒ ์ด๋Š” ๋“œ๋ฌผ๊ณ , ์ด๊ฑด ์‹ค์ œ๋กœ ์œ ์šฉํ•˜๋‹ค.


VLA taxonomy(Fig. 16) โ€” Perception โ†’ Reasoning โ†’ Action โ†’ Adaptation์˜ ์ตœ์ ํ™” ๋ฐฉํ–ฅ์œผ๋กœ ์ž๋ฅธ๋‹ค. Group I: Perception(๋ฐ์ดํ„ฐ ์†Œ์Šคยท์ฆ๊ฐ•, ๊ณต๊ฐ„ ์ดํ•ด, ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์œตํ•ฉ), Group II: Reasoning(์žฅ๊ธฐ ํƒœ์Šคํฌ, ์ง€์‹ ๋ณด์กด, ์ถ”๋ก ยท์›”๋“œ๋ชจ๋ธ), III: Policy execution, IV: Adaptation. (์›๋ฌธ ์บก์…˜์˜ โ€œHierachicalโ€, โ€œfllowsโ€๋Š” ์˜คํƒ€)

7.2 Perception โ€” ๋ฐ์ดํ„ฐ, 3D, ๊ทธ๋ฆฌ๊ณ  ์ด‰๊ฐ

๋ฐ์ดํ„ฐ. ๋กœ๋ด‡ ์‹œ์—ฐ ์ˆ˜์ง‘ ๋น„์šฉ์ด ๊ทผ๋ณธ ๋ณ‘๋ชฉ์ด๋ฏ€๋กœ ์‚ฌ๋žŒ ํ™œ๋™ ๋ฐ์ดํ„ฐ๋กœ ์šฐํšŒํ•œ๋‹ค. EgoVLA(Yang et al. 2025d)๋Š” 1์ธ์นญ ์‚ฌ๋žŒ ์˜์ƒ์œผ๋กœ ์†๋ชฉยท์† ๋™์ž‘์„ ์˜ˆ์ธกํ•˜๋„๋ก ์‚ฌ์ „ํ•™์Šตํ•œ ๋’ค ์†Œ์ˆ˜์˜ ๋กœ๋ด‡ ์‹œ์—ฐ์œผ๋กœ ๋ฏธ์„ธ์กฐ์ •ํ•˜๊ณ , H-RDT(Bi et al. 2026)๋Š” ์ด 2๋‹จ๊ณ„ ํŒจ๋Ÿฌ๋‹ค์ž„์„ 20์–ต ํŒŒ๋ผ๋ฏธํ„ฐ ํ™•์‚ฐ ํŠธ๋žœ์Šคํฌ๋จธ๋กœ ํ‚ค์šด๋‹ค. ๋‹ค๋งŒ ์–‘์„ ๋Š˜๋ฆฌ๋Š” ๊ฒƒ๋งŒ์œผ๋กœ๋Š” ์ผ๋ฐ˜ํ™”๊ฐ€ ์˜ค์ง€ ์•Š๋Š”๋‹ค โ€” Xing et al. (2025b)๋Š” ๋Œ€๊ทœ๋ชจ ์ง‘ํ•ฉ ๋ฐ์ดํ„ฐ์…‹์—์„œ shortcut learning์ด ์ƒ๊ธฐ๋Š” ๋‘ ์›์ธ์„ ์งš๋Š”๋‹ค: (1) ๊ฐœ๋ณ„ ์„œ๋ธŒ๋ฐ์ดํ„ฐ์…‹ ๋‚ด๋ถ€์˜ ๋‹ค์–‘์„ฑ ๋ถ€์กฑ, (2) dataset fragmentation(์„œ๋กœ ๋‹ค๋ฅธ ๋žฉยท๋กœ๋ด‡์—์„œ ์˜จ ์„œ๋ธŒ๋ฐ์ดํ„ฐ์…‹ ๊ฐ„ ๋ถ„ํฌ ๊ฒฉ์ฐจ). ๊ทธ๋ž˜์„œ ๋ชจ๋ธ์ด ์นด๋ฉ”๋ผ ์‹œ์ ์ด๋‚˜ ๋ฐฐ๊ฒฝ ๊ฐ™์€ ํƒœ์Šคํฌ ๋ฌด๊ด€ ํ”ผ์ฒ˜์™€ ์Šคํ‚ฌ์„ ์—ฐ๊ฒฐํ•œ๋‹ค. ๋Œ€์ฑ…์€ ์ƒˆ๋กœ์šด ์‹œ์  ํ•ฉ์„ฑยท์žฅ๋ฉด ๊ฐ„ ๋ฌผ์ฒด ๊ตํ™˜ ๊ฐ™์€ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ ์ฆ๊ฐ•์ด๋‹ค.

3D. 2D VLM์˜ โ€œ๊ณต๊ฐ„ ์ธ์‹ ๊ฒฉ์ฐจโ€๋ฅผ ๋ฉ”์šฐ๋Š” ์„ธ ๊ฐˆ๋ž˜๊ฐ€ ๋šœ๋ ทํ•˜๋‹ค. (a) 2D ํ”ผ์ฒ˜์— 3D๋ฅผ ์ฃผ์ž… โ€” SpatialVLA(Qu et al. 2025)์˜ Ego3D Position Encoding + Adaptive Action Grids, PointVLA(Li et al. 2026a)๋Š” ๋ณ„๋„ ๊ฒฝ๋Ÿ‰ ์ธ์ฝ”๋”๊ฐ€ ํฌ์ธํŠธํด๋ผ์šฐ๋“œ๋ฅผ ์ฒ˜๋ฆฌํ•ด ๋™๊ฒฐ๋œ action expert์— ๊ธฐํ•˜ ํ”ผ์ฒ˜๋งŒ ์ฃผ์ž…(VLM ๋ฌด๊ฒฐ์„ฑ ๋ณด์กด). (b) 3D๋ฅผ 2D๋กœ ์žฌํฌ๋งท โ€” BridgeVLA(Li et al. 2026b)๋Š” ํฌ์ธํŠธํด๋ผ์šฐ๋“œ๋ฅผ top/front/side ์ •์‚ฌ์˜ 2D ์ด๋ฏธ์ง€๋กœ ํˆฌ์˜ํ•ด ํ‘œ์ค€ VLM ๋ฐฑ๋ณธ์— ๋„ฃ๊ณ  ๊ฐ™์€ ํˆฌ์˜๋ฉด ์œ„์˜ 2D ํžˆํŠธ๋งต์œผ๋กœ ํ–‰๋™์„ ์˜ˆ์ธกํ•œ๋‹ค. ์ž…๋ ฅ๊ณผ ์ถœ๋ ฅ์„ ํ•˜๋‚˜์˜ 2D ๊ณต๊ฐ„์œผ๋กœ ํ†ต์ผํ•˜๋Š” ์˜๋ฆฌํ•œ ์„ค๊ณ„์ด๊ณ , ํƒœ์Šคํฌ๋‹น 3๊ฐœ ๊ถค์ ์ด๋ผ๋Š” ์ƒ˜ํ”Œ ํšจ์œจ์ด ์ธ์ƒ์ ์ด๋‹ค(๋Œ€์‹  ์ •์‚ฌ์˜์—์„œ ๋ชฉํ‘œ ํ‚คํฌ์ธํŠธ๊ฐ€ ๊ฐ€๋ ค์งˆ ์ˆ˜ ์žˆ๊ณ  ๋ณต์žกํ•œ ์žฅ๊ธฐ ํƒœ์Šคํฌ์—์„œ ์„ฑ๋Šฅ์ด ๋–จ์–ด์ง„๋‹ค). (c) 2Dยท3D ๋ณ‘๋ ฌ ์ฒ˜๋ฆฌ ํ›„ ์œตํ•ฉ โ€” GeoVLA(Sun et al. 2025)๋Š” ํ‘œ์ค€ VLM์ด 2D+์–ธ์–ด๋ฅผ, ๋ณ„๋„ ๋„คํŠธ์›Œํฌ๊ฐ€ ํฌ์ธํŠธํด๋ผ์šฐ๋“œ๋ฅผ ์ฒ˜๋ฆฌํ•œ ๋’ค MoE ๊ธฐ๋ฐ˜ 3D-enhanced Action Expert๋กœ ์œตํ•ฉํ•œ๋‹ค.

์ด‰๊ฐยทํž˜. ์กฐ๋ฆฝยท์‚ฝ์ž… ๊ฐ™์€ ์ ‘์ด‰ ๊ณผ์ œ์—์„œ๋Š” ์‹œ๊ฐ๋งŒ์œผ๋กœ ๋ถ€์กฑํ•˜๋‹ค. VTLA(Zhang et al. 2026a)๋Š” ์ด‰๊ฐ ์ด๋ฏธ์ง€ ์‹œํ€€์Šค๋ฅผ ํ† ํฐํ™”ํ•˜๊ณ  DPO 2๋‹จ๊ณ„ ํ•™์Šต์œผ๋กœ โ€œVLM์˜ ๋ถ„๋ฅ˜ ๋ชฉ์  โ†”๏ธŽ ์—ฐ์† ๋กœ๋ด‡ ์ œ์–ดโ€์˜ ๋ถˆ์ผ์น˜๋ฅผ ๋‹ค๋ฃฌ๋‹ค. Tactile-VLA(Huang et al. 2025a)๋Š” ์ •์ฑ… ์ถœ๋ ฅ์ด ๋ชฉํ‘œ ํž˜๊ณผ ๋ชฉํ‘œ ์œ„์น˜๋ฅผ ํ•จ๊ป˜ ์˜ˆ์ธกํ•˜๊ฒŒ ํ•ด โ€œgentlyโ€, โ€œhardโ€ ๊ฐ™์€ ํž˜ ๊ด€๋ จ ๋ถ€์‚ฌ๋ฅผ ์ดํ•ดํ•˜๊ฒŒ ํ•˜๊ณ , ์‹คํŒจ ์‹œ ์ด‰๊ฐ ํ”ผ๋“œ๋ฐฑ์„ ํ•ด์„ํ•˜๋Š” CoT ๋ฉ”์ปค๋‹ˆ์ฆ˜์„ ๋„ฃ๋Š”๋‹ค. ์„ผ์„œ ์ด์งˆ์„ฑ(GelSight๋ฅ˜ vs ํž˜ ๊ธฐ๋ฐ˜)์€ OmniVTLA(Cheng et al. 2025)์˜ ์ด์ค‘ ๊ฒฝ๋กœ ์ธ์ฝ”๋” + ๊ต์ฐจ๋ชจ๋‹ฌ ๋Œ€์กฐ ํ•™์Šต์œผ๋กœ, ์œตํ•ฉ ๋ฐฉ์‹์€ ForceVLA(Yu et al. 2026)์˜ force-aware MoE ๊ธฐ๋ฐ˜ ๋™์  late fusion์œผ๋กœ ๋Œ€์‘ํ•œ๋‹ค.

๊ด€๋ จ: ์ด‰๊ฐ์„ VLA์— ๋…น์ด๋Š” ๊ณ„์—ด์€ ์ด ๋ธ”๋กœ๊ทธ์˜ Tactile-VLA ๋ฆฌ๋ทฐ์—์„œ ์› ๋…ผ๋ฌธ ์ˆ˜์ค€์œผ๋กœ ๋ณผ ์ˆ˜ ์žˆ๋‹ค. ์ ‘์ด‰ ์ƒํ™ฉ์˜ ์ปดํ”Œ๋ผ์ด์–ธ์Šค๋ฅผ VLM์œผ๋กœ ์กฐ์ ˆํ•˜๋Š” ์ตœ๊ทผ ํ๋ฆ„์€ CompliantVLA ๋ฆฌ๋ทฐ๋ฅผ ์ฐธ๊ณ .

7.3 Reasoning โ€” ๊ณ„ํš, ์ง€์‹ ๋ณด์กด, ์›”๋“œ๋ชจ๋ธ

์žฅ๊ธฐ ๊ณ„ํš ์ „๋žต์€ ์…‹์ด๋‹ค. ๊ณ„์ธต์  ๋ถ„ํ•ด(LoHoVLA, DexVLA๊ฐ€ ํ†ตํ•ฉ ๋ชจ๋ธ์ด ๋จผ์ € ์–ธ์–ด ์„œ๋ธŒํƒœ์Šคํฌ๋ฅผ ์ƒ์„ฑํ•˜๊ณ  ๊ทธ ์ž๊ธฐ์ƒ์„ฑ ์ง€์‹œ๋กœ ํ–‰๋™์„ ์˜ˆ์ธก โ€” โ€œthink before you actโ€), phase-aware control(Long-VLA๊ฐ€ ๊ฐ ์„œ๋ธŒํƒœ์Šคํฌ๋ฅผ โ€œmoving phaseโ€์™€ โ€œinteraction phaseโ€๋กœ ๋‚˜๋ˆ„๊ณ  phase-aware ์ž…๋ ฅ ๋งˆ์Šคํ‚น์œผ๋กœ ์ด๋™ ์‹œ์—” ๊ด‘๊ฐ, ์กฐ์ž‘ ์‹œ์—” ๊ทธ๋ฆฌํผ ๋ทฐ๋ฅผ ๋ณด๊ฒŒ ๊ฐ•์ œ โ€” skill chaining ๋ฌธ์ œ๋ฅผ ๊ฒจ๋ƒฅ), memory-augmented reasoning(MemoryVLA๊ฐ€ Perceptual-Cognitive Memory Bank๋กœ ์ €์ˆ˜์ค€ ์ง€๊ฐ ๋””ํ…Œ์ผ๊ณผ ๊ณ ์ˆ˜์ค€ ์˜๋ฏธ ์š”์•ฝ์„ ํ•จ๊ป˜ ์ €์žฅยท๊ฒ€์ƒ‰ํ•ด, ์ฃผ๋ฅ˜ VLA๊ฐ€ ์‚ฌ์‹ค์ƒ โ€œmemorylessโ€์ธ ๋ฌธ์ œ๋ฅผ ํ‘ผ๋‹ค).

์ง€์‹ ๋ณด์กด์€ ์ด ์ ˆ์—์„œ ๊ฐ€์žฅ ํฅ๋ฏธ๋กœ์šด ๋Œ€๋ชฉ์ด๋‹ค. VLA๋ฅผ ๋งŒ๋“œ๋Š” ์ด์œ ๊ฐ€ VLM์˜ ๋ฐฉ๋Œ€ํ•œ ์˜๋ฏธ ์ง€์‹์„ ์“ฐ๊ธฐ ์œ„ํ•ด์„œ์ธ๋ฐ, ์ข์€ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋กœ ๋ฏธ์„ธ์กฐ์ •ํ•˜๋ฉด ๋ฐ”๋กœ ๊ทธ ๋Šฅ๋ ฅ์ด ์‚ฌ๋ผ์ง„๋‹ค(catastrophic forgetting). ChatVLA(Zhou et al. 2025b)๋Š” ์›์ธ์„ ๋‘˜๋กœ ์ง„๋‹จํ•œ๋‹ค โ€” spurious forgetting(๋กœ๋ด‡ ๋ฐ์ดํ„ฐ ํ•™์Šต์ด ์‹œ๊ฐ-ํ…์ŠคํŠธ ์ •๋ ฌ์„ ๋ฎ์–ด์”€)๊ณผ task interference(์ œ์–ด์™€ ์ดํ•ด์˜ ๋ชฉ์ ์ด ๊ฒฝ์Ÿ). ๋Œ€์‘์€ ๋„ค ๊ฐˆ๋ž˜๋กœ ๊ฐˆ๋ฆฐ๋‹ค:

  • ์•„ํ‚คํ…์ฒ˜ ๊ฒฉ๋ฆฌ: MoE๋กœ ํ•œ ๋ชจ๋ธ ์•ˆ์— โ€œ์ „๋ฌธ๊ฐ€โ€๋ฅผ ๋ถ„๋ฆฌ(ChatVLA, ChatVLA-2).
  • ํ•™์Šต ๋™์—ญํ•™ ๋ณดํ˜ธ: Driess et al. (2026)์˜ knowledge insulation โ€” action expert์—์„œ VLM ๋ฐฑ๋ณธ์œผ๋กœ ๊ฐ€๋Š” ๊ทธ๋ž˜๋””์–ธํŠธ๋ฅผ ๋Š๊ณ , ๋Œ€์‹  ์ด์‚ฐํ™”๋œ ํ–‰๋™์— ๋Œ€ํ•œ ์ž๊ธฐํšŒ๊ท€ ๋‹ค์Œ ํ† ํฐ ์˜ˆ์ธก ์†์‹ค์„ ๋ณ‘๋ ฌ ํ•™์Šต ์‹ ํ˜ธ๋กœ ์ค€๋‹ค. MoE๊ฐ€ ๊ทธ๋ž˜ํ”„์˜ โ€œ๋ชจ๋ธ ๊ตฌ์กฐโ€๋ฅผ ๋ฐ”๊พธ๋Š” ๋ฐ˜๋ฉด ์ด์ชฝ์€ โ€œํ•™์Šต ๊ทธ๋ž˜ํ”„โ€๋ฅผ ๋ฐ”๊พผ๋‹ค.
  • ๋ฐ์ดํ„ฐ ์ค‘์‹ฌ co-training: InstructVLA(Yang et al. 2025e)๋Š” catastrophic forgetting์ด ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ์…‹์˜ ์ง€์‹œ ๋‹ค์–‘์„ฑ ๋ถ€์กฑ์—์„œ ์•…ํ™”๋œ๋‹ค๊ณ  ๋ณด๊ณ  ๋‹ค์–‘ํ•œ ์ง€์‹œยท์บก์…˜ยทQA ๋ฐ์ดํ„ฐ์…‹์„ ํ๋ ˆ์ด์…˜ํ•œ๋‹ค. GR-3(Cheang et al. 2025)๋Š” ์›น ๊ทœ๋ชจ ๋น„์ „-์–ธ์–ด ๋ฐ์ดํ„ฐ์™€์˜ ๋Œ€๊ทœ๋ชจ co-training์œผ๋กœ ๊ฐ™์€ ํšจ๊ณผ๋ฅผ ๋‚ธ๋‹ค.
  • ์ถ”๋ก  ์‹ ํ˜ธ ์ฃผ์ž…: DiffusionVLA(Wen et al. 2025c)์˜ โ€œreasoning injection moduleโ€์ด ์ž๊ธฐ์ƒ์„ฑ ํ…์ŠคํŠธ ์ถ”๋ก ์„ ํ™•์‚ฐ ์ •์ฑ…์— ์ž„๋ฒ ๋”ฉํ•œ๋‹ค.

๋‚ด๋ถ€ ์›”๋“œ๋ชจ๋ธ: Seer(Tian et al. 2025)๊ฐ€ ๋ฏธ๋ž˜ ์‹œ๊ฐ ์ƒํƒœ๋ฅผ ์˜ˆ์ธกํ•˜๊ณ  ์—ญ๋™์—ญํ•™์œผ๋กœ ํ–‰๋™์„ ์ •ํ•˜๋Š” ํŒจ๋Ÿฌ๋‹ค์ž„์„ ์„ธ์› ๊ณ , CoT-VLA(Zhao et al. 2025)๋Š” ์„œ๋ธŒ๊ณจ ์ด๋ฏธ์ง€๋ฅผ ๋ช…์‹œ์  ์ถ”๋ก  ๋‹จ๊ณ„๋กœ ์ƒ์„ฑํ•œ๋‹ค(โ€œthink visuallyโ€). WorldVLA(Cen et al. 2025)๋Š” ์•ก์…˜ ๋ชจ๋ธ๊ณผ ์›”๋“œ๋ชจ๋ธ์„ ํ•˜๋‚˜์˜ ์ž๊ธฐํšŒ๊ท€ ํ”„๋ ˆ์ž„์›Œํฌ๋กœ ์–‘๋ฐฉํ–ฅ ๊ฒฐํ•ฉํ•œ๋‹ค(์ƒํƒœ+๋ชฉํ‘œโ†’ํ–‰๋™, ์ƒํƒœ+ํ–‰๋™โ†’๋‹ค์Œ ์‹œ๊ฐ ์ƒํƒœ). ํ”ฝ์…€ ์˜ˆ์ธก์˜ ๋น„ํšจ์œจ(์ •์  ๋ฐฐ๊ฒฝ ๊ฐ™์€ ๋ฌด๊ด€ ์ •๋ณด ํฌํ•จ)์— ๋Œ€ํ•ด DreamVLA(Zhang et al. 2026b)๋Š” ํ”ฝ์…€ ๋Œ€์‹  ์••์ถ•๋œ โ€œworld embeddingโ€ ์„ ์˜ˆ์ธกํ•˜๊ณ  ๋ธ”๋ก ๋‹จ์œ„ ๊ตฌ์กฐํ™” ์–ดํ…์…˜์œผ๋กœ ์ง€์‹ ์ข…๋ฅ˜๋ฅผ ๋ถ„๋ฆฌํ•œ๋‹ค.

๊ด€๋ จ: โ€œํ”ฝ์…€ ์žฌ๊ตฌ์„ฑ ๋Œ€์‹  ์˜๋ฏธ์  ์งˆ์˜์‘๋‹ต์œผ๋กœ ์„ธ๊ณ„๋ฅผ ๋ชจ๋ธ๋งํ•œ๋‹คโ€๋Š” ๋Œ€์•ˆ์  ์ ‘๊ทผ์€ Semantic World Models ๋ฆฌ๋ทฐ์—์„œ ๋ณผ ์ˆ˜ ์žˆ๋‹ค. Sec. 9.2์˜ ์›”๋“œ๋ชจ๋ธ ๋…ผ์Ÿ๊ณผ ํ•จ๊ป˜ ์ฝ์œผ๋ฉด ์ข‹๋‹ค.

7.4 Action โ€” ์ด์‚ฐ ํ† ํฐ์—์„œ ์—ฐ์† ์ฒญํฌ๋กœ

์ดˆ๊ธฐ VLA(OpenVLA ๋“ฑ)์˜ ์ด์‚ฐ ์•ก์…˜ ํ† ํฐ์€ ์—ฐ์† ๋™์ž‘์˜ ์ถฉ์‹ค๋„์™€ ๋ถ€๋“œ๋Ÿฌ์›€์„ ์ œํ•œํ–ˆ๋‹ค. ฯ€0(Black et al. 2025b)๋Š” ์‚ฌ์ „ํ•™์Šต VLM ๋ฐฑ๋ณธ์— ์ „์šฉ action expert๋ฅผ ๋ถ™์—ฌ flow matching์œผ๋กœ ์—ฐ์† ์•ก์…˜ ์ฒญํฌ(50 Hz ๊ถค์ )๋ฅผ ์ƒ์„ฑํ•œ๋‹ค โ€” ์ •๋ฐ€๋„ ๋ฌธ์ œ๋Š” ํ’€์ง€๋งŒ ํ•™์Šต ์—ฐ์‚ฐ ๋น„์šฉ์ด ๋Š˜๊ณ , ์„œ๋ฒ ์ด Table 5์˜ ํ‘œํ˜„์œผ๋กœ๋Š” โ€œ๋Œ€๊ทœ๋ชจยท๋‹ค์–‘ํ•œ ํ•™์Šต ๋ฐ์ดํ„ฐ(10,000์‹œ๊ฐ„)โ€ ๋ฅผ ์š”๊ตฌํ•œ๋‹ค.

ํšจ์œจ ์ชฝ์—์„œ๋Š” Pertsch et al. (2025)์˜ ์ง„๋‹จ์ด ๋‚ ์นด๋กญ๋‹ค: ์ž๊ธฐํšŒ๊ท€ VLA์˜ ์ €์กฐํ•œ ์„ฑ๋Šฅ์€ ์—ฐ์† ์•ก์…˜ ํ† ํฐ๋“ค์ด ์„œ๋กœ ๋งค์šฐ ์ƒ๊ด€๋˜์–ด ๋‹ค์Œ ํ† ํฐ ์˜ˆ์ธก์ด ์•ฝํ•œ ํ•™์Šต ์‹ ํ˜ธ๊ฐ€ ๋˜๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. FAST(Frequency-space Action Sequence Tokeniser)๋Š” ์ด์‚ฐ ์ฝ”์‚ฌ์ธ ๋ณ€ํ™˜์œผ๋กœ ์•ก์…˜ ์‹œํ€€์Šค๋ฅผ ์ฃผํŒŒ์ˆ˜ ์˜์—ญ์—์„œ ์••์ถ•ํ•ด ์‹œ๊ฐ„์  ์ค‘๋ณต์„ ์ œ๊ฑฐํ•˜๊ณ , ์„œ๋ฒ ์ด ์ธ์šฉ์— ๋”ฐ๋ฅด๋ฉด ฯ€0 flow matching๊ณผ ๋™๋“ฑํ•œ ์„ฑ๋Šฅ์„ ์ตœ๋Œ€ 5๋ฐฐ ์งง์€ ํ•™์Šต ์‹œ๊ฐ„์œผ๋กœ ๋‹ฌ์„ฑํ•œ๋‹ค. ฯ€0.5(Black et al. 2025a)๋Š” ์‚ฌ์ „ํ•™์Šต์—” FAST ํ† ํฌ๋‚˜์ด์ €๋ฅผ, ํ›„ํ•™์Šต์—” flow-matching action expert๋ฅผ ์จ ์ด์‚ฐยท์—ฐ์†์„ ํ•จ๊ป˜ ํ•™์Šตํ•˜๊ณ , ๋Ÿฐํƒ€์ž„์—๋Š” ๊ณ ์ˆ˜์ค€ ์„œ๋ธŒํƒœ์Šคํฌ(ํ…์ŠคํŠธ)๋ฅผ ๋จผ์ € ์˜ˆ์ธกํ•œ ๋’ค ์—ฐ์† ๋ช…๋ น์œผ๋กœ ์ •์ œํ•œ๋‹ค. Discrete Diffusion VLA(Liang et al. 2025)๋Š” ์•„์˜ˆ ์•ก์…˜ ์ฒญํฌ๋ฅผ ๋‹จ์ผ ํŠธ๋žœ์Šคํฌ๋จธ ์•ˆ์˜ ์ด์‚ฐ ํ™•์‚ฐ ๊ณผ์ •์œผ๋กœ ๋ชจ๋ธ๋งํ•ด VLM ๋ฐฑ๋ณธ๊ณผ ๋™์ผํ•œ ๊ต์ฐจ์—”ํŠธ๋กœํ”ผ ๋ชฉ์ ์„ ๊ณต์œ ํ•œ๋‹ค.

๊ด€๋ จ: ฯ€0์˜ ์› ๋…ผ๋ฌธ ๋ฆฌ๋ทฐ๋Š” ฯ€0 ๋ฆฌ๋ทฐ์— ์žˆ๋‹ค. VLA์— ์˜จ๋ผ์ธ RL์„ ๋ถ™์—ฌ ์ •๋ฐ€๋„๋ฅผ ์˜ฌ๋ฆฌ๋Š” ํ๋ฆ„์€ RL Token ๋ฆฌ๋ทฐ ์ฐธ๊ณ .

7.5 Adaptation โ€” ๋ฐฐํฌ ๊ฐ€๋Šฅ์„ฑ์˜ ๋ฌธ์ œ

OpenVLA-OFT(Kim et al. 2025b)๊ฐ€ ๋Œ€ํ‘œ๋‹ค. ๋ณ‘๋ ฌ ๋””์ฝ”๋”ฉ + action chunking + ์—ฐ์† ์•ก์…˜ ์˜ˆ์ธก(L1 ํšŒ๊ท€)์œผ๋กœ LIBERO ์„ฑ๊ณต๋ฅ  20% ๊ฐœ์„ , OpenVLA ๋Œ€๋น„ ์ œ์–ด ์ฃผํŒŒ์ˆ˜ 26๋ฐฐ(Sec. 7.5 ๋ณธ๋ฌธ)๋ฅผ ๋ณด๊ณ ํ•œ๋‹ค. ๊ฐ™์€ ๋…ผ๋ฌธ์— ๋Œ€ํ•ด Table 5๋Š” โ€œ์ถ”๋ก  ์†๋„ 25โ€“50ร— ๊ฐœ์„ โ€ ์ด๋ผ๊ณ  ์ ๋Š”๋ฐ, ๋‘ ์ˆ˜์น˜๋Š” ์ธก์ • ๋Œ€์ƒ์ด ๋‹ค๋ฅด๋ฏ€๋กœ(์ œ์–ด ์ฃผํŒŒ์ˆ˜ vs ์ถ”๋ก  ์†๋„) ๋ชจ์ˆœ์€ ์•„๋‹ˆ๋‚˜ ์ธ์šฉํ•  ๋•Œ ๊ตฌ๋ถ„์ด ํ•„์š”ํ•˜๋‹ค. ControlVLA(Li et al. 2025c)๋Š” ๋ฌผ์ฒด ์ค‘์‹ฌ ํ‘œํ˜„์„ zero-initialized layer๋กœ ์ฃผ์ž…ํ•ด 10โ€“20๊ฐœ ์‹œ์—ฐ๋งŒ์œผ๋กœ ์ƒˆ ๋ฌผ์ฒดยท๋ฐฐ๊ฒฝ์— ์ ์‘ํ•œ๋‹ค(GroundingDINOยทSAM2 ๊ฐ™์€ ์™ธ๋ถ€ ์‹œ๊ฐ ๋ชจ๋ธ์— ์˜์กด, ํ‰๊ฐ€๊ฐ€ ๋‹จ์ผ ํŒ” ์‹ค๋‚ด๋กœ ํ•œ์ •). ํ›„ํ•™์Šต ๊ณ„์—ด๋กœ ConRFT(Chen et al. 2025g)์™€ RIPT-VLA(Tan et al. 2025)๊ฐ€ ํƒœ์Šคํฌ ๋ณด์ƒยท์˜จ๋ผ์ธ ์ƒํ˜ธ์ž‘์šฉยท์‚ฌ๋žŒ ๊ฐœ์ž…์œผ๋กœ ์‹คํŒจ๋ฅผ ๊ต์ •ํ•œ๋‹ค.

Table 5 & Table 10 โ€” VLA ๊ณ„์—ด ์ •๋ฆฌ (์›๋ฌธ ํ‘œ ์žฌํ˜„)

Method ์ตœ์ ํ™” ๋ฐฉํ–ฅ ํ•ต์‹ฌ ๋ฉ”์ปค๋‹ˆ์ฆ˜ ์žฅ์  ๋‹จ์ 
EgoVLA (Yang et al. 2025d) Perception 1์ธ์นญ ์‚ฌ๋žŒ ์˜์ƒ์œผ๋กœ ํ–‰๋™ ์˜ˆ์ธก ์‚ฌ์ „ํ•™์Šต ํ›„ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋กœ ๋ฏธ์„ธ์กฐ์ • ๋Œ€๊ทœ๋ชจยท๊ณ ๋น„์šฉ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ ์ˆ˜์ง‘ ์˜์กด์„ ํฌ๊ฒŒ ๋‚ฎ์ถค ์‚ฌ๋žŒโ†”๏ธŽ๋กœ๋ด‡ โ€œembodiment gapโ€์„ ๋ฉ”์šธ ๊ฐ•๊ฑดํ•œ ์•ก์…˜ ๋ฆฌํƒ€๊ฒŒํŒ… ํ•„์ˆ˜
BridgeVLA (Li et al. 2026b) Perception 3D ํฌ์ธํŠธํด๋ผ์šฐ๋“œ๋ฅผ ๋‹ค์ค‘๋ทฐ 2D๋กœ ํˆฌ์˜ํ•˜๊ณ  2D ํžˆํŠธ๋งต์œผ๋กœ ํ–‰๋™ ์˜ˆ์ธก ๋งค์šฐ ๋†’์€ ์ƒ˜ํ”Œ ํšจ์œจ(ํƒœ์Šคํฌ๋‹น 3๊ถค์ ), ์‹œ๊ฐ ๊ต๋ž€ยท์ƒˆ ์ง€์‹œ์— ๊ฐ•๊ฑด 2D ์ •์‚ฌ์˜์—์„œ ๋ชฉํ‘œ ํ‚คํฌ์ธํŠธ ๊ฐ€๋ฆผ, ๋ณต์žกํ•œ ๋‹ค๋‹จ๊ณ„ ์žฅ๊ธฐ ํƒœ์Šคํฌ์—์„œ ์„ฑ๋Šฅ ํ•˜๋ฝ
CoT-VLA (Zhao et al. 2025) Reasoning ์ค‘๊ฐ„ ์„œ๋ธŒ๊ณจ ์ด๋ฏธ์ง€๋ฅผ ์‹œ๊ฐ์  chain-of-thought๋กœ ์ž๊ธฐํšŒ๊ท€ ์ƒ์„ฑ ๋ชฉํ‘œ ์ƒํƒœ๋ฅผ ๋ช…์‹œ์ ์œผ๋กœ ์‹œ๊ฐํ™”ํ•ด ๋‹ค๋‹จ๊ณ„ ์ถ”๋ก ยท๋ณต์žก ์ง€์‹œ ์ˆ˜ํ–‰ ๊ฐœ์„  ์ด๋ฏธ์ง€ ํ† ํฐ ์ƒ์„ฑ์˜ ํฐ ์—ฐ์‚ฐ ๋ถ€๋‹ด, OOD ์„œ๋ธŒ๊ณจ ํ•ฉ์„ฑ์— ์ทจ์•ฝ
MemoryVLA (Shi et al. 2026) Reasoning ํƒœ์Šคํฌ ๋งฅ๋ฝยท์‹œ๊ฐ ์ด๋ ฅ์„ ์œ ์ง€ํ•˜๋Š” ๋ช…์‹œ์  ๋ฉ”๋ชจ๋ฆฌ ์žฅ๊ธฐ ํƒœ์Šคํฌ์˜ ๋งฅ๋ฝ ์†์‹ค ์™„ํ™” ์ปค์ง€๋Š” ๋ฉ”๋ชจ๋ฆฌ ๋ฒ„ํผ์˜ ๊ด€๋ฆฌยท๊ฒ€์ƒ‰์ด ๊ตฌ์กฐ์ ยท์—ฐ์‚ฐ์  ๋ถ€๋‹ด
ฯ€0 (Black et al. 2025b) Action ์‚ฌ์ „ํ•™์Šต VLM์— flow-matching action expert๋ฅผ ๋ถ™์—ฌ ๊ณ ์ฃผํŒŒ ์—ฐ์† ํ–‰๋™ ์ถœ๋ ฅ ์˜๋ฏธ ์ถ”๋ก ๊ณผ ์ •๋ฐ€ ์—ฐ์† ๋ชจํ„ฐ ์ œ์–ด๋ฅผ ์—ฐ๊ฒฐ, ๊ณ ๋‚œ๋„ ๋‹ค๋‹จ๊ณ„ ํƒœ์Šคํฌ ๊ฐ€๋Šฅ ๋ฐฉ๋Œ€ํ•˜๊ณ  ๋‹ค์–‘ํ•œ ํ•™์Šต ๋ฐ์ดํ„ฐ ํ•„์š”(10,000์‹œ๊ฐ„)
ControlVLA (Li et al. 2025c) Adaptation ๋ฌผ์ฒด ์ค‘์‹ฌ ํ‘œํ˜„์„ zero-initialized layer๋กœ ์ฃผ์ž… ๋งค์šฐ ๋ฐ์ดํ„ฐ ํšจ์œจ์ (10โ€“20 ์‹œ์—ฐ), ๋ฏธํ•™์Šต ๋ฌผ์ฒดยท๋ฐฐ๊ฒฝ์— ๊ฐ•๊ฑด ์™ธ๋ถ€ ์‹œ๊ฐ ๋ชจ๋ธ(GroundingDINO, SAM2) ์˜์กด, ํ‰๊ฐ€๊ฐ€ ๋‹จ์ผ ํŒ” ์‹ค๋‚ด๋กœ ํ•œ์ •
OpenVLA-OFT (Kim et al. 2025b) Adaptation ์ž๊ธฐํšŒ๊ท€ ์ด์‚ฐ ์˜ˆ์ธก์„ ๋ณ‘๋ ฌ ๋””์ฝ”๋”ฉยทaction chunkingยท์—ฐ์† L1 ํšŒ๊ท€๋กœ ๋Œ€์ฒด ์ถ”๋ก  ์†๋„ 25โ€“50ร— ๊ฐœ์„ , ์‹ค์‹œ๊ฐ„ ์ œ์–ด ์ง€์—ฐ ๊ฐ์†Œ, ์„ฑ๊ณต๋ฅ ๋„ ์ƒ์Šน ๋ณต์žกํ•œ ๋ฉ”๋ชจ๋ฆฌ ์˜์กด ํƒœ์Šคํฌ์— ์ทจ์•ฝ, ๊ณ ๋„๋กœ ๋‹ค์ค‘๋ชจ๋“œ์ธ ํ–‰๋™ ๋ถ„ํฌ ๋ชจ๋ธ๋ง ์—ญ๋Ÿ‰ ๋ถ€์กฑ ๊ฐ€๋Šฅ

(์›๋ฌธ Table 5์˜ โ€œAdaptatingโ€ ํ‘œ๊ธฐ๋Š” ์˜คํƒ€๋กœ ๋ณด์ด๋ฉฐ, ์—ฌ๊ธฐ์„œ๋Š” Adaptation์œผ๋กœ ์˜ฎ๊ฒผ๋‹ค.)

๋ถ€๋ก Table 10์€ ์œ„ ๊ณ„์—ด์„ ์„ค๊ณ„ ์ฐจ์›์˜ ์ฒดํฌ๋ฐ•์Šค ํ‘œ๋กœ ํ™•์žฅํ•œ๋‹ค. ๊ด€์ธก(RGB/D/ROB/TX), ์•ก์…˜ ์ƒ์„ฑ(FM/DM/AR/DP), VLM ์ •์ฑ… ๋ฉ”์ปค๋‹ˆ์ฆ˜(CoT/Future Prediction/Memory), ์‚ฌ์ „ํ•™์Šต(Multiple Datasets / Cross-embodiment), ํ‰๊ฐ€ ์‹œ๋‚˜๋ฆฌ์˜ค(Multi-scenario / Real World / Cross-embodiment Execution)๋ฅผ ํ•œ ๋ˆˆ์— ๋Œ€์กฐํ•œ๋‹ค. ์ด ํ‘œ๋ฅผ ํ›‘์œผ๋ฉด CoT๋ฅผ ์“ฐ๋Š” VLA๋Š” ์•„์ง ์†Œ์ˆ˜์ด๊ณ , Future Prediction์€ โ€œReasoning & World Modelsโ€ ๊ทธ๋ฃน์— ๋ชฐ๋ ค ์žˆ์œผ๋ฉฐ, ๋Œ€๋ถ€๋ถ„์ด RGB+ROB+TX๋ผ๋Š” ๋™์ผํ•œ ๊ด€์ธก ์กฐํ•ฉ์— ์ˆ˜๋ ดํ•œ๋‹ค๋Š” ์‚ฌ์‹ค์ด ๋ฐ”๋กœ ๋ณด์ธ๋‹ค.


VLA ์„ค๊ณ„ ์ฐจ์› ๋Œ€์กฐํ‘œ(Table 10, ๋ถ€๋ก A) โ€” ์ตœ์ ํ™” ๋ฐฉํ–ฅ๋ณ„๋กœ 35๊ฐœ ๋ชจ๋ธ์„ ๊ด€์ธกยท์•ก์…˜ ์ƒ์„ฑยทVLM ์ •์ฑ…ยท์‚ฌ์ „ํ•™์Šตยทํ‰๊ฐ€ ์‹œ๋‚˜๋ฆฌ์˜ค๋กœ ์ •๋ฆฌํ•œ๋‹ค. Time ์—ด์˜ ์ตœ์‹  ํ•ญ๋ชฉ์€ 2025-09(ForceVLA)๋‹ค.

์ง๊ตํ•˜๋Š” 5์ถ• ๋น„๊ต ๋ถ„์„ (Sec. 8)

์—ฌ๊ธฐ๋ถ€ํ„ฐ๊ฐ€ โ€œ์ด ์„œ๋ฒ ์ด๋ฅผ ์ฝ๋Š” ์ด์œ โ€์˜ ํ›„๋ฐ˜๋ถ€๋‹ค. ๊ธฐ๋Šฅ์  ๋ถ„๋ฅ˜๋Š” what role์„ ๋งํ•ด์ฃผ์ง€๋งŒ, ๋ฐฐ์น˜ ๊ฐ€๋Šฅ์„ฑ์€ ๋‹ค๋ฅธ ์ถ•์—์„œ ๊ฒฐ์ •๋œ๋‹ค.

8.1 Action granularity โ€” skill / trajectory / low-level

  • Skill-level: ์‚ฌ์ „ ์ •์˜๋œ ์Šคํ‚ฌ์ด๋‚˜ API๋ฅผ ๋ถ€๋ฅธ๋‹ค(SayCan, Code as Policies, Inner Monologue, ReKep, TAMP ๊ณ„์—ด). ์–ธ์–ด์™€ ์ž˜ ๋งž๋Š”๋‹ค(โ€œ์Šคํ‚ฌ์€ ์ž์—ฐ์–ด ๋‹จ์œ„โ€). ์ฃผ ์‹คํŒจ ์–‘์ƒ์€ skill library uncoverage โ€” ์ •์ฑ…์ด ์š”๊ตฌํ•œ ํ”„๋ฆฌ๋ฏธํ‹ฐ๋ธŒ๊ฐ€ ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ์— ์—†๋‹ค. ๋Œ€์‘์€ affordance/value ํ•„ํ„ฐ, ์ƒ์„ฑ ์ฝ”๋“œ์˜ ์Šคํ‚ค๋งˆ ๊ฒ€์ฆ, ์žฅ๋ฉด ์ธ์ง€ ์„ฑ๊ณต ๊ฒ€์‚ฌ + ์žฌ๊ณ„ํš.
  • Trajectory-level: ์—”๋“œ์ดํŽ™ํ„ฐ ์›จ์ดํฌ์ธํŠธยท๊ถค์ ์„ ๋‚ธ๋‹ค(๋Œ€๋ถ€๋ถ„์˜ ์–ธ์–ด ์กฐ๊ฑด IL, ํ™•์‚ฐ ์ •์ฑ…). ํ‘œํ˜„๋ ฅ๊ณผ ์–ธ์–ด ์กฐ๊ฑดํ™”์˜ ๊ท ํ˜•์ . ์ฃผ ์‹คํŒจ ์–‘์ƒ์€ covariate shift๋กœ ์ธํ•œ ๊ถค์  ํ‘œ๋ฅ˜์™€ compounding error, ๋Œ€์‘์€ receding-horizon ์žฌ๊ณ„ํš๊ณผ ๊ฐœ์ž… ๊ธฐ๋ฐ˜ ๋ฐ์ดํ„ฐ ์ง‘๊ณ„.
  • Low-level control: 100 Hz+ ๊ด€์ ˆ ํ† ํฌ/์†๋„. ์ ‘์ด‰์ด ์ง€๋ฐฐํ•˜๋Š” ๊ณผ์ œ(์ •๊ต ์กฐ์ž‘, ๋ณ€ํ˜•์ฒด)์— ํ•„์š”ํ•˜๋‹ค. EUREKA๊ฐ€ ํŽœ ์Šคํ”ผ๋‹ ๊ฐ™์€ ์ €์ˆ˜์ค€ ์Šคํ‚ฌ์˜ ๋ณด์ƒ์„ ์ง„ํ™”์ ์œผ๋กœ ๋งŒ๋“ค๊ณ , Bi-LAT(Kobayashi et al. 2025)๋Š” ์–‘์ธก ์ œ์–ด(bilateral control) ์›๊ฒฉ์กฐ์ž‘์œผ๋กœ ์œ„์น˜ยท์†๋„๋ฟ ์•„๋‹ˆ๋ผ ๊ด€์ ˆ ํ† ํฌ๊นŒ์ง€ ๊ธฐ๋กํ•ด โ€œsoftly/strongly twist the spongeโ€ ๊ฐ™์€ ์ง€์‹œ๊ฐ€ ํž˜ ์ถœ๋ ฅ์„ ๋ณ€์กฐํ•˜๊ฒŒ ํ•œ๋‹ค. ManiFoundation(Xu et al. 2024)์€ ์กฐ์ž‘์„ contact synthesis ๋ฌธ์ œ๋กœ ์žฌ์ •์‹ํ™”ํ•œ๋‹ค. TA-VLA(Zhang et al. 2025d)๋Š” โ€œํ† ํฌ ์ธ์ง€ VLAโ€์˜ ์„ค๊ณ„ ๊ณต๊ฐ„์„ ์ •๋ฆฌํ•œ๋‹ค โ€” (i) ํ† ํฌ ์‹ ํ˜ธ๋Š” ์•ก์…˜ ๋””์ฝ”๋”์— ๋„ฃ๋Š” ๊ฒƒ์ด ์ข‹๊ณ (๊ด€์ ˆ๊ฐ ๊ฐ™์€ ๊ณ ์œ ์ˆ˜์šฉ ์‹ ํ˜ธ์™€ ์ •๋ ฌ๋จ), (ii) ํ† ํฌ ์ด๋ ฅ์€ ๋‹จ์ผ ํ† ํฐ์œผ๋กœ ์š”์•ฝ ๊ฐ€๋Šฅํ•˜๋ฉฐ, (iii) ๋ฏธ๋ž˜ ํ† ํฌ ์˜ˆ์ธก ๋ณด์กฐ ํƒœ์Šคํฌ๊ฐ€ ์„ฑ๋Šฅ์„ ์˜ฌ๋ฆฐ๋‹ค.

์„œ๋ฒ ์ด๊ฐ€ ์งš๋Š”, ์™œ ๋Œ€๋ถ€๋ถ„์ด ์—ฌ์ „ํžˆ ๊ถค์  ์ˆ˜์ค€์— ๋จธ๋ฌด๋Š”๊ฐ€์— ๋Œ€ํ•œ ๋‹ต ๋‘ ๊ฐ€์ง€๊ฐ€ ์‹ค์šฉ์ ์ด๋‹ค: (a) ๋ฐ์ดํ„ฐ ๋ผ๋ฒจ๋ง โ€” ์ •ํ™•ํ•œ ํž˜ ์„ผ์‹ฑ๊ณผ ๊ด€์ ˆ๋ณ„ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜์ด ๋ถ™์€ ์‹œ๊ฐ„ ์ •๋ ฌ ํ† ํฌ ๋ผ๋ฒจ์€ ๋น„์‹ธ์ง€๋งŒ ๊ถค์ ์€ ์›๊ฒฉ์กฐ์ž‘์œผ๋กœ ์‰ฝ๊ฒŒ ์–ป๊ณ  ๋…ธ์ด์ฆˆ๋„ ์ ๋‹ค. (b) sim-to-real โ€” ๋งˆ์ฐฐยท์ปดํ”Œ๋ผ์ด์–ธ์Šคยท์•ก์ถ”์—์ดํ„ฐ ๋™์—ญํ•™ ์‹œ๋ฎฌ๋ ˆ์ด์…˜์ด ์–ด๋ ค์›Œ ํ† ํฌ ์ˆ˜์ค€ ์ •์ฑ…์€ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ๋ฌผ๋ฆฌ์— ๊ณผ์ ํ•ฉ๋˜์ง€๋งŒ, ๊ถค์  ์ถœ๋ ฅ์€ ๊ฐ•๊ฑดํ•œ ์ €์ˆ˜์ค€ ์ปจํŠธ๋กค๋Ÿฌ๊ฐ€ ์ถ”์ข…ํ•ด ์ฃผ๋ฉด ์ „์ด๊ฐ€ ๋งค๋„๋Ÿฝ๋‹ค.

8.2 Data and supervision regimes

๋ฐ์ดํ„ฐ ์†Œ์Šค๋Š” (i) ๋กœ๋ด‡ ์ƒํ˜ธ์ž‘์šฉ ๋ฐ์ดํ„ฐ, (ii) ์›น ๊ทœ๋ชจ ๋ฐ์ดํ„ฐ๋กœ ๋‚˜๋‰˜๊ณ , ์ „์ž๋Š” ๋‹ค์‹œ ์ „๋ฌธ๊ฐ€ ์‹œ์—ฐ(RT-1์˜ 130k ์‹œ์—ฐ ๋“ฑ, ๊ณ ํ’ˆ์งˆ์ด์ง€๋งŒ ๋น„์‹ธ๋‹ค)๊ณผ ๋น„๊ตฌ์กฐ์  play data(๋ผ๋ฒจ ์—†์ด ์ž์œ ๋กญ๊ฒŒ ์ƒํ˜ธ์ž‘์šฉํ•œ ๋กœ๊ทธ, ์‚ฌํ›„์— ์–ธ์–ด๋กœ relabelingํ•ด ์“ด๋‹ค โ€” Learning from Play, MCIL์€ 1% ์–ธ์–ด ๋ผ๋ฒจ๋กœ ํ•™์Šต)๋กœ ๊ฐˆ๋ฆฐ๋‹ค.

๊ฐ๋… ํ˜•ํƒœ๋Š” ์…‹์ด๋‹ค. Target labels(per-sample ์ •๋‹ต ๋ชจ์‚ฌ: RT-2, OpenVLA, Octo), Outcome evaluations(์‹คํ–‰์—์„œ ๋‚˜์˜จ ์Šค์นผ๋ผ: ์‚ฌ๋žŒ์ด ์ •์˜ํ•˜๊ฑฐ๋‚˜ VLM ์„ฑ๊ณต ๊ฐ์ง€๊ธฐยทLLM ๋ณด์ƒ ์ƒ์„ฑ์ด ๋งŒ๋“ ๋‹ค), Auxiliary supervision(visual attention: region-text alignmentยทkeypoint/graspability map / reconstruction: imageยทvideo ์žฌ๊ตฌ์„ฑ / future prediction: ๋‹ค์Œ ์ƒํƒœยทkeyframe ์˜ˆ์ธก). ๊ทธ๋ฆฌ๊ณ  ์•ž์„œ ๋ณธ \mathcal{L}_{\text{final}} = \lambda_1 \mathcal{L}_{\text{targets}} + \lambda_2 \mathcal{L}_{\text{evaluations}} + \lambda_3 \mathcal{L}_{\text{auxiliary}} ๋กœ ๋ฌถ์ธ๋‹ค. ์„ธ ๊ณ„์—ด์˜ ๊ฐ๋…์„ ํ•˜๋‚˜์˜ ๋ชฉ์ ํ•จ์ˆ˜์™€ ์ปค๋ฆฌํ˜๋Ÿผ์œผ๋กœ ํ†ตํ•ฉํ•œ ์„œ์ˆ ์€ ์ด ์„œ๋ฒ ์ด์˜ ๋…์ž์  ๊ธฐ์—ฌ์— ๊ฐ€๊น๋‹ค.

8.3 System cost and latency โ€” ์ด ์„œ๋ฒ ์ด์—์„œ ๊ฐ€์žฅ ์‹ค์šฉ์ ์ธ ํ‘œ

ํ•™์Šต ๋น„์šฉ์€ ์„ธ ์ „๋žต์œผ๋กœ ๋‚˜๋‰œ๋‹ค: from scratch(Gato์ฒ˜๋Ÿผ ํ† ํฐํ™”๋œ ์ด๋ฏธ์ง€ยทํ…์ŠคํŠธยทํ–‰๋™์„ ์ฒ˜์Œ๋ถ€ํ„ฐ โ€” ์—„์ฒญ๋‚œ ๋ฐ์ดํ„ฐยทGPU ์š”๊ตฌ), fine-tuning(RT-2๊ฐ€ PaLI-XยทPaLM-E ์œ„์— ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋ฅผ ์–น๋Š” ์‹ โ€” ์‚ฌ์ „ ์ง€์‹์„ ์‚ด๋ฆฌ์ง€๋งŒ ๊ณผ์ ํ•ฉยท๋ง๊ฐ์˜ ์œ„ํ—˜), prompt engineering(FM ๋™๊ฒฐ, ์ถ”๋ก  ์‹œ ํ”„๋กฌํ”„ํŠธ๋กœ๋งŒ โ€” ์ถ”๊ฐ€ ๋กœ๋ด‡ ํ•™์Šต์ด 0์ด๊ณ  ๊ฐœ๋ฐฉํ˜• ์ง€์‹์ด ๊ทธ๋Œ€๋กœ ์˜ค์ง€๋งŒ, ์ž„๋ฒ ๋””๋จผํŠธ์™€ ๋ถ„๋ฆฌ๋ผ ๊ฐœ๋ฃจํ”„ยทํ™˜๊ฐยท์žฅ๊ธฐ ํƒœ์Šคํฌ ์ทจ์•ฝ).


์ถ”๋ก  ๋น„์šฉยท์ง€์—ฐ(Table 6) โ€” ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜, ํ•˜๋“œ์›จ์–ด, ์ œ์–ด ์ฃผํŒŒ์ˆ˜, ํด๋ผ์šฐ๋“œ ์˜์กด ์—ฌ๋ถ€. โ€˜โ€“โ€™๋Š” ๋ฏธ๋ณด๊ณ ,โ€™*โ€™๋Š” ์•„ํ‚คํ…์ฒ˜์—์„œ ์ถ”๋ก ํ•œ ๊ฐ’, Cloud๋Š” ์›๊ฒฉ ์ปดํ“จํŠธ ์ถ”๋ก ์„ ๋œปํ•œ๋‹ค.

์ด ํ‘œ์˜ ๊ฐ’์€ ์ˆซ์ž๋ณด๋‹ค โ€œ๋ฌด์—‡์ด ๋น„์–ด ์žˆ๋Š”๊ฐ€โ€ ์— ์žˆ๋‹ค. RT-1(35M)์ด ~3Hz, RT-2(5B/55B)๊ฐ€ TPU์—์„œ 1โ€“3Hz, OpenVLA(7B)๊ฐ€ RTX 4090์—์„œ 3โ€“6Hz, CLIP-RT(1B)๊ฐ€ 8โ€“16Hz. ํ™•์‚ฐ ์ •์ฑ… ์ชฝ์€ Diffusion Policy(~200M*)๊ฐ€ ~1Hz, DP3(~150M*)๊ฐ€ 5โ€“6Hz, ManiCM(~200M*)์ด RTX 4090์—์„œ ~50โ€“60Hz. ๊ทธ๋Ÿฐ๋ฐ PaLM-SayCan(540B)๊ณผ PaLM-E(562B)์˜ ์ง€์—ฐ ์นธ์€ โ€˜โ€“โ€™(๋ฏธ๋ณด๊ณ ) ์ด๊ณ , ์—ฌ๋Ÿฌ ํ•ญ๋ชฉ์˜ ํ•˜๋“œ์›จ์–ด ์นธ๋„ ๋น„์–ด ์žˆ์œผ๋ฉฐ, ํ™•์‚ฐ ์ •์ฑ… ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜๋Š” ์ €์ž๋“ค์ด ์•„ํ‚คํ…์ฒ˜์—์„œ ์ถ”์ •ํ•œ ๊ฐ’์ด๋‹ค.

์ด ๊ณต๋ฐฑ์ด ๊ณง Sec. 9.3์˜ ์ฃผ์žฅ์œผ๋กœ ์ด์–ด์ง„๋‹ค. ์›๋ฌธ ํ‘œํ˜„์„ ๊ทธ๋Œ€๋กœ ์˜ฎ๊ธฐ๋ฉด: โ€œWe note that latency is not consistently treated as a first-class evaluation metric in the literature, and often it is mentioned only in footnotes. To assess real-world feasibility, we strongly encourage authors to report latency prominently as a primary performance metric.โ€ ์„œ๋ฒ ์ด๊ฐ€ ์ปค๋ฎค๋‹ˆํ‹ฐ์— ๋˜์ง€๋Š” ๊ฐ€์žฅ ๊ตฌ์ฒด์ ์ธ ์ œ์•ˆ์ด๊ณ , ์ด ํ‘œ๋Š” ๊ทธ ์ œ์•ˆ์˜ ์ฆ๊ฑฐ๋ฌผ์ด๋‹ค.

8.4 Environments and evaluations

์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ 6์ข…(Table 7: PyBullet, MuJoCo, CoppeliaSim, NVIDIA Omniverse, Unity, UniSim)๊ณผ ๋ฒค์น˜๋งˆํฌ 11์ข…์„ ์ •๋ฆฌํ•œ๋‹ค.


๋ฒค์น˜๋งˆํฌ ๋น„๊ต(Table 8) โ€” ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ/์‹ค๊ธฐ ๋ฐ์ดํ„ฐ์…‹, embodiment, ๋ฐ์ดํ„ฐ ๊ทœ๋ชจ, ๊ด€์ธก(RGB/Depth/Masks), ๋„๊ตฌ ์‚ฌ์šฉยท๋ฉ€ํ‹ฐ์—์ด์ „ํŠธยท์žฅ๊ธฐ ํƒœ์Šคํฌ ์ง€์› ์—ฌ๋ถ€. ์œ„์ชฝ 8๊ฐœ๋Š” ์‹œ๋ฎฌ๋ ˆ์ด์…˜, ์•„๋ž˜ 3๊ฐœ๋Š” ์‹ค๊ธฐ ๋ฐ์ดํ„ฐ์…‹์ด๋‹ค. (ARNOLD ํ–‰์˜ โ€œFramka Pandaโ€๋Š” ์›๋ฌธ ์˜คํƒ€)

๋ฒค์น˜๋งˆํฌ ์Šคํฌ๋ฆฐ์ƒท ๋ชจ์Œ(Fig. 17) โ€” ์œ„: CALVIN, Meta-world, RLbench, VIMAbench, LoHoRavens / ์•„๋ž˜: ARNOLD, RoboGen, Open X-Embodiment, DROID, Galaxea Open-world.

๋ณธ๋ฌธ์—์„œ ํ™•์ธ๋˜๋Š” ๊ทœ๋ชจ ์ˆ˜์น˜๋“ค: CALVIN์€ PyBullet ๊ธฐ๋ฐ˜ 4๊ฐœ ํ™˜๊ฒฝ 34๊ฐœ ํƒœ์Šคํฌ, ํ‰๊ฐ€ ์ง€ํ‘œ๊ฐ€ MTLC์™€ LH-MTLC ๋‘˜. Meta-World๋Š” MuJoCo ์œ„ 50๊ฐœ ํƒœ์Šคํฌ(ML10/ML45). RLBench๋Š” CoppeliaSim/V-REP ์œ„ 100๊ฐœ ํƒœ์Šคํฌ. VIMAbench๋Š” Ravens ๊ธฐ๋ฐ˜ 17๊ฐœ ํƒ์ƒ ํƒœ์Šคํฌ ํ…œํ”Œ๋ฆฟ, ์•ฝ 650,000 ์ „๋ฌธ๊ฐ€ ๊ถค์ , 4๋‹จ๊ณ„ ๊ณ„์ธต์  ํ‰๊ฐ€ ํ”„๋กœํ† ์ฝœ(๋ฌด์ž‘์œ„ ๋ฌผ์ฒด ๋ฐฐ์น˜ โ†’ ์™„์ „ํžˆ ์ƒˆ๋กœ์šด ํƒœ์Šคํฌ). LoHoRavens๋Š” ์žฅ๊ธฐ ํƒœ์Šคํฌ 10๊ฐœ. ARNOLD๋Š” Omniverse ์œ„ 8๊ฐœ ์–ธ์–ด ์กฐ๊ฑด ํƒœ์Šคํฌ, ๋ฌผ์ฒด 40์ข…ยท์žฅ๋ฉด 20๊ฐœ, 10,000 ์ „๋ฌธ๊ฐ€ ์‹œ์—ฐ. LIBERO๋Š” SPATIAL/OBJECT/GOAL/-100 ๋„ค ์Šค์œ„ํŠธ ์ด 130๊ฐœ ํƒœ์Šคํฌ. ์‹ค๊ธฐ ์ชฝ์€ Open X-Embodiment(21๊ฐœ ๊ธฐ๊ด€, 22๊ฐœ ๋กœ๋ด‡, 527 ์Šคํ‚ฌ, 160,266 ํƒœ์Šคํฌ, 2M+ ๊ถค์ ), DROID(76k ๊ถค์  โ‰ˆ 350์‹œ๊ฐ„, 564 ์žฅ๋ฉด, 52 ๊ฑด๋ฌผ, 86 ํƒœ์Šคํฌ, Franka + Robotiq 2F-85, ZED ์Šคํ…Œ๋ ˆ์˜ค 3๋Œ€), Galaxea Open-world(100k ๊ถค์  โ‰ˆ 500์‹œ๊ฐ„, 150 ํƒœ์Šคํฌ, 50 ์žฅ๋ฉด, 1,600+ ๋ฌผ์ฒด, 23-DoF Galaxea R1 Lite ์–‘ํŒ” ๋ชจ๋ฐ”์ผ).

๊ทธ๋ฆฌ๊ณ  ํƒœ์Šคํฌ ๊ณ„์—ด 3๋ถ„๋ฅ˜(Table 9)๋ฅผ ์ œ์•ˆํ•œ๋‹ค โ€” ์ด๊ฑด ๋ฒค์น˜๋งˆํฌ ์ ์ˆ˜ ํ•ด์„์šฉ ์žฅ์น˜๋‹ค.

ํƒœ์Šคํฌ ๊ณ„์—ด ์˜ˆ์‹œ ๋Œ€ํ‘œ ๋ฒค์น˜๋งˆํฌ ์ง€๋ฐฐ์  ๋‚œ์ด๋„
Object-centric ๋ฌผ์ฒด ์žฌ๋ฐฐ์น˜, ์Œ“๊ธฐ, ์ž์„ธ ์กฐ์ž‘ Meta-World, RLBench, VIMAbench ์‹œ๊ฐ-์–ธ์–ด ๊ทธ๋ผ์šด๋”ฉ, ๋‹จ๊ธฐ visuomotor ์ œ์–ด
Interaction-centric ๊ด€์ ˆ์ฒด ์กฐ์ž‘, ๋ณ€ํ˜•์ฒด ์กฐ์ž‘, ๋„๊ตฌ ๋งค๊ฐœ ์กฐ์ž‘ ARNOLD, RoboGen, Open X-Embodiment 3D ๊ณต๊ฐ„ ์ถ”๋ก , ํž˜ ์ œ์–ด, ์ด‰๊ฐ ํ”ผ๋“œ๋ฐฑ, ๋„๊ตฌ-๋ฌผ์ฒด affordance
Long-horizon ๋‹ค๋‹จ๊ณ„ ์žฌ๋ฐฐ์น˜, ๊ฐ€์‚ฌ, ๋ชจ๋ฐ”์ผ ์กฐ์ž‘ CALVIN, LoHoRavens, LIBERO, Open X-Embodiment, DROID, Galaxea Open-world ํƒœ์Šคํฌ ๋ถ„ํ•ด, ์„œ๋ธŒ๊ณจ ์‹œํ€€์‹ฑ, ๋ฉ”๋ชจ๋ฆฌ, ํ๋ฃจํ”„ ์žฌ๊ณ„ํš, ์‹คํŒจ ๋ณต๊ตฌ

์ €์ž๋“ค์˜ ๊ฒฝ๊ณ ๊ฐ€ ์ค‘์š”ํ•˜๋‹ค โ€” ์ด ์…‹์€ ์—„๊ฒฉํ•œ ๋‚œ์ด๋„ ์œ„๊ณ„๊ฐ€ ์•„๋‹ˆ๊ณ (๊ด€์ ˆ์ฒด ํƒœ์Šคํฌ๊ฐ€ ์žฅ๊ธฐ ๊ณ„ํš์„ ์š”๊ตฌํ•  ์ˆ˜๋„, ๋ณ€ํ˜•์ฒด ์กฐ์ž‘์ด ์งง์€ ๋‹ค๋‹จ๊ณ„ ๊ฐ•์ฒด ํƒœ์Šคํฌ๋ณด๋‹ค ์–ด๋ ค์šธ ์ˆ˜๋„ ์žˆ๋‹ค), ์ƒํ˜ธ๋ฐฐํƒ€์ ์ด์ง€๋„ ์•Š๋‹ค. ๋‹ค๋งŒ ๋ณด๊ณ ๋œ ์„ฑ๊ณต๋ฅ ์„ ํ•ด์„ํ•˜๋Š” ๋ Œ์ฆˆ๋กœ ์“ธ ์ˆ˜ ์žˆ๋‹ค: object-centric ๋ฒค์น˜๋งˆํฌ์˜ ์ข‹์€ ์„ฑ์ ์€ ์‹œ๊ฐ-์–ธ์–ด ๊ทธ๋ผ์šด๋”ฉ๊ณผ ๋‹จ๊ธฐ ์ œ์–ด๋ฅผ ์ž…์ฆํ•  ๋ฟ์ด๊ณ , ๋ฌผ๋ฆฌ ์ƒํ˜ธ์ž‘์šฉ ๋ชจ๋ธ๋งยท๋ฉ”๋ชจ๋ฆฌยทํ๋ฃจํ”„ ๊ฐ•๊ฑด์„ฑ์€ ๋‹ค๋ฅธ ๊ณ„์—ด์—์„œ๋งŒ ๊ฒ€์ฆ๋œ๋‹ค.

๋™์‹œ์— ์„œ๋ฒ ์ด๋Š” โ€œ์–ธ์–ด ๊ทธ๋ผ์šด๋”ฉ๊ณผ ๋งฅ๋ฝ ์ดํ•ด๊ฐ€ ์„ฑ๋Šฅ์— ์–ผ๋งˆ๋‚˜ ๊ธฐ์—ฌํ•˜๋Š”์ง€๋ฅผ ๊ณต์ •ํ•˜๊ฒŒ ์ •๋Ÿ‰ํ™”ํ•  ํ†ตํ•ฉ ํ‰๊ฐ€ ํ”„๋กœํ† ์ฝœ์ด ์•„์ง ์—†๋‹คโ€ ๊ณ  ๋ช…์‹œํ•œ๋‹ค. ํ˜„ํ–‰ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ํƒœ์Šคํฌ ์„ฑ๊ณต๋ฅ ์— ์ง‘์ค‘ํ•ด ์˜๋ฏธ ์ดํ•ด์™€ ํƒœ์Šคํฌ ๊ฐ„ ์ง€์‹ ์ „์ด๋ฅผ ๋†“์นœ๋‹ค๋Š” ์ง„๋‹จ์ด๋‹ค.

๊ด€๋ จ: ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐยท๋ฐ์ดํ„ฐ์…‹ยท๋ฒค์น˜๋งˆํฌ๋ฅผ ํ•˜๋‚˜์˜ ํ”Œ๋žซํผ์œผ๋กœ ํ†ตํ•ฉํ•˜๋ ค๋Š” ์ตœ๊ทผ ์‹œ๋„๋Š” RoboVerse ๋ฆฌ๋ทฐ์—์„œ ๋ณผ ์ˆ˜ ์žˆ๋‹ค(์ด ์„œ๋ฒ ์ด์˜ Table 7ยท8์—๋Š” ํฌํ•จ๋ผ ์žˆ์ง€ ์•Š๋‹ค).

8.5 Task specification โ€” ์–ธ์–ด vs ์ด๋ฏธ์ง€/์˜์ƒ

์ด ์ ˆ์ด ์ด ์„œ๋ฒ ์ด์—์„œ ๊ฐ€์žฅ ๊ท ํ˜• ์žกํžŒ ๋Œ€๋ชฉ์ด๋‹ค. ์ €์ž๋“ค์€ ์–ธ์–ด๋ฅผ ๊ฒฝ์Ÿ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๊ฐ€ ์•„๋‹ˆ๋ผ ์ƒ๋ณด ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๋กœ ๋†“๊ณ , ์„ธ ๊ธฐ๋Šฅ์  ์—ญํ• (state evaluation / policy condition / cognitive planning) ๊ฐ๊ฐ์—์„œ ์–ธ์–ด์™€ ์‹œ๊ฐ ์กฐ๊ฑดํ™”๋ฅผ ๋‚˜๋ž€ํžˆ ๋น„๊ตํ•œ๋‹ค.

  • ์ƒํƒœ ํ‰๊ฐ€: ์ด๋ฏธ์ง€/์˜์ƒ์€ ์•”๋ฌต์ ยท๋ฐ€์ง‘ ์ง„ํ–‰ ์‹ ํ˜ธ๋ฅผ ์ค€๋‹ค(XIRL์ด ์˜์ƒ์—์„œ ์‹œ๊ฐ„์  ์ง„ํ–‰๋„๋ฅผ ๋ฐฐ์šด๋‹ค). ์„ฑ๊ณต์ด โ€œํŽ˜๊ทธ๊ฐ€ ์‚ฝ์ž…๋๋Š”๊ฐ€โ€, โ€œ๊ธฐ์–ด๊ฐ€ ์ •๋ ฌ๋๋Š”๊ฐ€โ€์ฒ˜๋Ÿผ ์ง€๊ฐ ๊ฐ€๋Šฅํ•œ ๋ฌผ๋ฆฌ ์ƒํƒœ๋กœ ์ •์˜๋  ๋•Œ ๊ฐ•ํ•˜๋‹ค. ๋ฐ˜๋Œ€๋กœ ์–ธ์–ด๋Š” ๋ช…์‹œ์  ์กฐํ•ฉ ์˜๋ฏธ๋ก ์œผ๋กœ ๋ชฉํ‘œ๋ฅผ ์ค€๋‹ค โ€” ๋ถ€์ • ์ œ์•ฝ(โ€œstay away from the yellow bottleโ€), ์•ˆ์ „ ํ”„๋กœํ† ์ฝœ(โ€œslowlyโ€, โ€œuprightโ€ ๊ฐ™์€ ์ˆ˜์‹์–ด๋ฅผ ๊ถค์  ์ตœ์ ํ™” ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ), ๊ด€๊ณ„์  ์„ ํ˜ธ(โ€œmove farther from the stoveโ€) ๊ฐ™์€ ์‹œ๊ฐ ๋ชฉํ‘œ๋งŒ์œผ๋กœ๋Š” ์ถ”๋ก ํ•  ์ˆ˜ ์—†๋Š” ์ถ”์ƒ ์ œ์•ฝ์„ ๊ฐ•์ œํ•œ๋‹ค. ๋Œ€์‹  ์ •ํ™•ํ•œ ์‚ฝ์ž… ๊ฐ๋„ ๊ฐ™์€ ๊ธฐํ•˜ ๋””ํ…Œ์ผ์€ ๋ณธ์งˆ์ ์œผ๋กœ under-specify ํ•œ๋‹ค.
  • ์ •์ฑ… ์กฐ๊ฑด: ์ด๋ฏธ์ง€ ์กฐ๊ฑด์€ ๋ชฉํ‘œ๊ฐ€ ํŠน์ • ๊ณต๊ฐ„ ๋ฐฐ์น˜๋กœ ์ •์˜๋  ๋•Œ ์ตœ์ ์ด๊ณ , ์˜์ƒ ์กฐ๊ฑด์€ ์ ‘๊ทผ ๊ถค์ ยท์ ‘์ด‰ ํƒ€์ด๋ฐยท์†๋„ ํ”„๋กœํŒŒ์ผ ๊ฐ™์€ ์‹œ๊ณต๊ฐ„ ๋™์—ญํ•™์„ ์•”๋ฌต์ ์œผ๋กœ ์ „๋‹ฌํ•œ๋‹ค. ์–ธ์–ด ์กฐ๊ฑด ์ •์ฑ…์˜ ์‹ค์šฉ์  ๊ฐ•์  ์…‹: low-bandwidth specification(ํƒœ์Šคํฌ ๋ณ€ํ˜•๋งˆ๋‹ค ์ƒˆ ์‹œ์—ฐ์„ ๋…นํ™”ยท๋ Œ๋”๋งํ•  ํ•„์š” ์—†์Œ), compositional generalization(์Šคํ‚ฌยท๋ฌผ์ฒดยท๊ณต๊ฐ„ ๊ด€๊ณ„์˜ ์ฒด๊ณ„์  ์žฌ์กฐํ•ฉ), interactive editability(์‹ค์‹œ๊ฐ„ ๋ชฉํ‘œ ์ •์ œ์™€ ๊ตฌ๋‘ ์ •์ •, ๋Œ€ํ™” ๊ธฐ๋ฐ˜ ๋ช…ํ™•ํ™”).
  • ๊ณ„ํš: ์˜์ƒ์€ ๋ฐ€์ง‘ ์šด๋™ํ•™ยท๊ตฌ์กฐ prior๋ฅผ ์ค€๋‹ค(One-shot visual imitation์ด ์‹ฌ๋ณผ๋ฆญ ํ”Œ๋ž˜๋„ˆ ์—†์ด ๋‹ค๋‹จ๊ณ„ ์กฐ์ž‘ ๊ณ„ํš์„ ๋ฝ‘๋Š”๋‹ค โ€” ์˜ท ์ ‘๊ธฐ์ฒ˜๋Ÿผ ์–ธ์–ด๋กœ ํ‘œํ˜„ํ•˜๊ธฐ ์–ด๋ ค์šด ๋ฌผ๋ฆฌ ์กฐ์ž‘์— ํŠนํžˆ ํšจ๊ณผ์ ). ์–ธ์–ด ๊ณ„ํš์€ ๋ถ„๊ธฐยท์ œ์•ฝ์ด ๋งŽ๊ฑฐ๋‚˜ ์ƒํ˜ธ์ž‘์šฉ์ ์ธ ์ƒํ™ฉ์—์„œ ๊ฐ•ํ•˜๋‹ค(โ€œif the drawer is stuck, pull harder; otherwise, close it gentlyโ€). ์ €์ž๋“ค์˜ ์š”์•ฝ์ด ์ข‹๋‹ค: ์‹œ๊ฐ ์‹œ์—ฐ์€ ๊ตฌ์ฒด์  ๋ฌผ๋ฆฌ ๊ฒฝ๋กœ๋ฅผ ์ •์˜ํ•˜๊ณ , ์–ธ์–ด๋Š” ๋…ผ๋ฆฌ ๊ตฌ์กฐ๋ฅผ ์กฐ์งํ•œ๋‹ค.

๊ฒฐ๋ก ์€ โ€œhybridโ€๋‹ค. ์–ธ์–ด๋กœ ๋ฌด์—‡์„(๊ณ ์ˆ˜์ค€ ๋ชฉํ‘œยท๋…ผ๋ฆฌ ์ œ์•ฝยท์‚ฌ์šฉ์ž ์„ ํ˜ธ), ์ด๋ฏธ์ง€/์˜์ƒ์œผ๋กœ ์ •ํ™•ํžˆ ์–ด๋–ป๊ฒŒ(๊ณต๊ฐ„ ๊ธฐํ•˜ยท์šด๋™ํ•™ยท์ ‘์ด‰ ๋™์—ญํ•™)๋ฅผ ์ง€์ •ํ•˜๋Š” ๋‹ค์ค‘๋ชจ๋‹ฌ ๋ช…์„ธ ํ”„๋ ˆ์ž„์›Œํฌ๋กœ ์ˆ˜๋ ดํ•œ๋‹ค๋Š” ๊ฒƒ.


๋…ผ์Ÿ 3์ œ (Sec. 9)

์„œ๋ฒ ์ด ์ค‘๋ฐ˜ ์ดํ›„์˜ ๋ฐฑ๋ฏธ๋‹ค. ์ €์ž๋“ค์€ ๊ฒฐ๋ก ์„ ๋‚ด๋ฆฌ์ง€ ์•Š๊ณ  ์–‘์ชฝ ๊ทผ๊ฑฐ๋ฅผ ์ •๋ฆฌํ•œ๋‹ค.

9.1 VLA๊ฐ€ ์˜ณ์€ ๊ธธ์ธ๊ฐ€?

ํšŒ์˜ ์ชฝ ๊ทผ๊ฑฐ๊ฐ€ ๊ตฌ์ฒด์ ์ด๋‹ค. ์ˆœ์ˆ˜ ์–ธ์–ด ๋ชจ๋ธ๋ง์—์„œ ์Šค์ผ€์ผ๋ง ๋ฒ•์น™์ด ํ†ตํ•œ ๊ฒƒ์€ ๋ฐ์ดํ„ฐ๊ฐ€ ์‚ฌ์‹ค์ƒ ๋ฌดํ•œํ•˜๊ณ  ๊ท ์งˆํ•˜๋ฉฐ ๊ตฌ์กฐ์  ๊ทœ์น™์„ฑ์ด ๊ฐ•ํ–ˆ๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. ๋กœ๋ด‡์€ ๋‹ค๋ฅด๋‹ค โ€” ์˜ค๋Š˜์˜ LLM์€ ๋ณดํ†ต 100B ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ๋„˜๊ณ  ์ˆ˜์กฐ ํ† ํฐ์œผ๋กœ ํ•™์Šต๋˜์ง€๋งŒ, ๋Œ€๋ถ€๋ถ„์˜ VLA๋Š” 7B ๋ฏธ๋งŒ์ด๊ณ  ์ˆ˜๋ฐฑ๋งŒ ๊ฐœ ์ˆ˜์ค€์˜ ๋กœ๋ด‡ ๊ถค์ ์— ์˜์กดํ•œ๋‹ค. ๊ฒŒ๋‹ค๊ฐ€ ๋ฌผ๋ฆฌ ์„ธ๊ณ„์—์„œ๋Š” ์ž‘์€ ์˜ค๋ฅ˜๊ฐ€ ํƒœ์Šคํฌ ์‹คํŒจ๋กœ ์ง๊ฒฐ๋˜๊ณ (์–ธ์–ดยท๋น„์ „ ํƒœ์Šคํฌ์˜ ์‚ฌ์†Œํ•œ ๋ชจํ˜ธ์„ฑ๊ณผ ๋‹ฌ๋ฆฌ), ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ๋Š” ๋‹ค์–‘ํ•˜๊ณ  ๋น„์‹ธ๊ณ  ์žฌํ˜„์ด ์–ด๋ ค์›Œ ๊ทธ ํŽธํ–ฅ์€ ์ƒ˜ํ”Œ์„ ๋” ๋ชจ์•„์„œ ๋ณด์ƒํ•  ์ˆ˜ ์—†๋‹ค.

๋Œ€์•ˆ ๋ฐฉํ–ฅ์œผ๋กœ ์ €์ž๋“ค์ด ์ œ์‹œํ•˜๋Š” ๊ฒƒ์€ โ€œ์œ ํ•œ ๋ฐ์ดํ„ฐ + ๊ฐ•ํ•œ ๊ตฌ์กฐ์  ์˜์กด์„ฑโ€ ํŒจ๋Ÿฌ๋‹ค์ž„์ด๋‹ค. ๊ทธ๋ฆฌ๊ณ  ํฅ๋ฏธ๋กœ์šด ์žฌ์ •์˜๋ฅผ ํ•œ๋‹ค โ€” ์—ญ์‚ฌ์ ์œผ๋กœ VLA์˜ ์ง„๋ณด๋Š” ๋ชจ๋ธ ํฌ๊ธฐ๊ฐ€ ์•„๋‹ˆ๋ผ ํƒœ์Šคํฌ ๋ณต์žก๋„์˜ ํ™•์žฅ์—์„œ ์™”๋‹ค: ๋‹จ์ผ ํŒ” โ†’ ์–‘ํŒ”, ๊ณ ์ • ๋ฒ ์ด์Šค โ†’ ๋ชจ๋ฐ”์ผ, ๊ฐ•์ฒด โ†’ ๋ณ€ํ˜•์ฒด, ๋…๋ฆฝ ์กฐ์ž‘ โ†’ ์ธ๊ฐ„-๋กœ๋ด‡ ํ˜‘์—…. โ€œgenuine scaling in robotics lies in expanding the task manifold, namely the complexity, diversity, and structure of interactions, rather than merely increasing model parameters.โ€

9.2 ์›”๋“œ๋ชจ๋ธ์ด ์˜ณ์€ ๊ธธ์ธ๊ฐ€?

์ฐฌ์„ฑ: ์ƒ์ƒ ๋กค์•„์›ƒ์œผ๋กœ ์ƒ˜ํ”Œ ํšจ์œจ๊ณผ ์žฅ๊ธฐ ํ–‰๋™ ํ•™์Šต์„ ์–ป๊ณ (DreamerV3 ๊ณ„์—ด), ์–ธ์–ด๋กœ ์ƒ์ƒ์„ ์กฐ๊ฑดํ™”ํ•˜๋ฉด ์ž์œ ํ˜• ํ…์ŠคํŠธ๊ฐ€ ๋ชฉํ‘œ ์ธ์ง€์  ๋ฏธ๋ž˜๊ฐ€ ๋˜์–ด ์กฐํ•ฉ์  ์ผ๋ฐ˜ํ™”๋ฅผ ์ง€์›ํ•œ๋‹ค(LIMT). ์•ˆ์ „ ์ธก๋ฉด๋„ ์žˆ๋‹ค โ€” ํ›„๋ณด ํ–‰๋™ ์‹œํ€€์Šค๋ฅผ โ€œ์ƒ์ƒโ€ ์†์—์„œ ์˜คํ”„๋ผ์ธ ํ‰๊ฐ€ํ•ด ์œ„ํ—˜ํ•˜๊ฑฐ๋‚˜ ์‹คํ–‰ ๋ถˆ๊ฐ€๋Šฅํ•œ ๊ณ„ํš์„ ์‹ค์ œ ์‹œ๋„ ์ „์— ๊ฑธ๋Ÿฌ๋‚ผ ์ˆ˜ ์žˆ๋‹ค.

๋ฐ˜๋Œ€: ๋ชจ๋ธ ํŽธํ–ฅ๊ณผ ๋ถ„ํฌ ์ทจ์•ฝ์„ฑ. ์›”๋“œ๋ชจ๋ธ์€ ๊ทผ์‚ฌ ๋™์—ญํ•™์ด๋ฏ€๋กœ ์ ‘์ด‰ยท๋งˆ์ฐฐยท๋ฌผ์„ฑ์˜ ์ž‘์€ ์˜ค์ฐจ๊ฐ€ ์ƒ์ƒ ๋กค์•„์›ƒ์—์„œ ๋ˆ„์ ๋œ๋‹ค. OOD ์ƒํ™ฉ์—์„œ๋Š” ์˜๋ฏธ์ ์œผ๋กœ๋Š” ๊ทธ๋Ÿด๋“ฏํ•˜์ง€๋งŒ ๋ฌผ๋ฆฌ์ ์œผ๋กœ ๋ถˆ๊ฐ€๋Šฅํ•œ(์šด๋™ํ•™ยท์•ˆ์ •์„ฑยท์ ‘์ด‰ ์ œ์•ฝ ์œ„๋ฐ˜) ๊ณ„ํš์„ ๋‚ผ ์ˆ˜ ์žˆ๋‹ค. ์ฆ‰ ์‹œ๋ฎฌ์—์„œ ๋ฉ€์ฉกํ•ด ๋ณด์ด๋Š” ๊ณ„ํš์ด ์‹ค๊ธฐ์—์„œ ์‹คํŒจํ•œ๋‹ค. ๊ฒŒ๋‹ค๊ฐ€ ์ƒ์„ฑ ๋ชจ๋ธ์˜ ์—ฐ์‚ฐ ๋ถ€๋‹ด์ด ์‹ค์‹œ๊ฐ„ ์ œ์–ด ๋ฃจํ”„๋ฅผ ์••๋ฐ•ํ•œ๋‹ค.

์ €์ž๋“ค์˜ ์ •๋ฆฌ๋Š” ์‹ ์ค‘ํ•˜๋‹ค โ€” โ€œrather than definitive drawbacks, current limitations reflect an early methodological stage.โ€ ์—ด๋ฆฐ ๋ฌธ์ œ ์…‹: (i) ํ•™์Šต๋œ ๋™์—ญํ•™์— ๊ตฌ์กฐ์  prior(๋ฌผ๋ฆฌยท๊ธฐํ•˜ยทํƒœ์Šคํฌ ์ œ์•ฝยท์ƒ์‹) ์ฃผ์ž…, (ii) ๋ชจ๋ธ ๋ถˆํ™•์‹ค์„ฑ์˜ ์ •๋Ÿ‰ํ™”ยท์ „ํŒŒ, (iii) ์—ฐ์‚ฐ ํšจ์œจ์  ๋ชจ๋ธ๋กœ ์‹ค์‹œ๊ฐ„ ๋งˆ๊ฐ ๋งž์ถ”๊ธฐ.

9.3 ์‹ค์‹œ๊ฐ„ ์ œ์•ฝ ์•„๋ž˜์„œ ์Šค์ผ€์ผ๋ง์ด ๋„์›€์ด ๋˜๋Š”๊ฐ€?

๊ฐ€์žฅ ์‹ค์šฉ์ ์ธ ๋…ผ์Ÿ์ด๋‹ค. ์ œ์–ด ์ฃผ๊ธฐ๋งˆ๋‹ค ์„ผ์‹ฑยท์ •์ฑ… ์ถ”๋ก ยท๊ตฌ๋™์ด ๋๋‚˜์•ผ ํ•˜๋Š” ๊ณ ์ •๋œ ์‹œ๊ฐ„ ์˜ˆ์‚ฐ์ด ์žˆ๋‹ค. ๋ชจ๋ธ์„ ํ‚ค์›Œ ์ถ”๋ก  ์‹œ๊ฐ„์ด ์ด ์˜ˆ์‚ฐ์„ ๋„˜์œผ๋ฉด ์ œ์–ด ๋ฃจํ”„๊ฐ€ ๋งˆ๊ฐ์„ ๋†“์ณ jitter์™€ ์•ˆ์ •์„ฑ ์ €ํ•˜๊ฐ€ ์ƒ๊ธฐ๊ณ , ์ ‘์ด‰์ด ๋งŽ์€ ์ƒํ˜ธ์ž‘์šฉ์—์„œ ํŠนํžˆ ์น˜๋ช…์ ์ด๋‹ค. LLM/VLM์„ ์˜์‚ฌ๊ฒฐ์ •์— ์“ฐ๋ฉด (๊ณต๊ฒฉ์ ์œผ๋กœ ์บ์‹ฑํ•˜์ง€ ์•Š๋Š” ํ•œ) ์ดˆ ๋‹จ์œ„ ์ง€์—ฐ์ด ๋ถ™๊ณ , ์™„์ „ ์ข…๋‹จ๊ฐ„ VLA๋„ ์ž„๋ฒ ๋””๋“œ ํ•˜๋“œ์›จ์–ด์—์„œ ์Šคํ…๋‹น ์—ฐ์‚ฐยท๋ฉ”๋ชจ๋ฆฌ๋ฅผ ์š”๊ตฌํ•œ๋‹ค. ํ™•์‚ฐ ์ปจํŠธ๋กค๋Ÿฌ๋Š” ๋ฐ˜๋ณต ์ƒ˜ํ”Œ๋ง์˜ โ€œdenoising taxโ€๋ฅผ ์ถ”๊ฐ€๋กœ ๋‚ธ๋‹ค.

์‹ค๋ฌด์  ์™„ํ™”์ฑ…๋“ค: ์••์ถ•ยท์ฆ๋ฅ˜, ์ž…๋ ฅ ํ† ํฐ ๊ฐ€์ง€์น˜๊ธฐ, ๋ชจ๋ธ ๋ฉ”๋ชจ๋ฆฌ ์บ์‹ฑ, ๋ฌด๊ฑฐ์šด 3D ๋ณผ๋ฅ˜๋ฉ”ํŠธ๋ฆญ ์ง€๊ฐ ๋Œ€์‹  ๋‹ค์ค‘๋ทฐ 2D ์ธ์ฝ”๋”, ๊ทธ๋ฆฌ๊ณ  ๋ถ„ํ•  ์•„ํ‚คํ…์ฒ˜(๊ฒฝ๋Ÿ‰ ์˜จ๋ณด๋“œ ์ปจํŠธ๋กค๋Ÿฌ๊ฐ€ ์ฆ‰๊ฐ ํ”ผ๋“œ๋ฐฑยท์•ˆ์ „ ์ธํ„ฐ๋ก์„ ๋งก๊ณ , ๋ฌด๊ฑฐ์šด ์ˆ™๊ณ โ€”๊ณ ์ˆ˜์ค€ ๊ณ„ํšยท์„œ๋ธŒ๊ณจ ์ƒ์„ฑโ€”๋Š” ๋น„๋™๊ธฐ ๋˜๋Š” ์˜คํ”„๋ณด๋“œ๋กœ). ํด๋ผ์šฐ๋“œ ์˜คํ”„๋กœ๋”ฉ์€ ์ฒ˜๋ฆฌ๋Ÿ‰์„ ์ฃผ์ง€๋งŒ ์˜ˆ์ธก ๋ถˆ๊ฐ€๋Šฅํ•œ ๋„คํŠธ์›Œํฌ ์ง€์—ฐ๊ณผ ์•ˆ์ „ ์ž„๊ณ„ ์ƒํ™ฉ์—์„œ ๊ฒฝ๊ณ„ ์ง“๊ธฐ ์–ด๋ ค์šด ์‹คํŒจ ๋ชจ๋“œ๋ฅผ ๋“ค์—ฌ์˜จ๋‹ค. Sec. 10.2.3์€ ์—ฌ๊ธฐ์— ํ†ต์‹  ๋ณด์•ˆ๊นŒ์ง€ ๋ง๋ถ™์ธ๋‹ค โ€” ์‚ฐ์—… ํ™˜๊ฒฝ์—์„œ ์ˆ˜๋ฐฑ ๋Œ€์˜ ๋กœ๋ด‡์ด ๊ณต์œ  ํด๋ผ์šฐ๋“œ ๋ชจ๋ธ์„ ๋™์‹œ ์งˆ์˜ํ•˜๊ณ , ์—์ด์ „ํŠธ๋‹น 50 Hz๋ฅผ ๋„˜๋Š” ์ œ์–ด ๊ฐฑ์‹ ์ด ํ•„์š”ํ•˜๋ฉฐ(Belkhale et al. 2024), ๋ช…๋ น ํ•˜์ด์žฌํ‚น์ด๋‚˜ ๋ชจ๋ธ ๊ฐ€์ค‘์น˜ ์˜ค์—ผ์ด ๋ฌผ๋ฆฌ์  ์•ˆ์ „ ์œ„ํ˜‘์ด ๋œ๋‹ค.


์—ด๋ฆฐ ๋ฌธ์ œ์™€ ๋ฏธ๋ž˜ ๋ฐฉํ–ฅ (Sec. 10)

๋‘ ์ถ•์œผ๋กœ ์ •๋ฆฌ๋œ๋‹ค: ์ผ๋ฐ˜ํ™” ๋Šฅ๋ ฅ๊ณผ ์‹ค์„ธ๊ณ„ ์•ˆ์ „.

10.1 ์ผ๋ฐ˜ํ™”

๋ฐ์ดํ„ฐ ๊ฐ€์šฉ์„ฑ๊ณผ ๊ทธ ํ•œ๊ณ„. play data๊ฐ€ ๋ผ๋ฒจ๋ง ๋น„์šฉ์„ ์ค„์ด์ง€๋งŒ, โ€œrelying solely on play data and generative VLMs may not be sufficient to train a robust FM for robot manipulationโ€. ๊ทธ๋ฆฌ๊ณ  โ€œbeyond web-scale dataโ€ ๋ผ๋Š” ๋„๋ฐœ์  ์งˆ๋ฌธ์„ ๋˜์ง„๋‹ค โ€” ์ธ๊ฐ„์˜ ์กฐ์ž‘ ์ˆ™๋ จ์€ ํ›จ์”ฌ ์ ๊ณ  ๋งฅ๋ฝํ™”๋œ ๊ฒฝํ—˜์—์„œ ๋‚˜์˜จ๋‹ค. ๋ฐ์ดํ„ฐ๊ฐ€ ์ œํ•œ์ ์ผ ๋•Œ ๋”ฅ๋Ÿฌ๋‹ ๋ชจ๋ธ์€ ํ•™์Šต์…‹์˜ ํ—ˆ์œ„ ์ƒ๊ด€(shortcut) ์— ๊ณผ์ ํ•ฉ๋˜๋ฏ€๋กœ, โ€œ๋ฐ์ดํ„ฐ๋ฅผ ๋” ๋ชจ์œผ๋ฉด ๋œ๋‹คโ€๊ฐ€ ์œ ์ผํ•œ ๊ธธ์ด ์•„๋‹ ์ˆ˜ ์žˆ๋‹ค. ์—ฌ๊ธฐ์„œ ๋‰ด๋กœ์‹ฌ๋ณผ๋ฆญ์ด ๋ฐ์ดํ„ฐ ํšจ์œจ ๋Œ€์•ˆ์œผ๋กœ ๋‹ค์‹œ ํ˜ธ์ถœ๋œ๋‹ค.

๋ฒค์น˜๋งˆํ‚น์˜ ๋ฌธ์ œ๋„ ์ •์งํ•˜๋‹ค โ€” ๋Œ€๋ถ€๋ถ„์ด ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ์—์„œ ํ‰๊ฐ€ํ•˜๊ณ  ํ†ตํ•ฉยทํ‘œ์ค€ํ™”๋œ ์‹ค๊ธฐ ํ‰๊ฐ€ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์—†๋‹ค. ์‹œ๋ฎฌ ์„ฑ๋Šฅ์ด ์‹ค๊ธฐ ์„ฑ๊ณต์œผ๋กœ ์ด์–ด์ง€์ง€ ์•Š๋Š” ์ด์œ ๋Š” ์‹œ๊ฐ ์™ธํ˜•, ์„ผ์„œ ๋…ธ์ด์ฆˆ, ๋ฌผ๋ฆฌ ๋™์—ญํ•™, ๊ทธ๋ฆฌ๊ณ  ์–ธ์–ด์  ๋งฅ๋ฝ์˜ ํ•ด์„์ด ๊ฐˆ๋ผ์ง€๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. ์œ ๋งํ•œ ๋ฐฉํ–ฅ์œผ๋กœ real-to-sim-to-real(์‹ค๊ธฐ ์ƒํ˜ธ์ž‘์šฉ ๋ฐ์ดํ„ฐ๋กœ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ๋ฅผ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ โ†’ ์ •๋ ฌ๋œ ์‹œ๋ฎฌ์—์„œ ํ•™์Šต โ†’ ์‹ค๊ธฐ ์žฌ๋ฐฐ์น˜)์„ ๋“ ๋‹ค.

Lifelong learning๊ณผ cross-embodiment alignment. ํ›„์ž๋Š” taxonomy์™€ ์—ฐ๊ฒฐํ•ด ์„ธ ์ธต์œ„์—์„œ ์„ค๋ช…๋œ๋‹ค โ€” ์ง€๊ฐ ์ธต(์„ผ์„œ ๊ตฌ์„ฑยท์นด๋ฉ”๋ผ ๋ฐฐ์น˜ยท์ž‘์—…๊ณต๊ฐ„ ๊ธฐํ•˜๊ฐ€ ๋‹ฌ๋ผ ๊ฐ™์€ ์ง€์‹œ๊ฐ€ ๋‹ค๋ฅธ ์‹œ๊ฐ ๊ทธ๋ผ์šด๋”ฉ์„ ๋‚ณ๋Š”๋‹ค), ์ œ์–ด ์ธต(DoFยท๊ด€์ ˆ ํ•œ๊ณ„ยท์—”๋“œ์ดํŽ™ํ„ฐ๊ฐ€ ๋‹ค๋ฅด๋ฉด ํ•™์Šต๋œ ์ •์ฑ…์ด ์œ ํšจํ•œ ํ–‰๋™์„ ๋ชป ๋‚ธ๋‹ค), ๊ณ„ํšยท์ถ”๋ก  ์ธต(๊ฐ™์€ ๊ณ„ํš์ด ๋‹ค๋ฅธ ๋Šฅ๋ ฅ์˜ ๋กœ๋ด‡์—์„œ ์‹คํ–‰ ๊ฐ€๋Šฅํ•ด์•ผ ํ•œ๋‹ค).

Zero-shot์˜ ์‹คํšจ์„ฑ(10.1.4) โ€” ์ด ์„œ๋ฒ ์ด์—์„œ ๊ฐ€์žฅ ๊ฐ’์ง„ ํ•œ ์ ˆ์ด๋‹ค. ์ €์ž๋“ค์€ zero-shot์ด ๊ท ์ผํ•œ ์†์„ฑ์ด ์•„๋‹ˆ๋ผ ๋ฌด์—‡์„ ์ผ๋ฐ˜ํ™”ํ•˜๋А๋ƒ์— ๋‹ฌ๋ฆฐ ๊ฒƒ์ด๋ผ๊ณ  ์ž˜๋ผ ๋งํ•œ๋‹ค.

  • ์˜๋ฏธยท๊ณ„ํš ์ธต์—์„œ ๊ฐ€์žฅ ๊ฐ•ํ•˜๋‹ค: ZSRM์ด CLIP์œผ๋กœ ๋ชฉํ‘œ ์ด๋ฏธ์ง€-ํ…์ŠคํŠธ๋ฅผ ๋งค์นญํ•ด ํƒœ์Šคํฌ ํŠนํ™” ์žฌํ•™์Šต ์—†์ด ๋ณด์ƒ์„ ๋งŒ๋“ค๊ณ , SayCan์ด LLM ์ถ”๋ก  + affordance ์ ์ˆ˜๋กœ ์Šคํ‚ฌ ์‹œํ€€์Šค๋ฅผ ๋งŒ๋“ค๊ณ , Code as Policies๊ฐ€ ๋ฏธํ•™์Šต ๋ฌผ์ฒด์— ๋Œ€ํ•ด API ํ˜ธ์ถœ์„ ์žฌ์กฐํ•ฉํ•œ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ์—ฌ์ „ํžˆ ์ทจ์•ฝํ•˜๋‹ค โ€” SayCan์€ ์Šคํ‚ฌ ์‹คํ–‰์ด ๋ฌด๊ฒฐํ•˜๋‹ค๊ณ  ๊ฐ€์ •ํ•˜๊ณ , Code as Policies๋Š” ์‹คํ–‰ ๋ถˆ๊ฐ€๋Šฅํ•œ ๋‹จ๊ณ„๋‚˜ ์กด์žฌํ•˜์ง€ ์•Š๋Š” ํ•จ์ˆ˜๋ฅผ ๋‚ผ ์ˆ˜ ์žˆ์œผ๋ฉฐ, ZSRM์€ CLIP์˜ ์•ฝํ•œ ๊ณต๊ฐ„ ์ถ”๋ก ์ด ์ƒํ•œ์ด๋‹ค.
  • ์ •์ฑ… ์ธต์—์„œ๋Š” ๋” ์ œํ•œ์ ์ด๋‹ค: ๋Œ€๊ฐœ ๊ธฐ์กด ์Šคํ‚ฌ ์žฌ์กฐํ•ฉ์ด๋‚˜ ๊ด‘๋ฒ”์œ„ํ•œ ์‚ฌ์ „ํ•™์Šต ํ‘œํ˜„์— ๊ธฐ๋Œ„๋‹ค. LanCon-Learn์˜ ๋ผ์šฐํŒ…+์ œ์–ด ๊ณต๋™ ํ•™์Šต์€ ์ทจ์•ฝํ•˜๊ณ  ์ƒ˜ํ”Œ์„ ๋งŽ์ด ๋จน์œผ๋ฉฐ, RT-2์˜ ์ด๋“๋„ ์‚ฌ์ „ํ•™์Šต ๋ถ„ํฌ์˜ ์ปค๋ฒ„๋ฆฌ์ง€์™€ embodied ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ์˜ ๊ฐ€์šฉ์„ฑ์— ๊ฐ•ํ•˜๊ฒŒ ๋ฌถ์—ฌ ์žˆ๋‹ค.
  • ๋ฌผ๋ฆฌ ์‹คํ–‰์— ๊ฐ€๊นŒ์›Œ์งˆ์ˆ˜๋ก ๋” ์•ฝํ•ด์ง„๋‹ค: ์žฅ๊ธฐยท์ ‘์ด‰ ๊ณผ๋‹คยท๋™์ ยทcross-embodiment ํƒœ์Šคํฌ์—์„œ ๊ทธ๋ผ์šด๋”ฉยท์ง€๊ฐยท๋™์—ญํ•™ยทํ”ผ๋“œ๋ฐฑ์˜ ์˜ค์ฐจ ๋ˆ„์ ์ด ์ง€๋ฐฐํ•œ๋‹ค.

๊ฒฐ๋ก  ๋ฌธ์žฅ์ด ์ •ํ™•ํ•˜๋‹ค: ํ˜„์žฌ ์‹œ์Šคํ…œ์˜ zero-shot์€ โ€œpartial and conditional rather than universalโ€ โ€” ์˜๋ฏธ ๋ช…์„ธ์™€ ๊ณ ์ˆ˜์ค€ ๊ณ„ํš์—์„œ ๊ฐ€์žฅ ๊ฐ•ํ•˜๊ณ , ์ •์ฑ… ์ „์ด์—์„œ๋Š” ์œ ๋งํ•˜์ง€๋งŒ ์—ฌ์ „ํžˆ ์ทจ์•ฝํ•˜๋ฉฐ, ์ƒ๋‹นํ•œ novelty ์•„๋ž˜์˜ ์‹ ๋ขฐ์„ฑ ์žˆ๋Š” ์‹ค๊ธฐ ์กฐ์ž‘์—์„œ๋Š” ์—ฌ์ „ํžˆ ์ œํ•œ์ ์ด๋‹ค.

10.2 ์•ˆ์ „

์–ธ์–ด์˜ ๋ชจํ˜ธ์„ฑ(10.2.1). ์˜ˆ์‹œ๊ฐ€ ์ธ์ƒ์ ์ด๋‹ค โ€” โ€œRemove the chemicals from the table.โ€ ์‚ฌ์šฉ์ž๋Š” ํ™”ํ•™๋ฌผ์งˆ ์šฉ๊ธฐ๋ฅผ ์ง€์ •๋œ ๋ณด๊ด€ ์žฅ์†Œ๋กœ ์•ˆ์ „ํ•˜๊ฒŒ ์˜ฎ๊ธฐ๊ธฐ๋ฅผ ์˜๋„ํ–ˆ์„ ์ˆ˜ ์žˆ์ง€๋งŒ, ๋กœ๋ด‡์€ ์ด๋ฅผ ๋ฌผ๋ฆฌ์ ์œผ๋กœ ์น˜์›Œ ์—†์• ๊ธฐ(์—Ž๊ฑฐ๋‚˜ ์ž˜๋ชป ๋‹ค๋ฃจ๊ธฐ)๋กœ ํ•ด์„ํ•ด ํ™”ํ•™๋ฌผ์งˆ ์œ ์ถœ๊ณผ ์œ„ํ—˜์„ ๋‚ณ์„ ์ˆ˜ ์žˆ๋‹ค. ์™„ํ™”์ฑ…์€ ๋Šฅ๋™์  ๋ช…ํ™•ํ™” ์งˆ์˜(โ€œDo you want me to move the chemicals to storage, or should I dispose of them?โ€)์™€ ํ–‰๋™ ์ „ ํ•ด์„ ํ™•์ธ ๋˜๋จน์ž„(โ€œI understood that I should carefully move the containers to the storage area. Is this correct?โ€). ์—ฌ๊ธฐ์— 3D ์„ธ๊ณ„ ๊ทธ๋ผ์šด๋”ฉ์˜ ๋‚œ์ ์ด ๊ฒน์นœ๋‹ค โ€” VLM์€ ํ™˜๊ฐํ•˜๊ธฐ ์‰ฝ๊ณ , ๊ณต๊ฐ„ ํ‘œํ˜„์„ ํ•ด์„ํ•  ๋•Œ ๊ด€์  ์ทจํ•˜๊ธฐ(taking spatial perspectives) ๋ฅผ ๋ชป ํ•œ๋‹ค.

์‹คํŒจ ๋ณต๊ตฌ(10.2.2). ์†Œํ”„ํŠธ์›จ์–ด ์ธก(LLM ํ™˜๊ฐ โ†’ ์กด์žฌํ•˜์ง€ ์•Š๋Š” ๋ฌผ์ฒด ์ฐธ์กฐ, ๋…ผ๋ฆฌ์ ์œผ๋กœ ๋ชจ์ˆœ๋œ ๊ณ„ํš, ์•ˆ์ „ํ•˜์ง€ ์•Š์€ ์ œ์–ด ์ฝ”๋“œ)๊ณผ ํ•˜๋“œ์›จ์–ด ์ธก(์ถ”๋ก  ์ง€์—ฐ์œผ๋กœ ์ธํ•œ ํ–‰๋™ ์ง€์—ฐ, ๊ณ ๋™์  ๋ชจ์…˜์—์„œ์˜ ๋ชจํ„ฐ ๊ณผ์—ด ์…ง๋‹ค์šด, ์กฐ๋ช…ยท๋ฐ˜์‚ฌ๋ฉด์— ์ทจ์•ฝํ•œ ๊นŠ์ด ์„ผ์„œ, ์ œํ•œ๋œ ๋ฐฐํ„ฐ๋ฆฌ)์„ ๋ชจ๋‘ ๋“ ๋‹ค. ํ•˜๋“œ์›จ์–ด ์‹คํŒจ ์–‘์ƒ๊นŒ์ง€ ๊ตฌ์ฒด์ ์œผ๋กœ ์—ด๊ฑฐํ•œ ์„œ๋ฒ ์ด๋Š” ํ”์น˜ ์•Š๋‹ค.

์‹ค์‹œ๊ฐ„ ์„ฑ๋Šฅ(10.2.3). ์••์ถ•ยท์–‘์žํ™”ยท์ง€์‹ ์ฆ๋ฅ˜, ๊ทธ๋ฆฌ๊ณ  ์‹œ๊ฐ„ ์ž„๊ณ„ ๊ฒฐ์ •์€ ๊ฒฝ๋Ÿ‰ ๋กœ์ปฌ ๋ชจ๋ธ์— ์œ„์ž„ํ•˜๊ณ  ๋ณต์žกํ•œ ์ถ”๋ก ์€ ํฐ ๋ชจ๋ธ์— ์˜คํ”„๋กœ๋”ฉํ•˜๋Š” ํ•˜์ด๋ธŒ๋ฆฌ๋“œ.


๋น„ํŒ์ ์œผ๋กœ ๋ณด๋ฉด

๊ฐ•์ 

  1. ๋ถ„๋ฅ˜์ถ•์ด ์‹ค์ œ๋กœ ์ผ์„ ํ•œ๋‹ค. โ€œ์–ธ์–ด์˜ ๊ธฐ๋Šฅ์  ์—ญํ• โ€์ด๋ผ๋Š” ์ถ•์€ ๋‹จ์ˆœํ•œ ์žฌ๋ฐฐ์—ด์ด ์•„๋‹ˆ๋‹ค. ์ด ์ถ•์œผ๋กœ ์ž๋ฅด๋ฉด ๊ฐ™์€ ๋ฐฉ์— ๋ชจ์ธ ์—ฐ๊ตฌ๋“ค์ด ๊ฐ™์€ ๋ณ‘๋ชฉ์„ ๋‹ค๋ฅด๊ฒŒ ๊ณต๊ฒฉํ•œ ๊ณ„๋ณด๋กœ ์ฝํžŒ๋‹ค(Sec. 4์˜ โ€œ๋ณด์ƒ ์„ค๊ณ„ ๋…ธ๋™์„ ๋ˆ„๊ฐ€ ๋Œ€์‹ ํ•˜๋Š”๊ฐ€โ€ 3์„ธ๋Œ€, Sec. 5์˜ โ€œ์•ž ๊ณ„์—ด์˜ ํ•œ๊ณ„๋ฅผ ์™„ํ™”ํ•œ๋‹คโ€ ์‚ฌ์Šฌ, Sec. 6.1โ†’6.2์˜ โ€œ์‹ฌ๋ณผ๋ฆญ์˜ 4๋Œ€ ํ•œ๊ณ„ โ†’ LLM์ด ์šฐํšŒ โ†’ LLM์˜ 3๋Œ€ ์‹ ๊ทœ ๋ฌธ์ œโ€). ์„œ๋ฒ ์ด์˜ ๊ฐ€์น˜๋Š” ๋ชฉ๋ก์ด ์•„๋‹ˆ๋ผ ์ด๋Ÿฐ ์ธ๊ณผ ์„œ์‚ฌ์— ์žˆ๊ณ , ์ด ๋…ผ๋ฌธ์€ ๊ทธ๊ฑธ ๊ฐ–์ท„๋‹ค.
  2. ๊ฒฝ๊ณ„๋ฅผ ๋ช…์‹œ์ ์œผ๋กœ ๊ธ‹๋Š”๋‹ค. VLA๋ฅผ ๋„“๊ฒŒ ์ •์˜ํ•˜๋ฉด CLIPORT๋„ VLA์ง€๋งŒ, ์ด ์„œ๋ฒ ์ด๋Š” โ€œ์•ก์…˜ ์ƒ์„ฑ์ด ์‹œ๊ฐ-์–ธ์–ด ํ‘œํ˜„๊ณผ ๋ฐ€๊ฒฐํ•ฉํ•ด ํ•™์Šต๋˜๋Š”๊ฐ€โ€๋กœ ์ขํ˜€ ์žก๊ณ  ๊ทธ ์ด์œ ๋ฅผ ๊ฐ์ฃผ๊นŒ์ง€ ๋‹ฌ์•„ ์„ค๋ช…ํ•œ๋‹ค. ์„œ๋ฒ ์ด๊ฐ€ ์ž๊ธฐ ์šฉ์–ด์˜ ๊ฒฝ๊ณ„๋ฅผ ๋ฐฉ์–ดํ•˜๋Š” ๊ฒฝ์šฐ๋Š” ์ƒ๊ฐ๋ณด๋‹ค ๋“œ๋ฌผ๋‹ค.
  3. ๋‹จ์  ์นธ์„ ๋น„์šฐ์ง€ ์•Š๋Š”๋‹ค. Table 2~5์˜ โ€œKey Disadvantagesโ€๋Š” ํ˜•์‹์  ๋ฌธ๊ตฌ๊ฐ€ ์•„๋‹ˆ๋ผ ๊ตฌ์ฒด์ ์ด๋‹ค(โ€œํŠน๊ถŒ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ์ƒํƒœ ํ•„์š”โ€, โ€œ2D ์ •์‚ฌ์˜์—์„œ ํ‚คํฌ์ธํŠธ ๊ฐ€๋ฆผโ€, โ€œํ›„์† ์ €์ˆ˜์ค€ ์ •์ฑ…์ด ์ƒํ•œโ€, โ€œ๋ฉ”๋ชจ๋ฆฌ ๋ฒ„ํผ ๊ด€๋ฆฌ ๋น„์šฉโ€).
  4. ์ง€์—ฐ์‹œ๊ฐ„์„ 1๊ธ‰ ์ง€ํ‘œ๋กœ ๋ฐ€์–ด๋ถ™์ธ๋‹ค. Table 6๊ณผ Sec. 9.3์˜ ๊ฒฐํ•ฉ์€ ์ด ์„œ๋ฒ ์ด๊ฐ€ ์ปค๋ฎค๋‹ˆํ‹ฐ์— ๋‚จ๊ธฐ๋Š” ๊ฐ€์žฅ ์‹ค์ฒœ์ ์ธ ์š”๊ตฌ๋‹ค. ์‹ฌ์ง€์–ด ์ž๊ธฐ ํ‘œ์˜ ๋นˆ์นธ(โ€˜โ€“โ€™ = ๋ฏธ๋ณด๊ณ )์„ ๊ทผ๊ฑฐ๋กœ ์‚ผ๋Š”๋‹ค.
  5. ๋…ผ์Ÿ์„ ๋ด‰ํ•ฉํ•˜์ง€ ์•Š๋Š”๋‹ค. Sec. 9๋Š” โ€œVLA ์Šค์ผ€์ผ๋ง์ด ๋‹ต์ด๋‹คโ€๋ผ๊ณ  ๋งํ•˜์ง€ ์•Š๊ณ , ๋Œ€์‹  โ€œ๋กœ๋ด‡์˜ ์ง„์งœ ์Šค์ผ€์ผ๋ง์€ ํŒŒ๋ผ๋ฏธํ„ฐ๊ฐ€ ์•„๋‹ˆ๋ผ ํƒœ์Šคํฌ ๋งค๋‹ˆํด๋“œ์˜ ํ™•์žฅโ€์ด๋ผ๋Š” ๋ฐ˜๋Œ€ ๋ช…์ œ๋ฅผ ์ œ์‹œํ•œ ๋’ค ์—ด์–ด ๋‘”๋‹ค.
  6. ์ตœ์‹ ์„ฑ์ด ์‹ค์ œ๋กœ ๋†’๋‹ค. v7(2026-06-22)์€ ฯ€0.5, FAST ํ† ํฌ๋‚˜์ด์ €, DreamVLA, MemoryVLA, ForceVLA, knowledge insulation, Discrete Diffusion VLA ๊ฐ™์€ 2025~2026๋…„ ํ๋ฆ„์„ ๋ฐ˜์˜ํ•œ๋‹ค. ๋ถ€๋ก Table 12์—๋Š” 2026๋…„ ํ•ญ๋ชฉ๋„ ์žˆ๋‹ค. 2023๋…„ ์ดˆํŒ๋งŒ ๋ณด๊ณ  โ€œ๋‚ก์€ ์„œ๋ฒ ์ดโ€๋กœ ํŒ๋‹จํ•˜๋ฉด ์•ˆ ๋œ๋‹ค.

์•ฝ์ ยทํ•œ๊ณ„

  1. ์ •๋Ÿ‰ ๋น„๊ต๊ฐ€ ์‚ฌ์‹ค์ƒ ์—†๋‹ค. 4๊ฐœ์˜ ๋Œ€ํ‘œ๊ธฐ๋ฒ• ํ‘œ๋Š” ๋ชจ๋‘ ์ •์„ฑ ์„œ์ˆ (๋ฉ”์ปค๋‹ˆ์ฆ˜/์žฅ์ /๋‹จ์ )์ด๊ณ , ์„ฑ๊ณต๋ฅ ยทSRยท์ผ๋ฐ˜ํ™” ์ ์ˆ˜๋ฅผ ๋‚˜๋ž€ํžˆ ๋†“์€ ํ‘œ๊ฐ€ ์—†๋‹ค. ์ €์ž๋“ค์€ ๋ฒค์น˜๋งˆํฌ๊ฐ€ ์ œ๊ฐ๊ฐ์ด๋ผ ๊ณต์ • ๋น„๊ต๊ฐ€ ๋ถˆ๊ฐ€๋Šฅํ•˜๋‹ค๊ณ  Sec. 8.4์—์„œ ๋ช…์‹œํ•˜๊ณ , ๊ทธ ์ง„๋‹จ ์ž์ฒด๋Š” ์˜ณ๋‹ค. ํ•˜์ง€๋งŒ ๊ทธ ๊ฒฐ๊ณผ ๋…์ž๋Š” โ€œ์–ด๋–ค ๊ณ„์—ด์ด ์ง€๊ธˆ ์–ผ๋งˆ๋‚˜ ๋˜๋Š”๊ฐ€โ€๋ฅผ ์ด ์„œ๋ฒ ์ด๋งŒ์œผ๋กœ๋Š” ์•Œ ์ˆ˜ ์—†๋‹ค. Table 6์กฐ์ฐจ ์ ˆ๋ฐ˜์ด ๋น„์–ด ์žˆ๋‹ค. ์ฆ‰ ์ด ์„œ๋ฒ ์ด๋Š” ์ง€๋„์ด์ง€ ์„ฑ์ ํ‘œ๊ฐ€ ์•„๋‹ˆ๋‹ค.
  2. ๊นŠ์ด๊ฐ€ ์ ˆ๋งˆ๋‹ค ๊ณ ๋ฅด์ง€ ์•Š๋‹ค. Sec. 4ยท5ยท6์€ ๊ณ„๋ณด ์„œ์‚ฌ๊ฐ€ ์ด˜์ด˜ํ•œ๋ฐ, Sec. 7(VLA)์€ ๋ฐฉ๋ฒ• ๋‚˜์—ด์˜ ๋ฐ€๋„๊ฐ€ ํ›จ์”ฌ ๋†’์•„ โ€œ์ด ๋ฐฉ๋ฒ•์€ ์ด๊ฑธ ํ•˜๊ณ , ์ € ๋ฐฉ๋ฒ•์€ ์ €๊ฑธ ํ•œ๋‹คโ€ ์‹ ์„œ์ˆ ์ด ๊ธธ๊ฒŒ ์ด์–ด์ง„๋‹ค. ๋ถ„์•ผ๊ฐ€ ๋น ๋ฅด๊ฒŒ ์›€์ง์—ฌ์„œ์ผ ํ…๋ฐ, Sec. 7๋งŒ ๋”ฐ๋กœ ์ฝ์œผ๋ฉด ์ถ•์ด ์ž˜ ์•ˆ ์žกํžŒ๋‹ค(Fig. 16๊ณผ Table 10์„ ๋จผ์ € ๋ณด๊ณ  ๋“ค์–ด๊ฐ€๋Š” ํŽธ์ด ๋‚ซ๋‹ค).
  3. ๋ถ„๋ฅ˜์ถ•์ด ์‹ค์ œ ์—ฐ๊ตฌ๋ฅผ ๊น”๋”ํžˆ ๊ฐ€๋ฅด์ง€ ๋ชปํ•˜๋Š” ์ง€์ ์ด ์žˆ๋‹ค. ์ €์ž๋“ค๋„ Fig. 16 ๊ฐ์ฃผ์—์„œ โ€œwe focus on delineating the primary contribution of each method โ€ฆ even though most methods involve multiple aspectsโ€ ๋ผ๊ณ  ์ธ์ •ํ•œ๋‹ค. ฯ€0.5๋Š” โ€œ๊ณ ์ˆ˜์ค€ ์„œ๋ธŒํƒœ์Šคํฌ(ํ…์ŠคํŠธ) ์˜ˆ์ธก ํ›„ ์—ฐ์† ๋ช…๋ น ์ •์ œโ€์ธ๋ฐ ์ด๊ฑด โธ(์–ธ์–ด๋กœ ๊ณ„ํš)๊ณผ โน(ํ†ตํ•ฉ VLA)์— ๊ฑธ์นœ๋‹ค. LoHoVLAยทDexVLA์˜ โ€œ์ž๊ธฐ์ƒ์„ฑ ์–ธ์–ด ์„œ๋ธŒ๊ณจโ€๋„ ๋งˆ์ฐฌ๊ฐ€์ง€๋‹ค. โธ๊ณผ โน์˜ ๊ฒฝ๊ณ„๋Š” ์‹ค์ œ๋กœ ํ๋ ค์ง€๋Š” ์ค‘์ด๊ณ , ์„œ๋ฒ ์ด์˜ ์ถ•์€ ์ด ์ˆ˜๋ ด์„ ์ž˜ ๋‹ด์ง€ ๋ชปํ•œ๋‹ค.
  4. ์ปค๋ฒ„๋ฆฌ์ง€์˜ ๊ตฌ๋ฉ์ด ์žˆ๋‹ค. ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ํ‘œ(Table 7)์— Isaac Lab/Isaac Sim, Genesis, SAPIEN, ManiSkill์ด ์—†๋‹ค(SAPIENยทManiSkill์€ ๋ถ€๋ก Table 11ยท12์˜ ๊ฐœ๋ณ„ ๋…ผ๋ฌธ ํ–‰์—๋งŒ ๋“ฑ์žฅํ•œ๋‹ค). ๋ฒค์น˜๋งˆํฌ ํ‘œ(Table 8)์—๋„ RoboCasa, BEHAVIOR, SIMPLER ๊ฐ™์€ ์ถ•์ด ๋น ์ ธ ์žˆ๋‹ค. ๋ชจ๋ธ ์ชฝ์—์„œ๋„ SmolVLAยทMolmoAct ๊ณ„์—ด(ํšจ์œจ ์ง€ํ–ฅ ์†Œํ˜• VLA, ์•ก์…˜ ์ถ”๋ก  ๋ชจ๋ธ)์ด ๋ณธ๋ฌธ์— ์—†๋‹ค. ๋ถ€๋ก Table 10์˜ ์ตœ์‹  ํ•ญ๋ชฉ์ด 2025-09๋ผ๋Š” ์ ๋„ ํ•จ๊ป˜ ๋ณด๋ฉด, v7์˜ ์‹ค์งˆ์  ์ปค๋ฒ„๋ฆฌ์ง€ ์ปท์˜คํ”„๋Š” 2025๋…„ ํ•˜๋ฐ˜๊ธฐ๋กœ ๋ณด๋Š” ๊ฒƒ์ด ์ •ํ™•ํ•˜๋‹ค(๋ณธ๋ฌธ ์ธ์šฉ ์—ฐ๋„๊ฐ€ 2026์ธ ํ•ญ๋ชฉ๋“ค๋„ ๋Œ€๋ถ€๋ถ„ 2025๋…„ arXiv ํ”„๋ฆฌํ”„๋ฆฐํŠธ์˜ ์ •์‹ ๊ฒŒ์žฌ๋ณธ์ด๋‹ค).
  5. ์ธ์šฉ ์—ฐ๋„ ํ‘œ๊ธฐ๊ฐ€ ๋‘ ๋ฒŒ๋กœ ๋Œ์•„๊ฐ„๋‹ค. ๋ณธ๋ฌธ์€ โ€œLi et al. 2026b(BridgeVLA)โ€์ธ๋ฐ Table 10์˜ Time ์—ด์€ โ€œ2025-06โ€์ด๋‹ค. ๋‘ ๊ฐ’ ๋ชจ๋‘ ๋งž์ง€๋งŒ(๊ฒŒ์žฌ ์—ฐ๋„ vs arXiv ์ตœ์ดˆ ๊ณต๊ฐœ), ๊ฐ™์€ ๋ฌธ์„œ ์•ˆ์—์„œ ๋‘ ๊ธฐ์ค€์ด ์„ž์ด๋ฉด ๋…์ž๊ฐ€ ์–ด๋–ค ๊ฒƒ์ด ์ตœ์‹ ์ธ์ง€ ํŒ๋‹จํ•˜๊ธฐ ์–ด๋ ต๋‹ค. ์ด ์„œ๋ฒ ์ด๋ฅผ ์ธ์šฉํ•  ๋•Œ๋Š” Table 10ยท11ยท12์˜ Time/Years ์—ด์„ ๊ธฐ์ค€์œผ๋กœ ์žก๋Š” ํŽธ์ด ์•ˆ์ „ํ•˜๋‹ค.
  6. ํŽธ์ง‘ ํ’ˆ์งˆ์˜ ์ž” ํ . Fig. 5์˜ โ€œVLM-dirvenโ€, Fig. 6์˜ โ€œDiffuison-basedโ€, Fig. 16 ์บก์…˜์˜ โ€œHierachicalโ€ยทโ€œfllowsโ€, Table 5์˜ โ€œAdaptatingโ€, Table 8์˜ โ€œFramka Pandaโ€. ๋‚ด์šฉ์— ์˜ํ–ฅ์€ ์—†์ง€๋งŒ IJRR ์Šน์ธ๋ณธ์ด๋ผ๋Š” ์ ์„ ์ƒ๊ฐํ•˜๋ฉด ์•„์‰ฝ๋‹ค.
  7. โ€œ์•ˆ์ „โ€ ์ ˆ์ด ์„œ์ˆ ์ ์ด๋‹ค. Sec. 10.2๋Š” ๋ฌธ์ œ๋ฅผ ์ž˜ ์—ด๊ฑฐํ•˜์ง€๋งŒ(๋ชจํ˜ธ์„ฑ/์‹คํŒจ ๋ณต๊ตฌ/์‹ค์‹œ๊ฐ„/ํ†ต์‹  ๋ณด์•ˆ), ์ •ํ˜• ๊ฒ€์ฆยท๋Ÿฐํƒ€์ž„ ๋ชจ๋‹ˆํ„ฐยท์•ˆ์ „ ํ•„ํ„ฐ ๊ฐ™์€ ํ˜•์‹์  ์•ˆ์ „ ๊ธฐ๋ฒ•์˜ ๊ณ„๋ณด๋Š” ๊ฑฐ์˜ ๋‹ค๋ฃจ์ง€ ์•Š๋Š”๋‹ค. LTL์„ ์“ฐ๋Š” SELP, conformal prediction์„ ์“ฐ๋Š” KnowNo๊ฐ€ ๋‹จ๋ฐœ๋กœ ์–ธ๊ธ‰๋  ๋ฟ, โ€œ์•ˆ์ „โ€์„ taxonomy์˜ ํ•œ ์ถ•์œผ๋กœ ์Šน๊ฒฉ์‹œํ‚ค์ง€๋Š” ์•Š๋Š”๋‹ค.

2026๋…„ ์‹œ์ ์—์„œ ์œ ํšจํ•œ ๋ถ€๋ถ„ / ๋‚ก์€ ๋ถ€๋ถ„

์—ฌ์ „ํžˆ ์œ ํšจํ•œ ๋ถ€๋ถ„์€ taxonomy ์ž์ฒด์™€ Sec. 8ยท9๋‹ค. โ€œ์–ธ์–ด๊ฐ€ ๋ณด์ƒ์ธ๊ฐ€ ์กฐ๊ฑด์ธ๊ฐ€ ๊ณ„ํš์ธ๊ฐ€ ํ‘œํ˜„์ธ๊ฐ€โ€๋ผ๋Š” ์งˆ๋ฌธ์€ ๋ชจ๋ธ์ด ๋ช‡ ๋ฒˆ ๋” ์„ธ๋Œ€๊ต์ฒดํ•ด๋„ ์œ ์ง€๋˜๋Š” ์ถ•์ด๊ณ , action granularityยทlatencyยทdata regime ๊ฐ™์€ ๊ณตํ•™ ์ถ•์€ ์˜คํžˆ๋ ค ์‹œ๊ฐ„์ด ๊ฐˆ์ˆ˜๋ก ์ค‘์š”ํ•ด์ง„๋‹ค. Sec. 9.3(์‹ค์‹œ๊ฐ„ ์ œ์•ฝ)๊ณผ Sec. 10.1.4(zero-shot์˜ ์กฐ๊ฑด๋ถ€ ์„ฑ๊ฒฉ)๋Š” ์ง€๊ธˆ ์ฝ์–ด๋„ ๊ฐ€์žฅ ์ •์งํ•œ ์ง„๋‹จ์ด๋‹ค. Sec. 4(๋ณด์ƒ/๋น„์šฉ)์™€ Sec. 6.1(๋‰ด๋กœ์‹ฌ๋ณผ๋ฆญ)์€ ์ตœ๊ทผ ๋…ผ๋ฌธ์—์„œ ์ž˜ ์•ˆ ๋‹ค๋ฃจ๋Š” ๊ณ„๋ณด๋ฅผ ์ด˜์ด˜ํžˆ ๋‚จ๊ฒจ๋‘” ์•„์นด์ด๋ธŒ์  ๊ฐ€์น˜๊ฐ€ ์žˆ๋‹ค.

๋น ๋ฅด๊ฒŒ ๋‚ก๋Š” ๋ถ€๋ถ„์€ Sec. 7์˜ ๊ฐœ๋ณ„ ๋ฐฉ๋ฒ• ๋ชฉ๋ก๊ณผ Table 10์ด๋‹ค. ์ปค๋ฒ„๋ฆฌ์ง€ ์ปท์˜คํ”„๊ฐ€ 2025๋…„ ํ•˜๋ฐ˜๊ธฐ์ด๋ฏ€๋กœ, 2026๋…„ ์ƒ๋ฐ˜๊ธฐ ์ดํ›„์˜ VLA(๋Œ€๊ทœ๋ชจ co-training ์ „๋žต, ์•ก์…˜ ์ถ”๋ก  ๋ชจ๋ธ, ์†Œํ˜•ยท์˜จ๋””๋ฐ”์ด์Šค VLA)๋Š” ์ด ์„œ๋ฒ ์ด ๋ฐ–์—์„œ ๋”ฐ๋กœ ๋”ฐ๋ผ๊ฐ€์•ผ ํ•œ๋‹ค. Table 7์˜ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ ๊ตฌ์„ฑ๋„ ํ˜„์žฌ ์ƒํƒœ๊ณ„์™€ ์–ด๊ธ‹๋‚œ๋‹ค.

๊ฒฐ๋ก ์ ์œผ๋กœ ์ด ์„œ๋ฒ ์ด๋ฅผ ์ฝ์„ ๊ฐ’์€ ์ด๋ ‡๋‹ค. โ‘  ์ด ๋ถ„์•ผ์— ์ฒ˜์Œ ๋“ค์–ด์˜ค๋Š” ์‚ฌ๋žŒ์—๊ฒŒ๋Š” Fig. 3 ํ•œ ์žฅ + Sec. 3๋งŒ์œผ๋กœ ์ง€ํ˜•์ด ์žกํžŒ๋‹ค. โ‘ก ํŠน์ • ๊ณ„์—ด์„ ํŒŒ๋Š” ์‚ฌ๋žŒ์—๊ฒŒ๋Š” ํ•ด๋‹น ์ ˆ(4/5/6/7)์˜ ๊ณ„๋ณด ์„œ์‚ฌ์™€ Table 2~5์˜ ๋‹จ์  ์นธ์ด โ€œ๋‚ด ๋ฐฉ๋ฒ•์ด ์–ด๋А ๋ณ‘๋ชฉ์„ ๊ณต๊ฒฉํ•˜๋Š”์ง€โ€๋ฅผ ์ •ํ™•ํžˆ ์œ„์น˜์‹œ์ผœ ์ค€๋‹ค. โ‘ข ์‹œ์Šคํ…œ์„ ๋งŒ๋“œ๋Š” ์‚ฌ๋žŒ์—๊ฒŒ๋Š” Sec. 8(5์ถ•)๊ณผ Table 6~9๊ฐ€ ๊ฐ€์žฅ ์‹ค์šฉ์ ์ด๋‹ค โ€” ํŠนํžˆ ์ง€์—ฐ์‹œ๊ฐ„๊ณผ ํƒœ์Šคํฌ ๊ณ„์—ด 3๋ถ„๋ฅ˜๋Š” ์‹คํ—˜ ์„ค๊ณ„์— ๋ฐ”๋กœ ์“ธ ์ˆ˜ ์žˆ๋‹ค. โ‘ฃ ๋ฐ˜๋Œ€๋กœ โ€œ์–ด๋–ค ๋ฐฉ๋ฒ•์ด SOTA์ธ๊ฐ€โ€๋ฅผ ์•Œ๊ณ  ์‹ถ๋‹ค๋ฉด ์ด ์„œ๋ฒ ์ด๋Š” ๋‹ตํ•˜์ง€ ์•Š๋Š”๋‹ค.


๊ด€๋ จ ์—ฐ๊ตฌ์™€์˜ ์ž๋ฆฌ ๋งค๊น€

์ด ๋ธ”๋กœ๊ทธ์˜ ๊ธฐ์กด ๋ฆฌ๋ทฐ๋“ค๊ณผ ์—ฎ์œผ๋ฉด ์ด ์„œ๋ฒ ์ด๋Š” ํ—ˆ๋ธŒ ๋…ธ๋“œ๋กœ ์“ธ ์ˆ˜ ์žˆ๋‹ค.

  • ๋‹ค๋ฅธ ์ถ•์˜ ์„œ๋ฒ ์ด: VLA for Embodied AI(๋ชจ๋ธ ์ข…๋ฅ˜ ์ถ•), Dexterous Imitation Learning(์กฐ์ž‘ ๋Œ€์ƒ ์ถ•). ์„ธ ํŽธ์„ ๊ฒน์ณ ์ฝ์œผ๋ฉด ๊ฐ™์€ ๋ฌธํ—Œ ์ง‘ํ•ฉ์˜ ์„œ๋กœ ๋‹ค๋ฅธ ๋‹จ๋ฉด์ด ๋ณด์ธ๋‹ค.
  • โถ ์ƒํƒœ ํ‰๊ฐ€ ๊ณ„์—ด์˜ ์› ๋…ผ๋ฌธ: Eureka(LLM ๋ณด์ƒ ์ฝ”๋“œ ์ง„ํ™”), Reward Engineering(๋ณด์ƒ ์„ค๊ณ„ยทshaping ์ผ๋ฐ˜๋ก ), PWTF(VoxPoser/ReKep ๊ณ„์—ด์˜ ํ›„์† โ€” VLM์ด ๋งŒ๋“  ๋น„์šฉ์„ ๋””์ง€ํ„ธ ํŠธ์œˆ MPC์— ๋„ฃ๊ธฐ).
  • โน VLA ๊ณ„์—ด์˜ ์› ๋…ผ๋ฌธ: ฯ€0(flow matching action expert), Tactile-VLA(Sec. 7.2.3์— ์ง์ ‘ ์ธ์šฉ), CompliantVLA(์ €์ˆ˜์ค€ ์ปดํ”Œ๋ผ์ด์–ธ์Šค โ€” Sec. 8.1.3์˜ low-level control ์ถ•), RL Token(Sec. 7.5 ํ›„ํ•™์Šต ๊ณ„์—ด).
  • ์„œ๋ฒ ์ด ๋ฐ–์˜ ์ตœ์‹  ํ๋ฆ„: SmolVLA(์˜จ๋””๋ฐ”์ด์Šค ์†Œํ˜• VLA โ€” Sec. 9.3์˜ ์‹ค์‹œ๊ฐ„ ๋…ผ์Ÿ์— ๋Œ€ํ•œ ์ง์ ‘์  ์‘๋‹ต), MolmoAct2(์•ก์…˜ ์ถ”๋ก  ๋ชจ๋ธ), RoboVerse(Table 7ยท8์— ์—†๋Š” ํ†ตํ•ฉ ํ”Œ๋žซํผ), Semantic World Models(Sec. 9.2 ์›”๋“œ๋ชจ๋ธ ๋…ผ์Ÿ์˜ ๋Œ€์•ˆ์  ์ •์‹ํ™”).

์š”์•ฝ

  • ํ•œ ๋ฌธ์žฅ: ์–ธ์–ด ์กฐ๊ฑด ๋กœ๋ด‡ ์กฐ์ž‘์„ โ€œ์•Œ๊ณ ๋ฆฌ์ฆ˜ ์ข…๋ฅ˜โ€๊ฐ€ ์•„๋‹ˆ๋ผ โ€œ์–ธ์–ด๊ฐ€ ์ œ์–ด ๋ฃจํ”„์—์„œ ๋งก๋Š” ๊ธฐ๋Šฅ์  ์—ญํ• โ€ โ€” ์ƒํƒœ ํ‰๊ฐ€ โถ / ์ •์ฑ… ์กฐ๊ฑด โท / ์ธ์ง€์  ๊ณ„ํšยท์ถ”๋ก  โธ / ํ†ตํ•ฉ VLA โน โ€” ๋กœ ์ž๋ฅด๊ณ , ์ด์™€ ์ง๊ตํ•˜๋Š” 5๊ฐœ ๊ณตํ•™ ์ถ•(granularity, data/supervision, cost/latency, environments/evaluation, task specification)์œผ๋กœ ๋‹ค์‹œ ๊ฐ€๋กœ์ง€๋ฅธ IJRR ์Šน์ธ ์„œ๋ฒ ์ด(v7, 2026-06).
  • ๋ฌด์—‡์„ ์–ป๋Š”๊ฐ€: โ‘  ์ด ๋ถ„์•ผ์˜ ์ง€ํ˜•๋„ ํ•œ ์žฅ(Fig. 3), โ‘ก ๋„ค ๊ฐˆ๋ž˜ ๊ฐ๊ฐ์˜ ๊ณ„๋ณด ์„œ์‚ฌ(๋ˆ„๊ฐ€ ์–ด๋–ค ๋ณ‘๋ชฉ์„ ์–ด๋–ป๊ฒŒ ๋ฌผ๋ ค๋ฐ›์•„ ๊ณต๊ฒฉํ–ˆ๋Š”๊ฐ€), โ‘ข ๋Œ€ํ‘œ๊ธฐ๋ฒ•์˜ ๋‹จ์ ๊นŒ์ง€ ์ ํžŒ ๋น„๊ตํ‘œ 4์žฅ, โ‘ฃ ํŒŒ๋ผ๋ฏธํ„ฐยทํ•˜๋“œ์›จ์–ดยท์ œ์–ด ์ฃผํŒŒ์ˆ˜ยทํด๋ผ์šฐ๋“œ ์˜์กด์„ ๋ชจ์€ ์ง€์—ฐ์‹œ๊ฐ„ ํ‘œ, โ‘ค ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ 6์ข…ยท๋ฒค์น˜๋งˆํฌ 11์ข…ยทํƒœ์Šคํฌ ๊ณ„์—ด 3๋ถ„๋ฅ˜, โ‘ฅ ๋ด‰ํ•ฉํ•˜์ง€ ์•Š์€ ๋…ผ์Ÿ 3์ œ, โ‘ฆ 2018โ†’2026 ์—ฐํ‘œ(๋ถ€๋ก Table 11ยท12).
  • ๋ฌด์—‡์„ ๋ชป ์–ป๋Š”๊ฐ€: ๋ฐฉ๋ฒ• ๊ฐ„ ์ •๋Ÿ‰ ์„ฑ๋Šฅ ๋น„๊ต, 2026๋…„ ์ƒ๋ฐ˜๊ธฐ ์ดํ›„ VLA, Isaac/Genesis/ManiSkill ๊ณ„์—ด ์‹œ๋ฎฌ๋ ˆ์ด์…˜ ์ƒํƒœ๊ณ„, ํ˜•์‹์  ์•ˆ์ „ ๊ธฐ๋ฒ•์˜ ๊ณ„๋ณด.
  • ์ฝ๋Š” ์ˆœ์„œ ์ถ”์ฒœ: Sec. 3(๋ถ„๋ฅ˜ ์ •์˜) โ†’ Fig. 3 โ†’ ๊ด€์‹ฌ ์žˆ๋Š” ๊ฐˆ๋ž˜ 1๊ฐœ(Sec. 4~7 ์ค‘) โ†’ Sec. 8(5์ถ•) โ†’ Sec. 9(๋…ผ์Ÿ) โ†’ Sec. 10.1.4(zero-shot์˜ ์กฐ๊ฑด๋ถ€ ์„ฑ๊ฒฉ). ์‹œ๊ฐ„์ด ์—†์œผ๋ฉด Sec. 3 + Sec. 8 + Sec. 9๋งŒ ์ฝ์–ด๋„ ์ด ์„œ๋ฒ ์ด์˜ ๊ณ ์œ  ๊ธฐ์—ฌ๋Š” ๋Œ€๋ถ€๋ถ„ ํšŒ์ˆ˜๋œ๋‹ค.

Copyright 2026, JungYeon Lee