반응형 LIBERO14 📝 [ReGuide] 재학습을 넘어 리퍼런트 교정으로: 학습 없이 VLA 조합 일반화 한 줄 요약: VLA가 틀리는 건 '어디서'뿐, 엔드이펙터를 올바른 대상 앞에 데려다주면 기존 스킬로 해결함🧩 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델임. 하지만 로봇 데이터에서는 물체·목적지·배경이 늘 같은 조합으로 나와서, 이미 본 요소를 새로 조합(Recomposition)하기만 해도 정책이 익숙한 시각 단서를 따라가 엉뚱한 물체를 집음. 기존 해법은 조합을 늘린 데이터 수집, 백본별 구조 수정 후 재학습, 외부 플래너·스코어러 기반 추론 시 조향(Steering)이었고, 모두 비용이 크거나 정책이 고려하지 않은 대상으로는 손을 옮겨주지 못함.이 논문은 "조합이 바뀌었을 때 VLA는 '어디서(WHERE)' 행동할지를 잘못 .. 2026. 10. 7. 📝 [Online-ES] 노이즈 가지치기를 넘어 궤적 진화로: Critic 없는 VLA 적응 한 줄 요약: Flow Matching VLA 궤적을 섭동하고 성공/실패로 가중한 MSE로 학습해, 가치 모델 없이 RL급 개선 달성🎲 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델이고, 최근에는 π0.5·GR00T처럼 Flow Matching으로 행동을 생성하는 방식이 주류가 됨. 이런 모델은 랜덤 잠재 노이즈(Latent Noise)에서 출발해 같은 장면에서도 매번 다른 궤적을 만들어냄. 그런데 같은 장면에서 성공 궤적과 실패 궤적이 함께 나오고, 상당한 확률 질량이 실패 영역에 남아 있는 '잘못 형성된(Ill-formed) 분포'가 흔함. 기존 RL 미세조정은 가치 모델(Value Model)이나 복잡한 어드밴티지(Advanta.. 2026. 10. 7. 📝 [Blackout vs. Freeze] 성공률 너머 물리적 위험으로: 카메라 고장 시 VLA 해부 한 줄 요약: 카메라 블랙아웃과 프리징은 비슷한 성공률 뒤에 서로 다른 물리적 위험을 숨기고 있음을 π0.5·GR00T로 분석함📷 🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 보고 로봇 행동을 직접 출력하므로, 시각 입력에 크게 의존함. 하지만 실제 현장에서는 작업자의 손이 카메라를 가리거나 조명이 꺼져 화면이 검게 변하고(Blackout), 센서·통신 장애로 같은 프레임만 반복 입력되는(Freezing) 일이 생김. 기존 연구는 이런 상황을 주로 작업 성공률로 평가해 왔고, 고장 유형별로 어떤 물리적 위험이 생기는지, 남은 카메라나 고유수용감각(Proprioception)이 이를 얼마나 보완하는지는 밝혀지지 않았음.이 논문은 "카메라 블랙아웃과 프리징은 성.. 2026. 10. 6. 📝 [TRUST] 추론 교정을 넘어 행동 교정으로: CoT 안전 인터페이스 검증 한 줄 요약: 추론을 고친다고 행동까지 고쳐지지는 않음. 교정 가능성과 행동 반영성을 나눠서 평가함🧠 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델이고, 요즘은 행동 전에 사고 연쇄(Chain-of-Thought, CoT)로 장면 해석과 계획을 텍스트로 먼저 쓰는 추론형 VLA가 늘고 있음. 이 CoT를 들여다보다가 틀린 추론을 잡아 고치면 위험한 행동을 미리 막을 수 있지 않겠냐는 기대가 있음. 다만 추론을 바로잡아도 정책이 그 추론대로 움직이는지는 따로 검증된 적이 없었음.이 논문은 "토큰 단위 가치 모델로 frozen VLA의 CoT를 감시·교정할 수는 있지만, 추론 정확도가 오른다고 실제 행동 성능까지 저절로 오르지는 않는다".. 2026. 10. 5. 이전 1 2 3 4 다음