본문 바로가기
반응형

전체 글160

📝 [PRICE] 평가자 없이 결과만으로: 행동 청크별 크레딧 추론 한 줄 요약: 물리적으로 대응되는 상태를 궤적끼리 비교해 최종 성공 신호만으로 청크별 크레딧을 부여하는 RL 기법🤖 VLA(Vision-Language-Action) 모델은 모방 학습으로 기본 조작 능력을 익힌 뒤, 강화학습(RL)으로 추가 성능을 끌어올림. 대표적인 Outcome 기반 GRPO는 작업 성공 여부만 보상으로 쓰기 때문에 단계별 보상 설계가 필요 없다는 장점이 있음. 다만 한 궤적 안의 모든 행동 청크(Action Chunk)에 같은 어드밴티지를 주므로, 잡기·운반은 잘하고 마지막 배치에서만 실패한 에피소드도 초반의 좋은 행동까지 통째로 벌을 받음. 이를 보완하려는 기존 방법들은 Process Reward, 학습된 가치 모델, 월드 모델 같은 별도 평가자(Evaluator)가 필요했음.이.. 2026. 10. 6.
📝 [Cue the Flow] 비주얼 프롬프트를 넘어 액션 조향으로: 동결 VLA 어댑터 한 줄 요약: 동결된 π0.5의 속도장을 공간 단서로 조향하는 초경량 어댑터로 신규 물체·지시 조작 성공률을 약 2배로 높임.📦 배송 로봇은 "Joseph 이름이 적힌 포장 봉투 줘" 같은 자유로운 지시를 듣고, 처음 보는 물체를 집어야 함. 기존 이중 시스템(Dual-System)은 VLM이 지시를 시각 프롬프트로 바꾸고 기하 기반 제어기가 실행하는데, 인식이 흔들리거나 물체가 움직이면 쉽게 깨짐. 시각 프롬프트를 VLA 입력에 넣는 방식도 프롬프트가 행동 생성에 어떻게 반영되는지가 암묵적이라, 새로운 언어-물체 매핑에서는 엉뚱한 물체로 향하는 문제가 남아 있음.이 논문은 "사전학습된 Flow-matching VLA는 이미 조작할 줄 알고 '무엇을' 집을지만 모를 뿐이므로, 공간 단서로 동결된 정책의.. 2026. 10. 6.
📝 [Blackout vs. Freeze] 성공률 너머 물리적 위험으로: 카메라 고장 시 VLA 해부 한 줄 요약: 카메라 블랙아웃과 프리징은 비슷한 성공률 뒤에 서로 다른 물리적 위험을 숨기고 있음을 π0.5·GR00T로 분석함📷 🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 보고 로봇 행동을 직접 출력하므로, 시각 입력에 크게 의존함. 하지만 실제 현장에서는 작업자의 손이 카메라를 가리거나 조명이 꺼져 화면이 검게 변하고(Blackout), 센서·통신 장애로 같은 프레임만 반복 입력되는(Freezing) 일이 생김. 기존 연구는 이런 상황을 주로 작업 성공률로 평가해 왔고, 고장 유형별로 어떤 물리적 위험이 생기는지, 남은 카메라나 고유수용감각(Proprioception)이 이를 얼마나 보완하는지는 밝혀지지 않았음.이 논문은 "카메라 블랙아웃과 프리징은 성.. 2026. 10. 6.
📝 [UAO] 성능 경쟁을 넘어 보안으로: 3cm 공 하나로 VLA 무력화 한 줄 요약: 텍스처를 최적화한 3cm 구체 하나로 π0·RDT의 평균 성공률을 31.2~39.9% 떨어뜨린 물리 적대 공격🛡️ VLA(Vision-Language-Action) 모델은 카메라 영상과 자연어 지시를 받아 로봇 행동을 바로 출력하는 end-to-end 정책으로, 디지털 세계에 머무는 LLM·VLM과 달리 실제 물체와 사람을 직접 다룸. 그런데 지금까지 VLA 연구는 성능 향상에만 집중했고, 적대적 공격(Adversarial Attack)이나 보안 평가는 거의 다뤄지지 않았음. 기존의 물리 적대 패치·객체 공격은 자율주행 인식기나 단순 모방학습·강화학습 정책을 겨냥한 것이라, 멀티모달 융합·디퓨전 기반 생성·시간적 의사결정이 얽힌 VLA에는 그대로 옮겨 쓸 수 없음.이 논문은 "표면 텍스처.. 2026. 10. 6.
📝 [DSDyn-VLA] 정적 VLA를 넘어 움직이는 세계로: Slow-Fast 이중 스트림 한 줄 요약: 광학 흐름·미래 상태 예측·RL 잔차 보정으로 움직이는 물체 조작 성공률을 끌어올린 VLA🏭 🤖 VLA(Vision-Language-Action)는 이미지와 언어 지시를 받아 로봇 행동을 바로 출력하는 모델로, 빨래 개기나 커피 만들기 같은 정적 작업은 잘 해냄. 그런데 컨베이어 벨트 위 물체처럼 대상이 움직이면 금방 무너짐. 정지 RGB 이미지에는 속도 정보가 없고(Perception Gap), 추론 지연 동안 세상이 바뀌어 버리며(Latency Gap), 행동 청크(Action Chunk)를 개루프로 실행하는 동안에는 변화에 반응하지 못하기(Control Gap) 때문임.이 논문은 "광학 흐름으로 움직임을 보고, 실행 시점의 상태를 미리 예측해 계획하며, 경량 RL 정책이 30Hz로.. 2026. 10. 6.
📝 [Planning Limits of Latent WM] 더 큰 예측기 대신 목표 위치: 월드 모델 계획의 한계 한 줄 요약: 잠재 월드 모델은 목표가 상상한 궤적 안에 있을 때만 행동을 믿을 만하게 고를 수 있음🔭 월드 모델(World Model)은 로봇이 행동하기 전에 "이렇게 움직이면 세상이 어떻게 바뀔지" 미리 상상해 보고 계획하게 해주는 모델임. V-JEPA 2처럼 잠재 공간(Latent Space)에서 미래를 예측하는 방식이 주목받지만, 지금까지의 연구는 대부분 이런 모델로 무엇을 할 수 있는지만 보여줬음. 예측이 언제까지 계획에 쓸모 있고 어디서 무너지는지는 아직 알려진 바가 거의 없음.이 논문은 "잠재 월드 모델의 계획 한계는 예측기 크기가 아니라 목표가 상상한 궤적 안에 있느냐로 정해지며, 완벽한 시뮬레이터조차 이 제약을 벗어나지 못한다"는 원리를 증명함!▲ Figure 1 · 목표가 5스텝 롤아.. 2026. 10. 5.
📝 [MotionWeave] 미래 영상 복원 대신 움직임으로: 동작 중심 VLA 한 줄 요약: 미래 프레임 대신 스텝별 로봇 팔 움직임 영역을 학습해 π0 대비 MetaWorld 평균 +8.6%p 달성🦾 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델임. 최근에는 행동 라벨만으로는 감독 신호가 부족해 미래 이미지·영상을 예측하는 월드 모델(World Model)을 붙이는 흐름이 대세임. 그러나 미래 장면 전체를 복원하면 배경·텍스처처럼 제어와 무관한 외형까지 학습하게 되고, 행동 청크(Action Chunk)를 하나의 전역 특징에서 디코딩하면 각 스텝이 같은 시각 증거를 공유해 "몇 번째 행동이 어느 영역을 바꾸는지" 대응 관계가 사라지는 문제가 있음.이 논문은 "미래 장면 전체를 재구성하지 않고, 행동 스텝별로 .. 2026. 10. 5.
📝 [IronMind] 리타게팅을 넘어 카메라 공간으로: 1만 시간 사람 영상 사전학습 한 줄 요약: 카메라 공간 행동 표현으로 1만 시간 1인칭 영상을 사전학습해 휴머노이드 OOD 성공률 55% 달성🤖 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델이지만, 손가락까지 쓰는 정교한 조작(Dexterous Manipulation)은 로봇 시연 데이터가 비싸서 규모를 키우기 어려움. 그래서 머리에 카메라를 달고 찍은 사람의 1인칭 영상(Egocentric Video)이 값싼 대안으로 떠올랐음. 하지만 사람 손과 로봇 손은 구조가 다르고, 저가 장비는 몸통·척추 자세를 기록하지 않아 기존 몸 리타게팅(Retargeting)에서 라벨 노이즈가 생김. 여기에 손 추적 오차와 영상·설명 문장 불일치 같은 데이터 품질 문제도 남아 있.. 2026. 10. 5.