반응형 Vision-Language-Action71 📝 [PRICE] 평가자 없이 결과만으로: 행동 청크별 크레딧 추론 한 줄 요약: 물리적으로 대응되는 상태를 궤적끼리 비교해 최종 성공 신호만으로 청크별 크레딧을 부여하는 RL 기법🤖 VLA(Vision-Language-Action) 모델은 모방 학습으로 기본 조작 능력을 익힌 뒤, 강화학습(RL)으로 추가 성능을 끌어올림. 대표적인 Outcome 기반 GRPO는 작업 성공 여부만 보상으로 쓰기 때문에 단계별 보상 설계가 필요 없다는 장점이 있음. 다만 한 궤적 안의 모든 행동 청크(Action Chunk)에 같은 어드밴티지를 주므로, 잡기·운반은 잘하고 마지막 배치에서만 실패한 에피소드도 초반의 좋은 행동까지 통째로 벌을 받음. 이를 보완하려는 기존 방법들은 Process Reward, 학습된 가치 모델, 월드 모델 같은 별도 평가자(Evaluator)가 필요했음.이.. 2026. 10. 6. 📝 [Cue the Flow] 비주얼 프롬프트를 넘어 액션 조향으로: 동결 VLA 어댑터 한 줄 요약: 동결된 π0.5의 속도장을 공간 단서로 조향하는 초경량 어댑터로 신규 물체·지시 조작 성공률을 약 2배로 높임.📦 배송 로봇은 "Joseph 이름이 적힌 포장 봉투 줘" 같은 자유로운 지시를 듣고, 처음 보는 물체를 집어야 함. 기존 이중 시스템(Dual-System)은 VLM이 지시를 시각 프롬프트로 바꾸고 기하 기반 제어기가 실행하는데, 인식이 흔들리거나 물체가 움직이면 쉽게 깨짐. 시각 프롬프트를 VLA 입력에 넣는 방식도 프롬프트가 행동 생성에 어떻게 반영되는지가 암묵적이라, 새로운 언어-물체 매핑에서는 엉뚱한 물체로 향하는 문제가 남아 있음.이 논문은 "사전학습된 Flow-matching VLA는 이미 조작할 줄 알고 '무엇을' 집을지만 모를 뿐이므로, 공간 단서로 동결된 정책의.. 2026. 10. 6. 📝 [Blackout vs. Freeze] 성공률 너머 물리적 위험으로: 카메라 고장 시 VLA 해부 한 줄 요약: 카메라 블랙아웃과 프리징은 비슷한 성공률 뒤에 서로 다른 물리적 위험을 숨기고 있음을 π0.5·GR00T로 분석함📷 🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 보고 로봇 행동을 직접 출력하므로, 시각 입력에 크게 의존함. 하지만 실제 현장에서는 작업자의 손이 카메라를 가리거나 조명이 꺼져 화면이 검게 변하고(Blackout), 센서·통신 장애로 같은 프레임만 반복 입력되는(Freezing) 일이 생김. 기존 연구는 이런 상황을 주로 작업 성공률로 평가해 왔고, 고장 유형별로 어떤 물리적 위험이 생기는지, 남은 카메라나 고유수용감각(Proprioception)이 이를 얼마나 보완하는지는 밝혀지지 않았음.이 논문은 "카메라 블랙아웃과 프리징은 성.. 2026. 10. 6. 📝 [UAO] 성능 경쟁을 넘어 보안으로: 3cm 공 하나로 VLA 무력화 한 줄 요약: 텍스처를 최적화한 3cm 구체 하나로 π0·RDT의 평균 성공률을 31.2~39.9% 떨어뜨린 물리 적대 공격🛡️ VLA(Vision-Language-Action) 모델은 카메라 영상과 자연어 지시를 받아 로봇 행동을 바로 출력하는 end-to-end 정책으로, 디지털 세계에 머무는 LLM·VLM과 달리 실제 물체와 사람을 직접 다룸. 그런데 지금까지 VLA 연구는 성능 향상에만 집중했고, 적대적 공격(Adversarial Attack)이나 보안 평가는 거의 다뤄지지 않았음. 기존의 물리 적대 패치·객체 공격은 자율주행 인식기나 단순 모방학습·강화학습 정책을 겨냥한 것이라, 멀티모달 융합·디퓨전 기반 생성·시간적 의사결정이 얽힌 VLA에는 그대로 옮겨 쓸 수 없음.이 논문은 "표면 텍스처.. 2026. 10. 6. 이전 1 2 3 4 ··· 18 다음