본문 바로가기
반응형

전체 글122

📝 [DILL] 미래 예측을 넘어 도메인 불변 예측으로: VLA 지름길 학습 차단 한 줄 요약: 도메인 불변 미래 잠재를 예측하게 해 VLA가 시점·배경 같은 지름길에 기대지 않게 함🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 범용 로봇 정책임. 하지만 시점·배경·조명·카메라 설정처럼 과제와 무관한 시각 변화에 매우 취약함. 로봇 데이터는 특정 과제가 특정 시각 단서와 반복적으로 같이 나타나는 경우가 많아, 정책이 "무엇을 하라는지" 대신 "어떻게 보이는지"를 행동의 지름길(Shortcut)로 삼는 문제가 생김. 미래 예측 기반 방법도 원본 픽셀이나 얽힌(Entangled) 잠재를 예측 대상으로 삼으면 이 도메인 정보를 그대로 품게 됨.이 논문은 "미래를 예측하는 것만으로는 부족하고, 도메인 요인을 분리한 과.. 2026. 10. 1.
📝 [EgoHumanoid-V2] 분리 제어를 넘어 전신 협응으로: 사람 시연만으로 휴머노이드 학습 한 줄 요약: 사람 1인칭 시연을 정렬해 로봇 시연 없이 휴머노이드 전신 조작 VLA를 학습함🧍 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 정책으로, 학습하려면 로봇 원격조종(Teleoperation) 데이터가 많이 필요함. 이를 대신해 UMI나 VR 모션 캡처로 사람 시연을 모으는 연구가 늘었지만, 대부분 양팔 조작이나 이동처럼 팔과 하체를 따로 제어하는(Decoupled Control) 수준에 머묾. 사람처럼 팔·몸통·다리를 함께 쓰는 전신 협응 기술을 옮기려고 전신 추적 정책(Whole-Body Tracking Policy)에 사람 동작을 넣으면 손끝 오차가 크고, 온라인 IK로 보정하면 균형이 무너지는 문제가 있음.이 논문.. 2026. 10. 1.
📝 [V-JEPA Policy] 비디오 생성기 없이 예측 잠재 공간으로: 0.9B 월드-액션 모델 한 줄 요약: 고정된 V-JEPA 2.1 잠재 공간 위에 미래 예측기와 행동 전문가를 함께 학습시켜 만든 0.9B WAM🔮 로봇이 '지금 장면'뿐 아니라 '행동하면 장면이 어떻게 바뀔지'까지 예측하도록 만드는 월드-액션 모델(World-Action Model, WAM)이 로봇 제어 분야에서 주목받고 있음. 최근 WAM은 대규모로 사전학습된 비디오 생성 모델이나 이미지 편집 모델을 가져와 예측 지식을 물려받는 방식이 주류임. 그런데 이렇게 하면 수십억 파라미터짜리 생성 백본까지 통째로 떠안게 되어 모델이 커지고 배포 비용도 늘어남.이 논문은 "완전한 시각 생성 모델을 물려받지 않아도, 대규모 예측 사전학습으로 얻은 V-JEPA의 고정된 잠재 공간만으로 효과적인 WAM을 처음부터 학습할 수 있다"는 원리를.. 2026. 10. 1.
📝 [ActMem-VLA] 관찰 기억을 넘어 행동 기억으로: 얼린 VLA에 끼우는 메모리 플러그인 한 줄 요약: 실행한 행동 이력을 Mamba로 기억해 초기 디노이징을 조종하고, 얼린 π0.5는 그대로 둠🍎 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 생성하는 모델임. π0.5 같은 대부분의 VLA는 현재 관찰만 보고 행동을 정해서, "사과를 저울 위에 든 상태"가 무게를 재기 전인지 후인지 구분하지 못하는 지각적 앨리어싱(Perceptual Aliasing) 문제를 겪음. 과거 프레임을 넣거나 메모리 모듈을 붙이는 기존 방식은 연산량이 크고, 무엇보다 기존 VLA까지 다시 학습시켜야 하는 부담이 있음.이 논문은 "이미 실행한 행동 이력만 Mamba로 압축해 경량 PreAction Expert가 초기 고노이즈 디노이징을 조종하게 하면, 원래 .. 2026. 10. 1.
📝 [Self-Compensating VLA] 명령-실행 오차를 넘어 자가 보정으로: 배포 중 적응하는 VLA 한 줄 요약: 명령과 실제 실행의 잔차만으로 VLA를 온라인 LoRA 적응시켜 실제 로봇 성공률 30%p+ 향상🦾 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 범용 조작 모델임. 지금까지의 강건성 연구는 시각 교란, 지시문 바꿔 말하기, 또는 출력 명령에 합성 가우시안 노이즈를 더하는 수준에 머물렀음. 하지만 실제 로봇은 마모, 무거운 하중, 온도 변화 때문에 명령과 다르게 움직이며, 이 실행 오차(Execution Error)는 관절 상태와 움직임 이력에 따라 달라져 기존 방식으로는 제대로 다뤄지지 않았음.이 논문은 "VLA가 내린 명령과 로봇이 실제로 실행한 동작의 잔차만으로, 보상이나 라벨 없이 배포 중에 정책을 온라인 적응시켜 실.. 2026. 10. 1.
📝 [RawVLA] 고정 ISP를 넘어 RAW로: 행동을 위한 신경 ISP 한 줄 요약: 동결된 VLA 앞단에 RAW를 적응적으로 렌더링하는 스트리밍 신경 ISP를 붙여 저조도·과노출에 강하게 만듦📷 🤖 VLA(Vision-Language-Action) 모델은 카메라 이미지와 언어 지시를 받아 로봇 행동을 출력하는 모델임. 기존 VLA는 카메라 ISP(Image Signal Processor)가 RAW 센서 값을 고정된 방식으로 바꾼 RGB 이미지를 그대로 입력으로 씀. 그러나 ISP의 노출·색·톤·노이즈 처리는 작업과 무관하지 않아서, 저조도나 과노출 상황에서는 클리핑·노이즈·톤 압축 때문에 조작에 필요한 시각 정보가 사라지고 정책이 무너짐.이 논문은 "RAW-to-RGB 처리는 VLA 행동을 크게 좌우하며, 행동 손실로 학습한 적응형 신경 ISP만 붙여도 동결된 정책의 .. 2026. 10. 1.
📝 [Faster and Better?] 성공률을 넘어 궤적으로: VLA 가속 평가 버그 감사 한 줄 요약: VLA 가속 기법의 성공률 상승은 벤치마크 버그와 설계 한계가 만든 착시일 수 있음을 7개 벤치마크 감사로 보여줌🔍 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 출력하는 모델이고, 실제 로봇에 올리려면 추론 지연(Latency)을 줄이는 가속 기법이 꼭 필요함. 가속 기법은 보통 "속도는 빨라졌고, 시뮬레이션 벤치마크 성공률은 떨어지지 않았다"는 방식으로 검증됨. 그런데 원래 정책의 계산을 근사만 하는 Training-free 가속 기법이 오히려 원본보다 높은 성공률을 내는 이상 현상이 나타남. 성공률 숫자만으로는 이것이 실제로 더 잘 수행한 결과인지, 성공 판정기(Success Checker)의 결함 때문인지 구분할 수 없음.이 .. 2026. 10. 1.
📝 [UAD] 균일 디노이징을 넘어 긴급도 순으로: 급한 행동부터 먼저 내보내기 한 줄 요약: 급한 행동만 1스텝으로 먼저 내보내고 나머지는 실행 중에 다듬어 VLA 지연을 최대 1.89배 줄임⏱️ 🤖 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 만드는 모델로, 최근엔 Diffusion·Flow-matching으로 여러 스텝의 행동 청크(Action Chunk)를 반복 디노이징해 생성함. 문제는 이 반복 연산이 느려서, 청크 하나 실행에 500ms 걸릴 때 다음 청크 생성에 약 300ms가 들어 로봇이 사이클의 30% 이상을 멈춰 기다린다는 점임. 기존 가속 기법은 청크 전체를 한 덩어리로 보고 모든 행동에 같은 디노이징 예산을 줌. 하지만 행동은 한꺼번에 생성돼도 실행은 하나씩 순서대로 되므로, 앞쪽 행동과 뒤쪽 행동의 긴급도는.. 2026. 10. 1.