본문 바로가기
반응형

π0.511

📝 [D&R] 휴리스틱 메모리를 넘어 최적화로: 재귀 선택형 VLA 메모리 한 줄 요약: 행동과 관련된 과거 토큰만 재귀적으로 골라 64토큰 메모리로 RoboMME SOTA 달성🧠 🤖 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 출력하는 정책으로, 대개 현재 관측만 보고 행동을 정함. 그런데 "앞서 본 영상과 같은 방식으로 큐브를 옮겨라"처럼 지금 화면만으로는 정답을 알 수 없고 과거를 기억해야 하는 작업이 많음. 기존 메모리 방법은 픽셀 변화가 큰 프레임을 남기거나 과거를 잠재 벡터로 압축하는 식으로 무엇을 기억할지를 사람이 미리 정해 둠. 그래서 작업마다 성능 향상 폭이 들쭉날쭉했음.이 논문은 "최적 메모리는 현재 관측이 주어졌을 때 행동과 메모리 사이의 조건부 상호정보량 I(a; m | o)를 최대화하는 것이며, 이를.. 2026. 10. 4.
📝 [WBAG] EEF 중심을 넘어 전신으로: 잡은 물체까지 지키는 CBF 한 줄 요약: 로봇 전신과 잡은 물체 형상을 BP-SDF로 모델링하고, CBF-QP로 VLA 행동을 최소한만 고치는 안전 필터🦾 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하지만, 충돌을 막아주는 명시적인 기하 안전 모델은 갖고 있지 않음. 그래서 AEGIS 같은 추론 시점(Inference-time) 안전 필터가 나왔는데, 대부분 엔드이펙터(End-Effector) 주변만 타원체로 감싸 보호하는 단순한 방식임. 이 때문에 엔드이펙터는 장애물과 떨어져 있어도 위쪽 링크나 손목, 혹은 손에 쥔 물체가 장애물에 부딪히는 문제를 막지 못함.이 논문은 "로봇 전신 링크와 파지 후 붙는 물체 형상을 미분 가능한 BP-SDF 기반 CBF로 묶으면.. 2026. 10. 4.
📝 [Is Success All You Need?] 성공률을 넘어 궤적의 질로: 섭동 하 VLA 행동 강건성 평가 한 줄 요약: VLA는 섭동을 받으면 성공하더라도 움직임이 덜컥대고 길어지며, TSR만 봐서는 이를 알 수 없음🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델로, LIBERO 같은 벤치마크에서 성공률 90% 이상을 찍고 있음. 최근에는 LIBERO-Plus처럼 조명·카메라 각도·센서 노이즈 등을 바꿔 강건성(Robustness)을 따지는 연구가 늘었음. 하지만 강건성도 여전히 이진 과제 성공률(TSR)로만 측정됨. 그래서 그릇을 떨어뜨렸다가 다시 집거나 팔이 덜컥거려도 결국 성공만 하면 '강건하다'고 기록되는 한계가 있음.이 논문은 "섭동 하에서 성공한 궤적만 모아 부드러움·효율·그리퍼 행동 지표를 비교하면, TSR이 같아도 .. 2026. 10. 4.
📝 [EC-VLA & VA-VLA] 언어 지시를 넘어 EMG·시각 주석으로: 연속 조건화 VLA 한 줄 요약: 언어 대신 근전도(EMG) 신호나 분할 마스크로 작업을 지정해 어수선한 장면에서 VLA 성능을 크게 높임🦾 VLA(Vision-Language-Action) 모델은 카메라 이미지, 로봇 관절 상태, 언어 지시를 받아 로봇 행동을 출력하는 범용 로봇 정책임. 입력은 멀티모달이지만, 정작 "무엇을 할지"는 거의 전적으로 언어 프롬프트에 맡기고, 이 프롬프트는 작업 시작 시 한 번 주어진 뒤 고정됨. 그런데 물체가 많고 어수선한(Cluttered) 장면이나 미묘한 작업에서는 사람이 말보다 손짓·그림·시선으로 더 자연스럽게 설명하게 되며, 고정된 언어만으로는 작업을 충분히 지정하기 어려움.이 논문은 "언어 대신 근전도(EMG)를 고유수용 벡터에, 분할 주석을 이미지에 넣어 작업을 매 스텝 연속적.. 2026. 10. 3.