본문 바로가기
반응형

전체 글110

📝 [Spatial Grafting] 2D 로봇 정책을 넘어 3D로: 액션 전문가에 기하 접목 한 줄 요약: 3D 복원 특징을 로봇 기준 좌표에 묶어 액션 전문가에 접목, VLA·WAM 모두 성능 향상.🦾 요즘 로봇 조작은 사전학습 백본에 Flow-Matching 액션 전문가(Action Expert)를 붙이는 방식이 주류임. VLA는 VLM을, WAM(World-Action Model)은 비디오 월드 모델을 백본으로 씀. 하지만 두 백본 모두 장면을 2D 픽셀로만 읽어 미터 단위 거리나 그리퍼 기준 표면 위치를 모름. 그래서 물체와 동작 순서는 맞게 고르면서도 정작 잡는 위치가 어긋나는 접촉 정밀도(Contact-level Precision) 문제가 남음.이 논문은 "고정된 3D 복원 모델의 잠재 특징을 로봇 기준 미터 좌표에 묶어 액션 전문가 후반부에만 접목하면, VLA·WAM 가리지 않고 .. 2026. 9. 30.
📝 [HexaAnything] VLA 단일 매핑을 넘어 코드로: 스스로 진화하는 물리 코딩 에이전트 한 줄 요약: 세계 상태와 실행 절차를 코드로 표현해 VLA를 도구로 쓰고, 검증된 궤적으로 스스로 진화하는 로봇 에이전트🤖 VLA(Vision-Language-Action)·WAM(World-Action Model)은 카메라 이미지와 지시문을 받아 곧바로 로봇 행동 청크(Action Chunk)를 출력하는 모델임. 그러나 지시문을 가려도 LIBERO 성공률이 96.2%→92.3%로 거의 변하지 않을 만큼 "장면→궤적" 암기에 가깝고, 시점·배치가 조금만 바뀌어도 성능이 무너짐. 근본 원인은 하위 목표, 완료 조건, 실패 복구가 모두 행동 시퀀스 안에 암묵적으로 묻혀 있어 검사·수정이 불가능하다는 표상(Representation)의 문제임.이 논문은 "세계 상태(Code as World)와 실행 절차(.. 2026. 9. 30.
📝 [Uni-VLaT] 시각을 넘어 전신 촉각으로: 촉각 앵커 VLA 적응 한 줄 요약: 전신 촉각으로 미래 촉각·고유감각·시각을 예측해 사전학습 VLA를 휴머노이드 접촉 제어에 적응시킴🤖 VLA(Vision-Language-Action)는 이미지와 언어 지시를 받아 로봇 행동을 바로 출력하는 사전학습 정책으로, 최근 휴머노이드 로코-매니퓰레이션(Loco-Manipulation)까지 확장되고 있음. 하지만 기존 VLA는 시각과 고유감각(Proprioception)에만 의존해 접촉을 간접적으로만 다룸. 그래서 등이나 팔처럼 카메라에 가려진 부위의 접촉, 점점 무거워지는 짐 같은 변화하는 물리 상호작용에서 접촉이 부족하거나 과해져 불안정하고 위험해짐. 촉각 특징을 단순히 이어붙이는(Concatenation) 방식으로는 사전학습 VLA가 접촉을 몸 반응·장면 변화와 연결하지 못함... 2026. 9. 30.
📝 [CATok] 압축을 넘어 생성으로: Flow Matching 기반 인과적 액션 토큰 한 줄 요약: Flow Matching 디노이징 단계를 토큰 순서에 묶어 coarse-to-fine 인과 액션 토큰을 만듦🤖 VLA(Vision-Language-Action)는 이미지·언어를 이해하는 VLM이 로봇 행동까지 출력하는 모델이고, 그중 순수 자기회귀(Autoregressive) VLA는 연속 행동을 이산 토큰으로 바꿔 언어처럼 다음 토큰을 예측함. 기존 토크나이저는 이 과정을 압축 문제로만 다룸. 단순 Binning은 토큰 수가 너무 많고, FAST는 주파수 순서라 왼쪽→오른쪽 생성과 맞지 않으며, OAT의 순서도 토큰 위치에 의미가 담겨 있지 않음. 즉 무엇을 복원할지는 담지만 어떻게 생성할지는 담지 못한다는 한계가 있음.이 논문은 "Flow Matching의 디노이징 단계를 토큰 순서에.. 2026. 9. 30.
📝 [F4R] 시연 재수집을 넘어 실패 재구성으로: 자가 개선 VLA 루프 한 줄 요약: 실세계 실패를 진단·시뮬 재구성해 co-training과 RL로 VLA를 반복 개선하는 폐루프 프레임워크🤖 VLA(Vision-Language-Action) 모델은 대규모 시연 데이터로 학습해 다양한 조작 작업을 수행하지만, 낯선 물체 배치·조명·방해물 같은 분포 밖(OOD) 상황에서는 쉽게 실패함. 흔한 해법은 실패 상황에서 사람이 교정 시연을 다시 수집하는 Targeted BC지만, 비용이 크고 위험하며 확장이 어려움. Real-to-Sim-to-Real 방식도 있지만, 수작업 시나리오나 광범위한 랜덤화는 실제 배포 중 겪는 실패 분포와 맞지 않는 경우가 많음.이 논문은 "배포 중 관측된 실패 하나하나를 자동 진단해 상호작용 가능한 시뮬 환경으로 재구성하고, 그 주변에 학습을 집중하면.. 2026. 9. 30.
📝 [Holo-M] 연속 액션 전문가를 넘어 토큰으로: 휴머노이드 이산 VLA 한 줄 요약: 부위별 토크나이저와 그룹 이산 확산으로 휴머노이드 전신 행동을 언어 토큰처럼 생성함🤖 VLA(Vision-Language-Action)는 이미지와 언어 지시를 받아 로봇 행동을 직접 출력하는 모델임. 행동을 텍스트와 같은 어휘의 이산 토큰(Discrete Token)으로 표현하는 방식은 로봇 팔에서 효과가 입증됐지만, 휴머노이드 VLA는 여전히 VLM 뒤에 flow-matching·diffusion 기반 연속 액션 전문가(Action Expert)를 붙이는 방식에 의존함. 다리·몸통·팔·손을 모두 다루는 전신 행동 공간은 차원이 높고 이질적이라 토큰화·학습 데이터·실시간 디코딩이 모두 어려움.이 논문은 "휴머노이드 행동 공간을 4개 부위별 토크나이저로 쪼개 LLM 어휘에 편입하고 그룹 단.. 2026. 9. 30.
📝 [InfraVLA] 온보드 시야를 넘어 CCTV로: 인프라 카메라를 읽는 내비게이션 VLA 한 줄 요약: 건물 CCTV 영상을 토큰으로 넣고 2단계로 학습해, 로봇이 보지 못하는 목표와 막힌 통로를 파악하는 VLA🏭 창고·병원·사무실에는 이미 CCTV가 곳곳에 달려 있어 로봇이 서 있는 자리에서는 안 보이는 통로와 방을 실시간으로 비춤. 그런데 최신 내비게이션 VLA(Vision-Language-Action)를 포함한 대부분의 정책은 로봇에 달린 온보드 카메라만 씀. 그래서 목표가 시야 밖에 있으면 통로를 하나씩 뒤져야 하고, 막힌 통로에 들어갔다가 되돌아 나오기도 함. 단순히 CCTV 인코더만 붙이면 정책이 CCTV 입력을 무시하는 지름길 학습(Shortcut Learning)에 빠지는 문제도 있음.이 논문은 "사전학습된 내비게이션 VLA에 CCTV 전용 인코더를 붙이고 반사실(Counte.. 2026. 9. 30.
📝 [View Collapse] 적대적 학습의 착시를 넘어: 멀티뷰 VLA의 View Collapse 한 줄 요약: 멀티뷰 VLA에 적대적 학습을 적용하면 손목 카메라에만 의존하는 View Collapse가 생기며, View Swap으로 이를 완화함🤖 VLA(Vision-Language-Action)는 사전학습된 VLM에 카메라 영상과 언어 지시를 넣어 로봇 행동을 출력하게 만든 모델임. 학습 분포 안에서는 성능이 높지만 카메라 시점, 센서 노이즈, 조명이 바뀌면 성능이 크게 떨어짐. 기존에는 예상되는 변화를 데이터나 증강으로 직접 넣어줬는데, 모든 변화를 미리 설계하기는 어렵고 비용도 큼. 모델 적응형 섭동을 만드는 적대적 학습(Adversarial Training, AT)이 대안이 될 수 있지만, 멀티뷰 VLA에서 어떤 효과를 내는지는 밝혀지지 않았음.이 논문은 "멀티뷰 VLA에서 AT로 얻은 강건.. 2026. 9. 30.