본문 바로가기
반응형

전체 글137

📝 [PyRUA-Lean] 툴 호출을 넘어 코드 실행으로: 토큰은 줄이고 성공률은 올리기 한 줄 요약: VLM이 로봇 프리미티브를 Python 셀로 묶어 실행해 성공률은 63.1%에서 71.7%로, 입력 토큰은 65% 줄임.🤖 VLM 에이전트는 카메라 이미지와 로봇 상태를 보고 이동·인식·파지 프리미티브나 VLA 정책을 호출하는 방식으로 로봇을 조작함. 지금까지는 도구 호출(Tool Calling) 인터페이스가 주로 쓰였는데, 앞 결과에 따라 달라지는 동작을 하나 실행할 때마다 VLM을 다시 불러야 함. 게다가 RPent처럼 이동할 때마다 카메라 이미지 여러 장이 자동으로 대화에 쌓이는 구조에서는, 위치 찾기·이동·복구를 반복하는 작업일수록 토큰 비용이 급격히 늘어남.이 논문은 "VLM이 로봇 프리미티브와 VLA 정책을 Python 셀 안에서 조건 분기·재시도와 함께 묶고, 요청한 관측만 .. 2026. 10. 3.
📝 [UniWAM] VLA와 WAM을 넘어 통합으로: 추론·생성·행동을 한 모델에 한 줄 요약: VLM 추론기·비디오 생성기·행동 예측기를 MoT로 묶어 인간·로봇·VQA 데이터로 함께 학습한 통합 로봇 모델🤖 VLA(Vision-Language-Action)는 이미지와 언어 지시를 받아 로봇 행동을 출력하는 모델로, 사전학습된 VLM의 의미 이해 능력을 물려받음. 하지만 행동만으로 지도하면 세계가 어떻게 변하는지(World Dynamics)를 제대로 배우지 못함. 반대로 비디오 생성 모델 기반의 World-Action Model(WAM)은 시공간 사전지식(Spatiotemporal Prior)은 강하지만, 분포 밖(OOD) 상황에서의 의미 이해와 복잡한 추론에는 약함.이 논문은 "VLM 기반 물리 추론기, 비디오 생성 기반 월드 생성기, 행동 예측기를 하나의 MoT로 묶고 데이터별.. 2026. 10. 3.
📝 [DuoMind] 단일 로봇 VLA를 넘어 협업으로: 말로 소통하는 멀티 로봇 한 줄 요약: 로봇마다 VLM 지휘자와 VLA 실행기를 두고 자연어 메시지로 협업하게 한 분산 계층형 프레임워크🤝 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 동작을 바로 출력하는 모델로, 최근에는 고수준 추론 모델이 작업을 쪼개 주고 VLA가 실행하는 계층형 구조가 주류임. 하지만 이런 발전은 대부분 로봇 한 대 기준이었음. LLM 기반 멀티 로봇 연구는 고수준 계획만 다루고 실제 동작은 미리 정의된 액션 프리미티브(Action Primitive)에 맡기는 경우가 많았음. 여러 로봇이 각자 시점만 보고 장기 협업하면서 정밀 조작까지 해내는 문제는 여전히 비어 있고, 이를 체계적으로 평가할 벤치마크도 부족했음.이 논문은 "로봇마다 VLM 오케스트레이터와 VL.. 2026. 10. 3.
📝 [Spike-driven VLA] Transformer를 넘어 스파이크로: 0.15B 뉴로모픽 VLA 한 줄 요약: 직접 학습한 SNN만으로 만든 첫 VLA로, 0.15B 파라미터·11.6mJ로 Meta-World 72.4% 달성🧠 🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 자연어 지시를 받아 로봇 행동을 바로 출력하는 범용 로봇 제어의 주류 패러다임임. 그러나 RT-2, OpenVLA, π0 같은 모델은 거대한 사전학습 Transformer에 의존해 메모리·지연·에너지 비용이 커서 엣지 로봇에 올리기 어려움. TinyVLA, SmolVLA 같은 경량 VLA도 결국 조밀한 곱셈-누산(MAC) 연산 구조는 그대로임. 기존 스파이킹 VLA는 ANN-to-SNN 변환에 의존해 원본 구조에 묶이고 여러 타임스텝을 누적해야 하는 시간 오버헤드가 컸음.이 논문은 "인코더·융합·행.. 2026. 10. 3.
📝 [Discrete Forcing] 반복 디노이징을 넘어 2-NFE로: 이산→연속 행동 생성 한 줄 요약: 이산 토큰으로 행동의 뼈대를 먼저 잡고 연속 1스텝으로 다듬어, 2-NFE로 반복 디노이징보다 높은 성능 달성🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 명령을 받아 로봇 행동을 직접 출력하는 모델임. 행동 표현은 크게 두 갈래로, 이산 토큰(Discrete Token)은 대략적인 구조를 압축해 담지만 정밀도가 떨어지고, 연속 행동(Continuous Action)은 정밀하지만 Flow Matching 디노이징을 여러 번 반복해야 해서 느림. 이미지 디퓨전은 저주파에서 고주파로 자연스럽게 '거칠게→세밀하게' 생성되지만, 행동에는 이런 주파수 구조가 없어 연속 공간에서 처음부터 디노이징하면 적은 스텝으로는 성능이 크게 떨어지는 문제가 있음.이 논문은 "이.. 2026. 10. 3.
📝 [GroundingPI] 범용 VLM을 넘어 그라운딩으로: 행동보다 지각을 먼저 한 줄 요약: 좌표 토큰 기반 4B 그라운딩 모델이 34개 벤치마크 평균 1위를 차지하고 로봇·자율주행 백본 성능까지 끌어올림🎯 로봇이 어수선한 책상에서 머그컵을 집으려면 "어떻게 움직일지"보다 먼저 "어디에 무엇이 있는지"를 정확히 찾아야 함. 그런데 VLA(Vision-Language-Action)와 WAM(World-Action Model)은 지각 능력을 범용 VLM이나 비디오 생성 백본에서 그대로 물려받음. 이런 백본은 물체가 빽빽한 장면이나 아주 작은 물체를 정밀하게 찾는 데 약함. 결국 부족한 지각 능력까지 귀한 로봇 데이터로 메워야 하는 병목이 생김.이 논문은 "점·박스 같은 시각 프리미티브(Visual Primitive)로 정밀한 그라운딩을 먼저 익힌 지각 전용 파운데이션 모델이 로봇 조.. 2026. 10. 3.
📝 [Aerial Whole-Body VLA] 로컬 VLA를 넘어 장면 규모로: 드론 매니퓰레이터 임무 합성 한 줄 요약: 합성 데이터로 학습한 로컬 VLA를 MPAR와 Scene Graph로 엮어 드론 다지점 조작을 수행🚁 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 직접 출력하는 정책으로, 최근 팔 달린 드론(UAM)에도 적용되기 시작함. 하지만 기체·팔·그리퍼가 결합된 전신(Whole-Body) 시연을 실제 드론으로 모으는 건 비싸고 위험함. 또 비동기 추론 때문에 새 행동 청크가 도착했을 때 경과 시간과 실제 진행 상태가 어긋나고, 멀리 떨어진 여러 작업 지점을 하나의 임무로 잇는 방법도 부족함.이 논문은 "합성 데이터로 학습한 로컬 전신 VLA 스킬을 측정 진행도 기반 궤적 실현과 Scene Graph 기반 조합으로 연결하면, 실기체 시연 없이.. 2026. 10. 2.
📝 [Optimus-R] 파라미터 튜닝을 넘어 메모리 튜닝으로: 스킬 뱅크형 VLA 한 줄 요약: VLA 적응을 가중치 업데이트 대신 쿼리-스킬 메모리 튜닝으로 바꿔 데이터 효율과 망각 억제를 함께 잡음🤖 Vision-Language-Action(VLA) 모델은 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 범용 조작 정책임. 그러나 새 작업·물체·도메인에 맞추려면 대부분 전체 미세조정(Full FT)이나 LoRA로 모델 가중치를 다시 업데이트함. 이런 파라미터 중심(Parameter-centric) 방식에서는 새 스킬마다 가중치가 암묵적으로 바뀌어 적응 비용이 크고, 이전에 배운 작업을 잊는 치명적 망각(Catastrophic Forgetting)이 생길 위험이 있음.이 논문은 "VLA 내부에서 뽑은 쿼리·스킬 표현을 외부 메모리 뱅크에 명시적으로 저장하고 잔차로만 갱신.. 2026. 10. 2.