본문 바로가기
반응형

전체 글140

📝 [ATI-VLA] 공동 학습을 넘어 정렬 후 주입으로: 행동 중심 예측형 VLA 한 줄 요약: 관측과 행동을 공유 코드북으로 정렬한 뒤 행동 손실만으로 예측 잠재를 주입해 LIBERO 97.9% 달성🔮 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델임. 최근에는 미래 관측이나 월드 다이내믹스를 함께 예측해 행동 생성을 돕는 예측형 VLA(Predictive VLA)가 주목받음. 그런데 실제로는 DreamVLA, CoT-VLA 같은 예측형 모델이 OpenVLA-OFT 같은 직접 행동 예측 모델보다 성능이 낮은 경우가 많음. 관측과 행동 사이의 모달리티 격차(Modality Gap), 예측 손실과 행동 손실을 함께 최적화할 때 생기는 충돌 때문에 학습의 초점이 행동에서 벗어나는 것이 원인으로 지목됨.이 논문은 "관측과.. 2026. 10. 3.
📝 [EC-VLA & VA-VLA] 언어 지시를 넘어 EMG·시각 주석으로: 연속 조건화 VLA 한 줄 요약: 언어 대신 근전도(EMG) 신호나 분할 마스크로 작업을 지정해 어수선한 장면에서 VLA 성능을 크게 높임🦾 VLA(Vision-Language-Action) 모델은 카메라 이미지, 로봇 관절 상태, 언어 지시를 받아 로봇 행동을 출력하는 범용 로봇 정책임. 입력은 멀티모달이지만, 정작 "무엇을 할지"는 거의 전적으로 언어 프롬프트에 맡기고, 이 프롬프트는 작업 시작 시 한 번 주어진 뒤 고정됨. 그런데 물체가 많고 어수선한(Cluttered) 장면이나 미묘한 작업에서는 사람이 말보다 손짓·그림·시선으로 더 자연스럽게 설명하게 되며, 고정된 언어만으로는 작업을 충분히 지정하기 어려움.이 논문은 "언어 대신 근전도(EMG)를 고유수용 벡터에, 분할 주석을 이미지에 넣어 작업을 매 스텝 연속적.. 2026. 10. 3.
📝 [ChunkVLA-AM] 실험실을 넘어 3D 프린팅 작업 셀로: OpenVLA-OFT 실배치 한 줄 요약: OpenVLA-OFT를 LoRA로 FR3 로봇에 맞추고 8-step 청크로 배치해 92.9% 이송 성공률을 달성함🏭 적층 제조(Additive Manufacturing, 3D 프린팅) 현장에서는 출력물 회수·검사·이송 같은 후처리 작업에 사람이 미세 입자나 금속 분말에 노출되는 위험이 있음. 이미지와 언어 지시로 로봇 행동을 바로 만드는 VLA(Vision-Language-Action) 모델이 대안이지만, 새 로봇에 맞추려면 좌표계·행동 의미·정규화 규칙을 다시 정의해야 해서 비용이 큼. 게다가 데모를 모을 때와 실제 작업 셀의 조명이 달라지면 이미지만 보고 행동을 예측하는 정책의 성능이 떨어질 수 있음.이 논문은 "단안 데모를 RLDS로 변환해 OpenVLA-OFT를 LoRA로 FR3에.. 2026. 10. 3.
📝 [PyRUA-Lean] 툴 호출을 넘어 코드 실행으로: 토큰은 줄이고 성공률은 올리기 한 줄 요약: VLM이 로봇 프리미티브를 Python 셀로 묶어 실행해 성공률은 63.1%에서 71.7%로, 입력 토큰은 65% 줄임.🤖 VLM 에이전트는 카메라 이미지와 로봇 상태를 보고 이동·인식·파지 프리미티브나 VLA 정책을 호출하는 방식으로 로봇을 조작함. 지금까지는 도구 호출(Tool Calling) 인터페이스가 주로 쓰였는데, 앞 결과에 따라 달라지는 동작을 하나 실행할 때마다 VLM을 다시 불러야 함. 게다가 RPent처럼 이동할 때마다 카메라 이미지 여러 장이 자동으로 대화에 쌓이는 구조에서는, 위치 찾기·이동·복구를 반복하는 작업일수록 토큰 비용이 급격히 늘어남.이 논문은 "VLM이 로봇 프리미티브와 VLA 정책을 Python 셀 안에서 조건 분기·재시도와 함께 묶고, 요청한 관측만 .. 2026. 10. 3.
📝 [UniWAM] VLA와 WAM을 넘어 통합으로: 추론·생성·행동을 한 모델에 한 줄 요약: VLM 추론기·비디오 생성기·행동 예측기를 MoT로 묶어 인간·로봇·VQA 데이터로 함께 학습한 통합 로봇 모델🤖 VLA(Vision-Language-Action)는 이미지와 언어 지시를 받아 로봇 행동을 출력하는 모델로, 사전학습된 VLM의 의미 이해 능력을 물려받음. 하지만 행동만으로 지도하면 세계가 어떻게 변하는지(World Dynamics)를 제대로 배우지 못함. 반대로 비디오 생성 모델 기반의 World-Action Model(WAM)은 시공간 사전지식(Spatiotemporal Prior)은 강하지만, 분포 밖(OOD) 상황에서의 의미 이해와 복잡한 추론에는 약함.이 논문은 "VLM 기반 물리 추론기, 비디오 생성 기반 월드 생성기, 행동 예측기를 하나의 MoT로 묶고 데이터별.. 2026. 10. 3.
📝 [DuoMind] 단일 로봇 VLA를 넘어 협업으로: 말로 소통하는 멀티 로봇 한 줄 요약: 로봇마다 VLM 지휘자와 VLA 실행기를 두고 자연어 메시지로 협업하게 한 분산 계층형 프레임워크🤝 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 동작을 바로 출력하는 모델로, 최근에는 고수준 추론 모델이 작업을 쪼개 주고 VLA가 실행하는 계층형 구조가 주류임. 하지만 이런 발전은 대부분 로봇 한 대 기준이었음. LLM 기반 멀티 로봇 연구는 고수준 계획만 다루고 실제 동작은 미리 정의된 액션 프리미티브(Action Primitive)에 맡기는 경우가 많았음. 여러 로봇이 각자 시점만 보고 장기 협업하면서 정밀 조작까지 해내는 문제는 여전히 비어 있고, 이를 체계적으로 평가할 벤치마크도 부족했음.이 논문은 "로봇마다 VLM 오케스트레이터와 VL.. 2026. 10. 3.
📝 [Spike-driven VLA] Transformer를 넘어 스파이크로: 0.15B 뉴로모픽 VLA 한 줄 요약: 직접 학습한 SNN만으로 만든 첫 VLA로, 0.15B 파라미터·11.6mJ로 Meta-World 72.4% 달성🧠 🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 자연어 지시를 받아 로봇 행동을 바로 출력하는 범용 로봇 제어의 주류 패러다임임. 그러나 RT-2, OpenVLA, π0 같은 모델은 거대한 사전학습 Transformer에 의존해 메모리·지연·에너지 비용이 커서 엣지 로봇에 올리기 어려움. TinyVLA, SmolVLA 같은 경량 VLA도 결국 조밀한 곱셈-누산(MAC) 연산 구조는 그대로임. 기존 스파이킹 VLA는 ANN-to-SNN 변환에 의존해 원본 구조에 묶이고 여러 타임스텝을 누적해야 하는 시간 오버헤드가 컸음.이 논문은 "인코더·융합·행.. 2026. 10. 3.
📝 [Discrete Forcing] 반복 디노이징을 넘어 2-NFE로: 이산→연속 행동 생성 한 줄 요약: 이산 토큰으로 행동의 뼈대를 먼저 잡고 연속 1스텝으로 다듬어, 2-NFE로 반복 디노이징보다 높은 성능 달성🤖 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 명령을 받아 로봇 행동을 직접 출력하는 모델임. 행동 표현은 크게 두 갈래로, 이산 토큰(Discrete Token)은 대략적인 구조를 압축해 담지만 정밀도가 떨어지고, 연속 행동(Continuous Action)은 정밀하지만 Flow Matching 디노이징을 여러 번 반복해야 해서 느림. 이미지 디퓨전은 저주파에서 고주파로 자연스럽게 '거칠게→세밀하게' 생성되지만, 행동에는 이런 주파수 구조가 없어 연속 공간에서 처음부터 디노이징하면 적은 스텝으로는 성능이 크게 떨어지는 문제가 있음.이 논문은 "이.. 2026. 10. 3.