반응형 VLA78 📝 [MobiAgent] 고정 서브태스크를 넘어 자가 진화로: 이중 루프 모바일 매니퓰레이션 한 줄 요약: 원자 스킬 조합·시각 검증 Inner Loop와 무라벨 데이터 재활용 Outer Loop로 장기 모바일 조작을 개선함🤖 🏠 모바일 매니퓰레이션(Mobile Manipulation)은 로봇이 집 안을 돌아다니며 물건을 집고 버리는 등 이동과 팔 조작을 여러 단계에 걸쳐 섞어 수행하는 과제임. OpenVLA, π0.5 같은 VLA(Vision-Language-Action) 모델은 짧은 탁상 작업에는 강하지만, 장기 과제에서는 오류가 누적되고 이동·팔 제어를 한 모델에 몰아넣어 용량 간섭(Capacity Interference)이 생김. LLM/VLM을 위에 얹은 계층형 에이전트도 서브태스크마다 정책을 고정 매핑해 재계획이 경직되고, 배포 후 스스로 학습하는 파이프라인이 없음.이 논문은 "조.. 2026. 10. 9. 📝 [Detect and Suppress] 파인튜닝 없이 내부 특징으로: VLA 적대적 패치 방어 한 줄 요약: SAE로 찾은 공격 특징을 프로브가 공격을 감지할 때만 억제해 VLA 강건성을 높임🛡️ 🤖 VLA(Vision-Language-Action) 모델은 카메라 이미지와 언어 지시를 받아 로봇 행동을 바로 출력함. 그런데 화면에 적대적 패치(Adversarial Patch) 하나만 붙여도 행동이 틀어져 작업에 실패할 수 있음. 지금까지의 방어는 이미지 전처리로 입력을 바꾸거나 적대적 파인튜닝(Adversarial Fine-tuning)으로 파라미터를 고치는 방식이었고, 파인튜닝은 정책을 다시 학습해야 해서 비용이 큼. 게다가 공격이 모델 내부의 어떤 메커니즘을 거쳐 실패로 이어지는지도 거의 밝혀지지 않았음.이 논문은 "SAE로 찾은 공격 관련 내부 특징을 선형 프로브가 공격을 감지한 순간에만.. 2026. 10. 9. 📝 [T²Mem] 외부 메모리를 넘어 정책 내부로: TTT 기반 VLA 기억 한 줄 요약: π0.5에 TTT fast-weight 메모리를 넣어 RoboMME 평균 성공률을 17.93%→56.83%로 높임🧠 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델이지만, 대부분 현재 관측만 보고 판단함. 그래서 "가려진 컵 속 물체 기억하기", "반복 횟수 세기"처럼 지나간 정보가 필요한 과제에서는 약함. 기존에는 장면 그래프·프레임 뱅크 같은 명시적 메모리나 외부 추론 모델을 붙였는데, 행동 예측 전에 정보가 버려지거나 왜곡될 수 있고 매번 긴 히스토리를 다시 처리해야 해서 추론 비용도 큼.이 논문은 "메모리가 없는 사전학습 VLA라도 행동 시연만으로, 외부 모델이나 메모리 라벨 없이 TTT fast weight에 히.. 2026. 10. 9. 📝 [LexiconVLA] 태스크 암기를 넘어 원자 행동 사전으로: 재사용 VLA 코드북 한 줄 요약: 원자 행동을 global·detail 코드북으로 사전화해 VLA가 처음 보는 태스크에서도 동작을 재조합하게 만듦🧩 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 동작을 바로 출력하는 정책(Policy)임. 기존 VLA는 지시에서 동작으로 가는 매핑을 태스크 단위로 학습하기 때문에, 접근·파지·운반처럼 여러 태스크에 반복해 나오는 원자 행동(Atomic Action)이 파라미터 속에 암묵적으로만 남음. 저자들의 진단 실험에서 전체 태스크 성공률은 65.7~95.7%였지만, 같은 원자 행동만 따로 시키면 성공률이 28.5~38.9%로 떨어졌음. 그래서 학습 때 보지 못한(Unseen) 태스크에서는 이미 배운 동작조차 다시 조합해 쓰지 못함.이 .. 2026. 10. 9. 이전 1 2 3 4 ··· 20 다음