반응형 전체 글175 📝 [MobiAgent] 고정 서브태스크를 넘어 자가 진화로: 이중 루프 모바일 매니퓰레이션 한 줄 요약: 원자 스킬 조합·시각 검증 Inner Loop와 무라벨 데이터 재활용 Outer Loop로 장기 모바일 조작을 개선함🤖 🏠 모바일 매니퓰레이션(Mobile Manipulation)은 로봇이 집 안을 돌아다니며 물건을 집고 버리는 등 이동과 팔 조작을 여러 단계에 걸쳐 섞어 수행하는 과제임. OpenVLA, π0.5 같은 VLA(Vision-Language-Action) 모델은 짧은 탁상 작업에는 강하지만, 장기 과제에서는 오류가 누적되고 이동·팔 제어를 한 모델에 몰아넣어 용량 간섭(Capacity Interference)이 생김. LLM/VLM을 위에 얹은 계층형 에이전트도 서브태스크마다 정책을 고정 매핑해 재계획이 경직되고, 배포 후 스스로 학습하는 파이프라인이 없음.이 논문은 "조.. 2026. 10. 9. 📝 [Detect and Suppress] 파인튜닝 없이 내부 특징으로: VLA 적대적 패치 방어 한 줄 요약: SAE로 찾은 공격 특징을 프로브가 공격을 감지할 때만 억제해 VLA 강건성을 높임🛡️ 🤖 VLA(Vision-Language-Action) 모델은 카메라 이미지와 언어 지시를 받아 로봇 행동을 바로 출력함. 그런데 화면에 적대적 패치(Adversarial Patch) 하나만 붙여도 행동이 틀어져 작업에 실패할 수 있음. 지금까지의 방어는 이미지 전처리로 입력을 바꾸거나 적대적 파인튜닝(Adversarial Fine-tuning)으로 파라미터를 고치는 방식이었고, 파인튜닝은 정책을 다시 학습해야 해서 비용이 큼. 게다가 공격이 모델 내부의 어떤 메커니즘을 거쳐 실패로 이어지는지도 거의 밝혀지지 않았음.이 논문은 "SAE로 찾은 공격 관련 내부 특징을 선형 프로브가 공격을 감지한 순간에만.. 2026. 10. 9. 📝 [T²Mem] 외부 메모리를 넘어 정책 내부로: TTT 기반 VLA 기억 한 줄 요약: π0.5에 TTT fast-weight 메모리를 넣어 RoboMME 평균 성공률을 17.93%→56.83%로 높임🧠 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델이지만, 대부분 현재 관측만 보고 판단함. 그래서 "가려진 컵 속 물체 기억하기", "반복 횟수 세기"처럼 지나간 정보가 필요한 과제에서는 약함. 기존에는 장면 그래프·프레임 뱅크 같은 명시적 메모리나 외부 추론 모델을 붙였는데, 행동 예측 전에 정보가 버려지거나 왜곡될 수 있고 매번 긴 히스토리를 다시 처리해야 해서 추론 비용도 큼.이 논문은 "메모리가 없는 사전학습 VLA라도 행동 시연만으로, 외부 모델이나 메모리 라벨 없이 TTT fast weight에 히.. 2026. 10. 9. 📝 [LexiconVLA] 태스크 암기를 넘어 원자 행동 사전으로: 재사용 VLA 코드북 한 줄 요약: 원자 행동을 global·detail 코드북으로 사전화해 VLA가 처음 보는 태스크에서도 동작을 재조합하게 만듦🧩 VLA(Vision-Language-Action) 모델은 카메라 영상과 언어 지시를 받아 로봇 동작을 바로 출력하는 정책(Policy)임. 기존 VLA는 지시에서 동작으로 가는 매핑을 태스크 단위로 학습하기 때문에, 접근·파지·운반처럼 여러 태스크에 반복해 나오는 원자 행동(Atomic Action)이 파라미터 속에 암묵적으로만 남음. 저자들의 진단 실험에서 전체 태스크 성공률은 65.7~95.7%였지만, 같은 원자 행동만 따로 시키면 성공률이 28.5~38.9%로 떨어졌음. 그래서 학습 때 보지 못한(Unseen) 태스크에서는 이미 배운 동작조차 다시 조합해 쓰지 못함.이 .. 2026. 10. 9. 📝 [AeroManip-VLA] 텔레오퍼레이션을 넘어 RL 자동 생성으로: 공중 조작 VLA 벤치마크 한 줄 요약: GPU 병렬 시뮬레이션과 RL+전문가 규칙으로 드론 조작 시연 8만 개 이상을 사람 없이 생성함🚁 VLA(Vision-Language-Action)는 카메라 영상과 언어 지시를 받아 로봇 행동을 바로 출력하는 모델이고, 대부분 고정형·지상형 로봇을 대상으로 함. 드론에 그리퍼를 단 공중 조작기(Aerial Manipulator)는 높은 곳이나 장애물 너머까지 작업할 수 있지만, 비행과 조작이 강하게 얽혀 있고 6-DoF 움직임 때문에 시점이 계속 바뀜. 기존 AIR-VLA 벤치마크는 사람이 직접 원격 조종한 시연 3,000개에 의존해서, 물체·장면·초기 자세가 바뀔 때마다 데이터를 다시 모아야 하는 확장성 한계가 있었음.이 논문은 "GPU 병렬 시뮬레이션 위에서 재사용 가능한 RL 정책과.. 2026. 10. 9. 📝 [VLALight] 센서 상태값을 넘어 CCTV 영상으로: 신호등을 직접 켜는 VLA 한 줄 요약: 교차로 영상만 보고 신호 페이즈를 고르는 VLA를 만들고, 필요할 때만 깊게 추론하도록 RL로 학습함🚦 교통 신호 제어(Traffic Signal Control, TSC)는 교차로마다 어느 방향에 초록불을 줄지 정해 도시 전체의 정체를 줄이는 문제임. 기존 RL·LLM 기반 제어기는 시뮬레이터가 주는 대기열 길이, 차량 수 같은 정제된 교통 상태값에 의존하고, VLM 기반 방법도 장면 이해만 맡고 실제 신호 결정은 별도 RL 제어기에 넘김. 그런데 실제 도로에서는 센서 커버리지 부족, 고장, 통신 끊김 때문에 이런 상태값이 불완전하고, 이미 깔린 노변 카메라 영상과 신호 결정 사이에는 여전히 단절이 있음.이 논문은 "4방향 노변 카메라 영상만 입력받아 이웃 교차로와 협력하면서 신호 페이즈.. 2026. 10. 8. 📝 [GeoScaffold] 토큰 중요도를 넘어 공간 골격으로: VLA 토큰 프루닝 한 줄 요약: 토큰을 영역별로 고르게 남기는 학습 불필요 프루닝으로 토큰 20%만 써도 성공률 93.2% 유지🤖 VLA(Vision-Language-Action) 모델은 카메라 이미지와 언어 지시를 받아 로봇 행동을 바로 출력하는데, 여러 시점의 이미지를 시각 토큰(Visual Token)으로 바꾸면 입력이 길어져 추론 비용이 커짐. 그래서 기존 방법들은 어텐션 같은 의미적 관련성(Semantic Relevance) 점수로 중요한 토큰만 남기는 프루닝(Pruning)을 써 왔음. 그런데 로봇 조작은 물체를 알아보는 것뿐 아니라 그 물체가 장면 어디에 있는지도 알아야 하는 일이고, 중요도만 보고 토큰을 고르면 이 공간 배치(Spatial Layout)가 무너짐.이 논문은 "VLA 프루닝 성능은 어떤 토큰.. 2026. 10. 8. 📝 [Speed in the Blind Spot] 정답률 너머 내부 표상으로: 주행 VLM의 속도 인지 해부 한 줄 요약: 주행 VLM은 자차 속도를 속으로는 알면서도 제대로 말하지 못하고, 주변 차량 속도와 프레임 순서는 거의 활용하지 못함🚗 이미지와 언어를 함께 다루는 VLM(Vision-Language Model)은 자율주행에서 장면 이해와 주행 계획(Planning)에 점점 많이 쓰이고 있음. 그런데 기존 Video-VLM 벤치마크나 주행 벤치마크는 인지·추론·계획을 한 점수로 묶어서 평가함. 그래서 오답이 났을 때 원인이 모션 정보가 없어서인지, 시간 정보를 제대로 합치지 못해서인지, 아니면 내부에는 정보가 있는데 말로 꺼내지 못해서인지 가려낼 수 없음.이 논문은 "그럴듯한 미래 속도(Planning) 출력이 나온다고 해서 모델이 현재의 동적 상태를 영상에서 제대로 복원하고 시간 순서에 근거해 추론했.. 2026. 10. 8. 이전 1 2 3 4 ··· 22 다음