perception에 대한 복잡서을 DP이나 VLM으로 하나로 묶어서 해준다 그와 함꼐 VLM이 모듈화되서 이용되고 있다 VLA/VLM Al-community에서도 spatial memory로 기억하는 구조 => Classical에 대해서는 SLA이나 위치 추정이나 obj에 대한 인식을 하는 방식이었다 => 이를 AI-based로 VLM으로 하나로 묶은 모듈형을 많이 이용중이다 percept : observation to state해주는 function을 뭘로 할거냐
superGlue : end-to-end로 하는데 function하나로 이미지 2개의 특징점을 연결해서 score방식으로 가장 나은 연결점을 찾아서 연결하는 방식 self-supervised / unsupervised 방식의 차이 이해해보기 DINO : teacher student형태로 학습시키는 방식
VGGT : img를 한번에 많이 넣어서 DUSTER랑과는 다르게 multi-view를 기반으로 하므로 한번에 Map이 나옴 => 딥러닝을 활용하여 한 경우 그러나 모두다 off-line이므로 mobile은 불가능 SLAM을 하긴하지만 mapping을 먼저 off-line으로 한이후에 함 그래서 현재는 경량모델 방식등을 찾는중
AGX(오린보드계열?) 라는 보드도 있는듯
D4RT : 동적으로 움직이는 구조여도 perception이 가능하다는 구조 reconstruction의 개념이해하기
training-data와 test-data의 차이에 따라 학습은 많은 성능차이를 보임 camera의 경우에는 학습데이터를 구할떄 lighting-condition이나 bluer에 영향이 크게 가해짐 semantic infomation이란?
VLA는 보통 무거운데 foundataion model이란 무엇? LLM-back-bone? Queen을 활용한 ? 학습방법이란? pro6000 pi-zero V-RAM 토르보드
MPC dreamer-계열 navigation world model world model은 동역학적인 관계를 엄밀하고 정확하게 가져가고 싶기에 이용하는거다 그런데 world model를 만들때 상태천이에 대한 움직임을 잘 서술하게 할건지를 도와줌?
LiDAR로 하면 되는데 왜 network방식으로 복잡하고 무겁게 해야하는가?
mujoco가 조금 학습이 느림 -> 병렬가속하려면 다른 환경써야함 contact는 필요없다면 mujoco도 아마 가능할것이다 fully-actuated가 re-construction을 할때 이용하는게 좋아보이는데 이제 잠수함이나 배 선박같은 narraw에 대한 곳을 움직일때 re-constrauction을 하는게 좋지않을까 싶다
ego motion이란? kipt모델 웨이모모델? self-superviesd가 되면 youtube도 된다