https://arxiv.org/pdf/2605.22903논문 스터디에서 리뷰한 논문을 간단하게 정리해둡니다..사실 Vision transformer 연구들에서 후반 레이어들의 토큰은 거의 비슷하다 뭐 이런 연구결과들이 많았는데 그걸 VLM에 적용해본것 같습니다..Abstract 간단 정리[Motivation]VLM이 벤치마크 점수가 높으면 이미지를 잘 이해한다 하는데 실제로 그런지 불분명이미지토큰의 75%가량 제거해도, 성능은 3%밖에 저하되지 않음원인은 중복성, 쉬운 벤치마크, 언어 편향 등의 원인이 존재[Method]전체 이미지 저하, 국소 가림, 질문 재형식화, 답변 공간 확장, 의사결정 분석, 레이어별 비전 토큰 기하학 분석[Insight]VLM이 시각 입력을 활용하긴 하지만, 세밀한 시각 증거..