학습한 정책이 내놓는 행동 묶음 다듬기 모방학습 정책은 한 번에 여러 스텝짜리 행동 묶음을 내놓습니다. 묶음이 바뀌는 자리에서 속도가 튀거나 움직임이 끊기는데, 정책을 다시 학습하지 않고 뒤쪽에서 가벼운 최적화로 이 이음매를 다듬는 방법을 연구했습니다. LiPo 로 IJCAS 2025 에 실었습니다.Imitation LearningAction ChunkingTrajectory Optimization PaperarXivProject