AI 자동화 연구 평가, AI 자동화 연구를 모델 안전 개선에 도입하기 전 무엇을 검증해야 하나
자동 연구 루프의 리더보드 개선을 배포 근거로 오해하지 않도록 개인정보 평가의 입력, 오류 비용, 독립 테스트와 사람 승인 조건을 분해한다.
자동 연구 루프의 리더보드 개선을 배포 근거로 오해하지 않도록 개인정보 평가의 입력, 오류 비용, 독립 테스트와 사람 승인 조건을 분해한다.
피드를 열고 반응하고 다시 방문하는 사용자 흐름을 따라 후보 생성과 랭킹, 이벤트 수집, 특징 저장소, 재학습과 장애 복구를 연결한 설계 사례다.
같은 사용자의 행이 train과 test에 함께 들어가면 새 사용자 성능이 낙관적으로 보일 수 있다. 세 가지 분할의 그룹 교집합과 점수 변화를 같은 조건에서 비교한다.
같은 자전거 수요 데이터에서 점예측 오차가 가장 작은 모델과 명목 커버리지에 가까운 모델은 달랐다. 시간 분할과 비대칭 비용으로 선택 기준을 다시 세운다.
예측 확률 0.8이 같은 점수대 집단의 실제 발생률 80%를 뜻하려면 필요한 데이터·평가·운영 조건을 통제 실험과 함께 정리한다.
랜덤 분할의 낙관 편향을 동일 합성 데이터에서 재현하고, horizon·gap·window를 실제 예측 조건에 맞추는 방법을 정리한다.
분류 점수를 실제 행동으로 바꾸는 임계값을 비용 행렬과 서비스 제약으로 선택하고, 보정·데이터 분리·base-rate shift까지 검증하는 방법을 정리한다.
JAGYEOKSU는 고립 트리 하나로 위험을 판정하지 않는다. 수도 사용 이력을 23개 특징으로 바꾸고 ML·통계·규칙 점수를 결합해 사람이 확인할 순서를 만든다.