데이터셋(Dataset)이란? AI가 학습과 평가에 쓰는 데이터 묶음
데이터셋은 AI가 패턴을 배우고 성능을 시험할 때 쓰는 데이터 묶음입니다. 학습·검증·테스트 데이터의 차이와 데이터 카드, 라벨링, 데이터 품질을 초보자 눈높이에서 정리합니다.
데이터셋은 AI가 패턴을 배우고 성능을 시험할 때 쓰는 데이터 묶음입니다. 학습·검증·테스트 데이터의 차이와 데이터 카드, 라벨링, 데이터 품질을 초보자 눈높이에서 정리합니다.
가중치는 AI 모델이 입력 정보를 얼마나 반영할지 정하는 학습된 숫자입니다. 파라미터·편향·특징·체크포인트와의 차이, AI 모델 파일을 볼 때 알아둘 점을 초보자 기준으로 설명합니다.
에폭은 AI 모델이 전체 학습 데이터를 한 번 모두 훑는 학습 단위입니다. 배치, 스텝, 체크포인트와의 차이와 실무 주의점을 쉽게 정리합니다.
컨텍스트 엔지니어링은 AI가 답하기 전에 봐야 할 지시, 자료, 도구, 메모리, 출력 형식을 알맞게 구성하는 설계 방식입니다.
시스템 카드는 AI 모델이나 AI 제품의 위험, 안전 평가, 완화 조치, 한계를 정리한 안전성 문서입니다. 모델 카드·벤치마크·레드팀과의 차이까지 초보자 눈높이로 설명합니다.
모델 서빙은 학습이 끝난 AI 모델을 앱, 웹사이트, 자동화가 호출할 수 있는 실행 환경에 올려 실제 요청에 응답하게 하는 운영 과정입니다.
RLHF는 사람이 더 낫다고 고른 답변이나 행동을 보상 신호로 바꿔 AI 모델을 조정하는 학습 방식입니다. 챗GPT 같은 대화형 AI를 이해할 때 꼭 알아야 할 기본 용어입니다.
시맨틱 검색은 검색어의 단어 일치보다 사용자의 의도와 문맥상 의미가 가까운 결과를 찾거나 더 위로 올리는 AI 검색 방식입니다.
지수 백오프는 API 요청이 실패했을 때 바로 반복하지 않고 재시도 사이의 대기 시간을 점점 늘려 과부하와 중복 실행을 줄이는 재시도 전략입니다.
프루닝은 AI 모델 안에서 덜 중요한 가중치나 연결을 줄여 모델을 더 희소하고 가볍게 만드는 모델 압축 방법입니다.