정확도(Accuracy)란? AI 모델이 맞힌 비율을 읽는 법
정확도는 AI 분류 모델이 전체 예측 중 몇 개를 맞혔는지 보여주는 기본 평가 지표입니다.
혼동 행렬은 AI 분류 모델의 예측이 실제 정답과 어떻게 맞고 틀렸는지 보여주는 평가 표입니다.
Patronus AI의 5000만 달러 투자 소식은 기업 AI가 모델 성능 경쟁을 넘어 에이전트 테스트, 디지털 월드 기반 검증, 안전성 운영으로 이동하고 있음을 보여줍니다.
AI 벤치마크는 여러 AI 모델이나 시스템을 같은 시험 조건에서 비교하기 위한 표준 테스트입니다.
AI 레드팀은 AI 시스템을 공격자나 악의적 사용자 관점에서 시험해 보안 취약점, 유해 출력, 데이터 유출, 정책 우회, 자동화 오작동 가능성을 미리 찾는 안전 평가 활동입니다.
로그프로브는 AI가 생성한 출력 토큰을 얼마나 그럴듯한 선택으로 봤는지 나타내는 로그 확률 점수입니다.
AI 평가(Evals)는 AI 모델이나 AI 앱의 답변이 미리 정한 기준을 얼마나 잘 만족하는지 테스트하는 과정입니다.