AI 과학 연구 · 전문가 검증
클로드·BootLoops 연구 사례, 숫자보다 검증을 봅니다
매슈 슈워츠는 3개월 동안 18개 분야에서 공동저자 19명과 논문 원고 36편을 진행했다고 설명합니다. BootLoops는 저자의 도구이며, 계산 결과의 검증과 연구 방향 설정에는 사람이 필요합니다.
이 글에서 다룰 내용
논문 원고 수의 의미, BootLoops의 역할, 전문가 검증, AI 에이전트 운영 기록과 한계
BootLoops, 새로운 클로드 출시 소식이 아닙니다
2026년 10월 1일 Anthropic에 공개된 매슈 슈워츠 교수의 기고 ‘Claude-shaped science’는 AI 과학 연구의 가능성과 한계를 함께 보여줍니다. Anthropic 방문연구자로 활동 중인 저자는 자신이 소유·유지관리하는 오픈소스 BootLoops를 소개했습니다.
BootLoops는 정량 과학 계산을 위한 하네스입니다. 하네스란 AI가 도구를 사용하고 작업을 이어가도록 받쳐주는 실행 틀이라고 이해하면 쉽습니다. Anthropic의 제품이나 새 클로드 모델이 아니며, 기고 공개일을 최초 출시일로 받아들여서도 안 됩니다.
3개월 논문 원고 36편, 숫자는 어디까지 뜻할까요?
저자의 설명 기준으로 작업 기간은 3개월, 연구 범위는 18개 분야, 함께한 공동저자는 19명, 진행한 결과물은 논문 원고 36편입니다. 네 숫자는 각각 기간·분야·협업 인원·원고 수를 나타냅니다.
이는 출판 완료 논문 36편이나 전체 성과의 독립 검증을 뜻하지 않습니다. 모든 연구자의 생산성이 같은 수준으로 높아진다는 측정 결과도 아니며, 개별 연구 결과는 추가 탐색과 검증 중입니다.
숫자가 클수록 ‘얼마나 많이 만들었나’에 시선이 쏠리기 쉽습니다. 하지만 원고 작성, 출판, 검증은 서로 다른 단계이므로 이 사례를 소개할 때도 ‘논문 원고’라는 표현을 유지하는 것이 중요합니다.
계산이 맞는데, 왜 전문가가 방향을 바꿨을까요?
슈워츠가 강조한 장점은 코딩, 논문 읽기, 데이터 처리, 기존 기법을 다른 분야로 연결하는 능력입니다. 다만 다른 분야에서 얻은 계산 결과가 기술적으로 맞더라도 해당 분야 전문가가 보기에는 연구 가치가 약한 경우가 있었습니다.
전문가들은 결과의 가능성을 보고 질문과 방향을 수정했습니다. ‘계산을 풀었다’와 ‘중요한 연구를 했다’는 같은 말이 아니었던 셈입니다.
여기서 전문가 검증은 마지막에 오탈자를 확인하는 일이 아닙니다. ‘이미 알려진 사실을 더 정밀하게 계산했을 뿐인가’, ‘이 결과가 실제로 어떤 질문에 답하는가’를 따지는 과정에 가깝습니다.
AI가 제시한 답이 그럴듯할수록 질문도 한 단계 더 나아가야 합니다. 정답 여부뿐 아니라, 왜 이 답을 구할 필요가 있었는지 설명할 수 있어야 연구의 의미를 살펴볼 수 있습니다.
연구 자동화는 한 번의 지시보다 운영 구조에 가까웠습니다
저자는 프로젝트별 세션과 전체를 조정하는 세션을 나누고 중간 결과를 Markdown 파일에 기록했습니다. 검산과 반대 관점의 리뷰도 별도로 운영했다고 설명합니다.
이 모습은 AI 에이전트에게 ‘연구를 끝내줘’라고 맡긴 뒤 기다리는 방식과는 다릅니다. 작업을 분리하고 기록을 남기며 결과를 다시 확인하는 구조로 연구 자동화를 운영한 사례입니다.
일반 업무에 참고한다면 대화창에만 진행 상황을 쌓아두기보다 확인 가능한 작업 기록을 남기는 편이 좋겠습니다. 무엇을 시도했고 무엇이 실패했는지, 다음 판단에 필요한 근거가 무엇인지 따로 정리하는 방식입니다.
완료 선언, 시간 추정, 결론까지 확인해야 합니다
저자는 성급한 완료 선언, 부정확한 시간 추정, 계산 이후의 결론 오류, 맥락 압축으로 인한 정보 손실을 지적했습니다. 토큰과 계산 비용도 많이 들었다고 밝혔습니다.
따라서 이 사례를 ‘사람 감독 없이 저렴하게 연구를 끝냈다’고 요약하면 핵심이 달라집니다. 저자는 실제 데이터를 이해하고 확인하는 일과 개념적 판단에 사람이 여전히 필요하다고 강조합니다.
업무에서도 ‘완료했습니다’라는 문장 자체를 통과 기준으로 삼지 않는 편이 좋겠습니다. 결과 파일이 있는지, 요구 조건을 충족했는지, 근거와 결론이 연결되는지를 확인하는 기준부터 정해두는 것입니다.
일반 업무에 적용한다면, 결과보다 검증 기준부터
여기부터는 연구 성과가 아니라 이 사례에서 착안한 일반적인 업무 적용 제안입니다. 문헌 정리, 데이터 가공, 코드 작성처럼 범위를 나눌 수 있는 작업부터 시작하되, 과학 연구와 같은 성과가 난다고 가정하지 않는 것이 좋겠습니다.
먼저 사람이 목적과 통과 조건을 정하고 AI가 초안이나 계산 결과를 만든 뒤 별도의 검토 단계에서 오류를 찾도록 구성해 보세요. 자료 정리와 판단을 구분하면 검토할 대상도 더 선명해집니다.
예를 들어 보고서 작성에서는 출처 수집, 표 계산, 해석 문장 작성을 나눌 수 있습니다. 계산이 맞는지 확인하는 검토와 그 계산으로 해당 결론을 내려도 되는지 살피는 검토를 따로 두는 방식입니다.
사람의 역할은 사라지는 것이 아니라 선명해집니다
BootLoops 사례에서 눈여겨볼 부분은 원고 수뿐 아니라, 계산 능력과 연구 판단을 구분했다는 점입니다. 슈워츠의 설명에서도 문제 선택, 실데이터 이해, 개념 판단과 검증은 사람의 역할로 남습니다.
AI를 활용할 때 던질 질문도 ‘얼마나 많이 만들었나’에서 ‘어떤 근거로 믿을 수 있나’까지 넓혀보면 좋겠습니다. 속도와 신뢰를 함께 따지는 관점이 이 사례를 읽는 데 더 도움이 됩니다.
한 줄 요약: 클로드와 BootLoops는 연구의 계산과 연결을 돕지만, 연구 가치와 결론을 판단하는 사람의 검증까지 대신하지는 않습니다.
참고 출처
이 글은 Anthropic에 2026년 10월 1일 실린 매슈 슈워츠 교수의 기고를 바탕으로 작성했습니다. 연구 수치는 저자의 설명 기준이며, 기고 공개일과 BootLoops의 최초 출시일은 구분합니다.
