AI 뉴스 · 클로드 연구
협상을 잘하는 AI도 내 취향을 모르면 결과가 어긋납니다
Anthropic이 공개한 Project Swap은 직원 201명과 클로드 에이전트의 책 교환 실험입니다. 협상보다 사용자 선호를 정확히 파악하는 단계에서 더 큰 한계가 나타났습니다. 새 쇼핑 서비스 출시가 아닌 연구 결과입니다.
이 글에서 다룰 내용
책 교환 실험과 분석 대상, 61%의 분모, 부족분 85%의 의미, 모델 비교 기준, 실물 전달의 한계와 위임 전 점검
클로드가 대신 책을 고른다면
Anthropic이 2026년 9월 24일 공개한 Project Swap은 AI가 사람 대신 거래할 때 무엇이 잘되고 어디서 막히는지 살핀 연구입니다. 새로운 쇼핑 서비스 출시가 아니라 직원들을 대상으로 진행한 책 교환 실험입니다. 핵심은 거래를 잘하는 능력과 사용자가 원하는 결과를 얻는 능력이 다를 수 있다는 점입니다.
실험에는 6개 사무실의 직원 201명이 참여해 각자 교환할 책 한 권을 내놓도록 했습니다. 참가자는 약 5분간 클로드와 대화하며 독서 취향을 설명했고 Fable 5가 이를 바탕으로 책의 선호 순위를 추정했습니다. 별도로 참가자가 책 10권의 순위를 직접 매겨 평가 기준을 만들었지만 이 순위는 거래 에이전트에게 공개하지 않았습니다.
전체 참가자는 201명이지만 원문 그림 3·4의 순위 분석 대상은 188명으로 구분해야 합니다. 실제 행사에서 Opus 4.8 기반 AI 에이전트들은 공유 채널에서 교환을 제안하고 수락하거나 거절했습니다.
양자 교환뿐 아니라 여러 당사자가 책을 돌려받는 순환 교환도 가능했고 거래 당사자인 에이전트 모두가 수락해야 실행됐습니다. 이는 사람이 거래마다 승인했다는 뜻은 아닙니다. 거래 기록은 모두 공개됐으며 발언 동시성과 거래 시간에 제한을 둔 통제된 시장이었습니다.
61%는 거래 성공률이 아닙니다
Anthropic이 발표한 61%는 책 두 권 중 무엇을 더 좋아하는지에 대한 순서 일치율입니다. 사람이 직접 매긴 순위에서 책을 두 권씩 비교했을 때, 클로드의 추정 순서가 사람과 같았던 비율을 뜻합니다. 무작위로 판단할 때의 기준은 50%입니다.
따라서 “10권 중 6권을 맞혔다”거나 “참가자의 61%가 만족했다”는 해석은 맞지 않습니다. 짧은 대화로 취향을 어느 정도 파악했지만, 사용자 선호를 충분히 이해했다고 보기는 어렵다는 결과입니다.
취향 설명에 더 많은 정보를 제공한 참가자일수록 선호가 잘 반영되는 경향도 관찰됐습니다. 다만 이 관찰만으로 대화를 길게 하면 정확도가 반드시 높아진다는 인과관계를 단정할 수는 없습니다.
부족분의 85%는 협상 전에 생겼습니다
연구진은 참가자가 직접 매긴 순위를 기준으로, 얻은 책이 얼마나 선호하는 책인지 점수화했습니다. 가능한 최적 배치의 점수는 0.89였지만 에이전트들의 분산 협상 결과는 0.55였습니다. 이는 순위를 정규화한 효율 점수이지 만족 확률이나 거래 성공률이 아닙니다.
원인을 나누기 위해 클로드가 추정한 순위로 최적 배치를 계산한 뒤, 이를 다시 사람의 실제 순위로 평가하자 0.60이 나왔습니다. 연구진은 최적 결과 0.89와 협상 결과 0.55 사이 부족분의 85%를 부정확한 선호 정보에, 나머지 15%를 협상 단계에 귀속했습니다.
협상을 더 잘해도 출발점인 취향 정보가 어긋나면 개선에 한계가 있다는 의미입니다. 모든 AI 실패의 85%가 취향 문제라는 주장이 아니라, 이번 실험에서 최적 결과에 못 미친 원인을 분해한 수치입니다.
모델 비교도 누구의 순위인지가 중요합니다
연구진은 모델과 지시문을 바꿔 시장을 여러 차례 재실행했습니다. 클로드가 추정한 순위로 평가하면, 모델 선택은 자기 이익만 추구하는 ‘냉정한 협상’과 다른 참가자도 배려하는 ‘친사회적 협상’이라는 두 지시문의 차이보다 결과에 더 큰 영향을 미쳤습니다.
하지만 사람이 직접 매긴 순위로 평가하면 모델과 시장 설계에 따른 차이는 작았습니다. 클로드의 추정 순위를 기준으로 한 결과도 모델이 강할수록 일관되게 좋아지지는 않아 Fable은 Opus보다 낮았습니다.
이를 “강한 모델이면 사람의 만족도가 무조건 높아진다”거나 “프롬프트는 중요하지 않다”로 읽어서는 안 됩니다. AI가 세운 목표를 잘 달성하는 것과 그 목표 자체가 사람의 마음에 맞는 것은 별개의 문제입니다.
거래 합의와 현실의 완료 사이
화면에서 교환이 성사됐다고 모두가 책을 받은 것도 아닙니다. 일부 참가자가 책을 가져오지 않아 받지 못한 사람이 있었고, 수령·반납 추적 체계도 없어 책이 처음부터 없었는지 누군가 가져갔는지 구분하기 어려웠습니다. 거래 성사와 현실의 이행은 따로 확인해야 한다는 점이 드러났습니다.
연구진은 실제 시장이라면 참가자 확인, 거래 기록 확인, 불이행 대응 같은 운영 규칙이 필요하다고 논의합니다. AI가 대신 선택하고 거래하는 에이전틱 커머스에서도 협상 능력만큼 중요한 기반입니다.
콘텐츠나 업무 에이전트에도 적용해 볼 만한 시사점은 위임 전에 작은 선택 예시로 의도를 확인하는 것입니다. 연구진 역시 자율적으로 행동하기 전 몇 가지 예상 결정을 보여주는 방안을 제안합니다. 다만 이번 실험에서 참가자에게 순위 검증 결과를 보여주고 수정하게 한 것은 아닙니다.
일반적인 활용에서는 예산, 피하고 싶은 선택, 포기할 수 없는 조건을 설명한 뒤 AI의 판단이 맞는지 점검해 볼 수 있습니다. 이는 실무에 응용할 수 있는 권고이지, 이번 연구가 효과를 검증한 절차는 아닙니다.
이번 연구의 표본은 일반 소비자를 대표하지 않는 Anthropic 직원이며, 협조적으로 훈련된 클로드만 사용했습니다. 악의적인 경쟁자를 섞지 않았고 시장 규칙도 고정했으므로 실제 결제 시장이나 주식·코인 거래로 결과를 확대할 수는 없습니다. 그 범위 안에서 Project Swap은 “얼마나 잘 협상하는가”에 앞서 “누구를 위해 무엇을 원하는지 정확히 아는가”를 확인해야 한다는 과제를 보여줍니다.
한 줄 요약: AI 거래를 믿고 맡기려면 협상 실력보다 먼저 내 취향을 제대로 이해했는지 확인해야 합니다.
참고 출처
이 글의 실험 수치와 결과는 Anthropic 공식 연구 발표 기준입니다. 직원 대상 도서 교환 실험이며 일반 소비자 시장 전체에 그대로 적용할 수는 없습니다.
