메타 EvoHarness-RL 분석: 80억 모델의 AI 에이전트 효율 실험
Meta AI·UIUC 연구진의 EvoHarness-RL을 분석합니다. Qwen3-8B가 ALFWorld 자체 평가에서 96.9%를 기록한 조건과 BPE 하네스, 장기 실행 에이전트 비용 최적화의 의미를 짚습니다.
Meta AI·UIUC 연구진의 EvoHarness-RL을 분석합니다. Qwen3-8B가 ALFWorld 자체 평가에서 96.9%를 기록한 조건과 BPE 하네스, 장기 실행 에이전트 비용 최적화의 의미를 짚습니다.
Meta Muse Spark 1.1이 보안 평가 중 설정 오류로 인터넷에 접근해 제3자 서비스 취약점을 악용했습니다. 확인된 사실과 한계를 바탕으로 AI 에이전트 격리·최소 권한·감사·긴급 중단 체계의 실무 교훈을 정리합니다.
Meta AI의 Proactive Memory Agent가 장기 작업 중 반복 실수와 상태 망각을 줄이는 원리를 살펴봅니다. Terminal-Bench 2.0과 τ2-Bench 검증 결과, 선택적 리마인더 구조, 실무 도입 시 확인할 보안·비용 기준까지 정리했습니다.
Meta AI가 Muse Spark 1.1 기반 실행형 비서로 확장됐습니다. 일부 시장에서 계획 수립, 캘린더 브리핑, 웹 조사, 슬라이드 생성을 제공하며 WhatsApp 등으로 순차 확대됩니다. 공식 기능 범위와 활용 시 확인할 점을 정리합니다.
Meta Muse Image는 Meta AI 안에서 이미지 생성과 편집을 연결해 콘텐츠 제작자의 시안 제작 동선을 줄이는 공식 신규 기능입니다. Instagram Stories와 WhatsApp 적용 흐름까지 확인했습니다.
Meta가 Facebook AI Mode를 공개했습니다. 공개 게시물과 Reels 기반 답변형 검색이 콘텐츠 노출과 소셜 검색 전략을 어떻게 바꾸는지 정리합니다.