Microsoft 자체 AI 모델
MAI 이미지·음성 모델이 Microsoft 제품 운영 단계로 들어왔습니다
Microsoft는 MAI-Image-2.5-Pro와 MAI-Voice-2-Flash를 공개 프리뷰로 발표하고 Bing·PowerPoint·Dynamics 365·Azure의 실제 적용 범위를 공개했습니다.
이 글에서 다룰 내용
신규 모델의 공개 범위, Microsoft 제품의 실제 적용, GitHub Copilot·Excel 특화 모델 전략
Microsoft AI, 이제 자체 모델을 전면에 세운다
Microsoft AI의 움직임이 달라지고 있습니다. 그동안 Microsoft는 OpenAI 모델을 Azure와 Copilot 제품군에 빠르게 연결하며 AI 시장을 확장해 왔는데요. 이제는 이미지와 음성 영역에서 자체 모델의 존재감까지 키우고 있습니다.
이번에 공개된 MAI-Image-2.5-Pro와 MAI-Voice-2-Flash는 단순히 모델 두 개가 추가됐다는 의미에 그치지 않습니다. Microsoft가 서비스마다 필요한 성능과 비용, 응답 속도를 직접 조정할 수 있는 자체 AI 기반을 강화하고 있다는 신호로 볼 수 있습니다.
이 글에서 다룰 내용
Microsoft 자체 모델 전략의 변화, 이미지·음성 모델의 실제 적용 범위, GitHub Copilot·Excel용 특화 모델의 의미
MAI-Image-2.5-Pro가 중요한 이유
MAI-Image-2.5-Pro는 고품질 이미지 생성·세밀한 편집·이미지 안의 정확한 텍스트 표현을 겨냥한 모델입니다. Microsoft는 2026년 7월 23일 이 모델을 공개 프리뷰로 발표했습니다.
공식 발표는 Pro 모델 공개와 함께 기존 MAI-Image-2.5의 실제 제품 배치도 설명합니다. Bing Image Creator는 이미지 생성과 편집 전 과정을 MAI-Image-2.5가 담당하며, PowerPoint에서는 image-to-image 기능에, OneDrive에서는 주요 이미지 편집 시나리오의 기본 모델로 운영되고 있습니다.
Microsoft 발표 기준으로 PowerPoint 배치에서는 GPT-Image-2 대비 GPU 비용을 최대 84% 줄였습니다. 이 수치는 Microsoft의 특정 제품·배치 환경에서 측정된 결과이므로 모든 이미지 작업에 그대로 일반화할 수는 없습니다.
MAI-Image-2.5-Pro는 공개 프리뷰이고, MAI-Image-2.5의 제품 배치는 이미 운영 중이라는 점을 구분해야 합니다. 지원 지역·언어·상업적 이용 조건은 실제 서비스와 Microsoft Foundry 안내에서 다시 확인해야 합니다.
MAI-Voice-2-Flash는 속도 중심의 음성 AI다
MAI-Voice-2-Flash는 대규모 음성 서비스의 빠른 응답과 효율을 겨냥한 모델입니다. Microsoft는 이 모델도 공개 프리뷰로 발표했으며, MAI-Voice-2보다 2배 빠르고 32% 저렴하다고 설명했습니다.
실제 적용처는 Dynamics 365 Contact Center와 Azure Voice Live입니다. Dynamics 365에서는 콜센터 에이전트의 자연스러운 음성을 제공하고, Azure Voice Live에서는 낮은 지연 시간의 음성 대 음성 에이전트를 구축하는 모델 선택지로 제공됩니다.
Microsoft는 Dynamics 365 Contact Center 배치에서 GPU 비용을 최대 89% 줄였다고 밝혔습니다. 이 역시 Microsoft가 보고한 특정 운영 환경의 결과이며, 모든 고객·언어·트래픽 조건에서 같은 절감률을 보장하는 수치는 아닙니다.
한국어 품질, 지원 음성, 지역별 제공 범위와 API 조건은 공개 프리뷰 문서에서 별도 확인해야 합니다. 속도와 비용 수치만으로 언어별 자연스러움이나 실제 상담 품질을 단정해서는 안 됩니다.
PowerPoint와 Excel에서 확인된 실제 변화
PowerPoint에서는 MAI-Image-2.5가 image-to-image 기능에 이미 적용됐습니다. 이번 발표의 핵심은 미래의 연결 가능성보다 Microsoft 자체 이미지 모델이 실제 Office 제품에 들어갔다는 점입니다.
Excel에는 이미지 모델이 아니라 MAI-Code-1-Flash를 출발점으로 추가 학습한 특화 모델이 배치됐습니다. Microsoft는 실제 제품 트래픽에서 이 모델이 일반적인 Excel 작업에 대해 GPT-5.6과 비슷한 품질을 보이면서 더 효율적이었다고 설명합니다.
이 Excel 모델은 최신 가속기만 요구하지 않고 NVIDIA H100과 A100급 GPU에서도 서비스할 수 있다고 Microsoft는 밝혔습니다. 중요한 변화는 하나의 거대 모델을 모든 업무에 쓰기보다 제품 평가와 사용자 피드백으로 작은 특화 모델을 반복 개선하는 방식입니다.
GitHub Copilot까지 연결되는 자체 모델 전략
Microsoft의 자체 모델 확대가 OpenAI와의 협력 종료를 뜻한다고 단정할 근거는 없습니다. 이번 발표가 직접 확인한 것은 제품별 품질·속도·비용에 맞춘 자체 모델 선택지를 늘린다는 전략입니다.
GitHub Copilot에서는 MAI-Code-1-Flash가 2026년 6월부터 제공되고 있습니다. Microsoft 발표 기준으로 VS Code에서 GPT-5.4 Mini와 Claude Haiku 4.5보다 코드 수락률이 약 10% 높고, 중앙값 토큰 사용량은 약 10% 낮았습니다.
이 수치는 Microsoft 자체 제품 환경에서의 비교 결과입니다. 회사는 같은 hill-climbing 접근을 Copilot Chat·Outlook·PowerPoint 등으로 확대하고 있다고 밝혔으며, 제품별 평가 루프가 자체 모델 경쟁력의 핵심이 되고 있습니다.
결론, Microsoft는 AI 유통사에서 제작자로 이동 중이다
MAI-Image-2.5-Pro와 MAI-Voice-2-Flash의 공개는 Microsoft가 다른 회사의 AI 모델을 연결하는 역할에 머물지 않겠다는 신호입니다. 이미지와 음성 모델을 직접 확보하고 자사 서비스에 최적화하면서, AI 기술과 사용자 경험을 함께 통제하려는 방향이 선명해졌습니다.
앞으로 확인할 것은 공개 프리뷰 모델의 정식 제공 범위와 언어별 품질입니다. 동시에 Bing Image Creator·PowerPoint·OneDrive·Dynamics 365·Azure Voice Live·GitHub Copilot·Excel에서 보고된 성능과 비용 효과가 더 넓은 운영 환경에서도 재현되는지 살펴봐야 합니다.
한 줄 요약: Microsoft AI는 자체 이미지·음성 모델을 앞세워 Copilot과 Azure 전반을 아우르는 다중 모델 생태계로 이동하고 있습니다.
