DATAUNION

마이크로소프트 실시간 음성 전사 AI 공개: MAI-Transcribe 한국어·가격·사용법 본문

Analysis

마이크로소프트 실시간 음성 전사 AI 공개: MAI-Transcribe 한국어·가격·사용법

DATAUNION 2026. 10. 3. 08:50
반응형

마이크로소프트 실시간 음성 전사 AI의 한국어 지원·가격·사용법을 소개하는 마이크와 음성 파형 개념 일러스트

말하는 도중 자막이 뜨는 AI는 어디까지 왔을까요? 마이크로소프트가 2026년 10월 1일 MAI-Transcribe-2-Streaming을 발표했습니다. 실시간 음성 전사, 한국어 지원, 가격이 궁금한 분들을 위해 공식 발표와 개발 문서에서 확인한 내용을 정리합니다.

작성·확인 기준: 2026년 10월 3일(한국시간) / 발표일: 2026년 10월 1일. 성능 수치는 발표 주체의 설명이며, 이 글에서 직접 성능을 측정한 것은 아닙니다.

핵심 요약: 한국어 포함 60개 언어, 시간당 0.54달러

  • 음성이 들어오는 동안 텍스트를 순차적으로 반환하는 스트리밍 전사 모델입니다.
  • 공식 발표는 60개 언어와 자동 언어 감지를 안내하며, 개발 문서의 지원 목록에는 한국어(ko)가 포함됩니다.
  • 발표된 도입 가격은 오디오 1시간당 0.54달러이며, 2026년 말까지의 조건입니다.
  • Microsoft Learn은 현재 공개 미리보기로 안내합니다. 정식 운영에 적용하기 전에 제공 조건을 확인해야 합니다.

출처: Microsoft AI 발표, Microsoft Learn 지원 언어·Realtime API, 공개 미리보기 안내.

실시간 전사는 녹음 파일 변환과 무엇이 다를까?

녹음이 끝난 뒤 파일 전체를 변환하는 작업과 달리, 스트리밍 방식은 들어오는 음성을 계속 처리합니다. 화면에 임시 문장이 먼저 나타나고, 이후 문맥에 따라 수정되며 최종 결과가 확정됩니다. Microsoft Foundry 모델 설명도 빠른 중간 결과와 안정적인 최종 결과를 구분합니다.

마이크로소프트는 오디오 수신 후 첫 임시 결과가 100ms를 조금 넘는 시점에 나온다고 설명했습니다. 이 수치를 회의록 전체 완성 시간이나 모든 환경에서 보장되는 지연 시간으로 해석하면 안 됩니다. 실제 경험에는 마이크 품질, 네트워크, 오디오 전송 방식과 화면 처리까지 영향을 줍니다. 정확도 순위 역시 공식 발표가 인용한 Artificial Analysis 평가 기준에 해당합니다. 공식 발표의 성능 설명.

한국어 회의록·강의 자막에 활용하는 방법

아래는 기능을 바탕으로 제안하는 활용 시나리오입니다. 특정 회의 앱에 이미 기본 탑재됐다는 의미는 아닙니다.

  1. 회의 중 자막: 발언 내용을 바로 화면에 표시하고, 확정된 문장을 회의록 초안으로 저장합니다. 결정 사항과 담당자는 녹취 문장을 검토한 뒤 별도로 정리합니다.
  2. 강의·웨비나: 수강생이 발언을 놓쳤을 때 앞 문장을 확인할 수 있도록 자막을 제공합니다. 약어·고유명사·전문 용어는 별도 검수 대상으로 둡니다.
  3. 고객 응대: 상담 내용을 읽을 수 있는 형태로 바꿔 담당자의 확인을 돕습니다. 임시 결과만으로 주문 변경이나 계약 처리를 확정하지 않도록 설계합니다.

직접 테스트한다면 같은 한국어 음성을 반복 사용해 첫 글자가 뜨는 시간, 문장이 확정되는 시간, 숫자·이름 오류, 중간 문장 수정 횟수를 비교해 보세요. 조용한 음성과 겹쳐 말하는 음성을 나눠 보면 도입 판단이 더 쉬워집니다.

가격 계산: 오디오 10시간이면 얼마일까?

발표된 도입 단가 0.54달러를 단순 적용하면 10시간은 5.40달러, 100시간은 54달러입니다. 이는 전사 모델 사용료만 계산한 예시입니다. 연결 플랫폼, 저장 공간, 요약 모델, 세금 등 추가 항목과 실제 청구 조건은 따로 확인해야 합니다. 도입 가격의 적용 기간이 끝난 뒤에도 같은 요금이라고 가정하지 마세요. 가격과 적용 기간 원문.

사용법: 체험과 서비스 연동을 나눠서 시작하기

먼저 체험하려면 MAI Playground에서 제공되는 데모와 계정별 접근 가능 여부를 확인하세요. 공식 발표는 음성 모델들을 함께 보여주는 Chatter 데모도 소개했습니다. 체험 화면과 제공 기능은 변경될 수 있습니다.

앱에 연결하려면 Microsoft Learn은 Realtime API와 Azure Speech SDK 두 경로를 안내합니다. 전자는 WebSocket 기반 연동에, 후자는 연결 관리와 오디오 스트리밍을 위한 클라이언트 라이브러리를 쓰는 경우에 해당합니다. 미리보기는 SLA가 제공되지 않으며, 문서는 프로덕션 워크로드에 권장하지 않는다고 명시합니다. 연동 방식과 미리보기 조건.

Vercel도 10월 1일 AI Gateway에서 MAI 음성 모델 지원을 발표했습니다. 음성 생성 모델과 실시간 전사 모델은 용도가 다르므로 모델 이름을 확인해야 합니다. Vercel 안내에서는 새 중간 결과가 들어올 때 화면의 임시 텍스트를 교체하도록 설명합니다. 무조건 뒤에 붙이면 수정 전·후 문장이 중복될 수 있습니다. Vercel 공식 연동 안내.

자주 묻는 질문

한국어를 지원하나요?

네. Microsoft Learn의 지원 언어 표에 한국어(ko)가 있습니다. 다만 모든 한국어 발음이나 전문 용어에서 동일한 정확도를 보장한다는 뜻은 아닙니다.

음성을 다른 언어로 번역해 주나요?

이 글에서 소개한 모델의 기본 역할은 음성을 텍스트로 전사하는 것입니다. 번역 자막이나 요약은 별도의 처리 단계가 필요한지 확인해야 합니다.

일반 사용자가 바로 쓰는 무료 회의록 앱인가요?

개발자와 서비스 구축자를 위한 음성 인식 모델입니다. 발표된 API 가격과 체험 데모를 일반 회의록 앱의 무료 이용 조건으로 받아들이면 안 됩니다.

회의 녹음을 넣기 전에 무엇을 확인해야 하나요?

참석자 안내와 동의, 회사의 녹음·외부 전송 기준, 사용할 플랫폼의 보관 조건을 먼저 확인하세요. 초기 테스트는 공개 또는 별도로 만든 예제 음성으로 진행하는 편이 좋습니다.

이번 발표에서 주목할 변화

이번 뉴스의 의미는 음성이 끝난 뒤 결과를 기다리는 작업에서, 말하는 도중 텍스트를 확인하는 작업으로 선택지가 넓어진다는 데 있습니다. 한국어 자막이나 회의록 서비스를 검토한다면 짧은 샘플부터 시험하고, 정확도·확정 지연·실제 청구액을 함께 비교해 보세요.

관련 글: GitHub Copilot Computer Use: PC 앱 직접 조작과 지원 환경

본 글은 공개된 공식 자료를 바탕으로 독자적으로 정리한 뉴스 해설입니다. 대표 이미지는 AI로 제작한 개념 일러스트이며 실제 서비스 화면이 아닙니다. 링크된 문서와 요금은 이후 변경될 수 있습니다.

반응형