모델 819건 · 국산 131 · 가격 656 추적 중
멀티모달

알리바바, 통역 지연 2.3초로 줄인 큐원3.8 공개

AI타임스·2026-09-21

요약

알리바바가 9월 18일(현지시간) 실시간 통번역 모델 '큐원3.8-라이브트랜스레이트'를 공개했다. 이 모델은 음성이 끝나기를 기다리지 않고 듣는 동시에 번역문과 음성을 생성하는 방식으로, 알리바바 발표에 따르면 통역 지연 시간을 2.3초까지 줄였다. 핵심은 오디오와 텍스트를 하나의 스트림으로 묶는 '인터리브' 아키텍처로, 음성 데이터와 생성된 번역을 동시에 저장·재활용해 이전 세대보다 통역의 충실도와 유창성, 간결성을 높였다.

큐레이터 노트

원문에 없는 맥락입니다

기존 통번역 모델은 발화가 끝난 뒤 순차적으로 처리해 지연이 발생했는데, 오디오·텍스트를 동시에 처리하는 구조로 이를 줄이려 한 시도로 볼 수 있다.

깊이 읽기

이 기사 한 건이 아니라, 같은 사안을 다룬 이 사이트의 기록을 근거로 정리했습니다

이 일이 어디서 왔나

알리바바는 9월 18일 하루에 옴니모달 모델 '큐원3.8-옴니-플래시'와 실시간 통번역 모델 '큐원3.8-라이브트랜스레이트'를 잇달아 공개했다. 앞서 9월 15일 구글도 실시간 음성 대화 중 추론과 도구 실행을 이어가는 '제미나이 3.8 라이브'를 내놓아, 실시간 음성·통번역 AI를 둘러싼 두 회사의 발표가 연이어 이어지는 흐름이다.

짚어야 할 점

  • 2.3초라는 지연 시간 수치는 알리바바 자체 발표 기준으로, 제3자 벤치마크로 검증된 값인지는 별개 문제다.
  • 오디오·텍스트를 하나의 스트림으로 묶는 '인터리브' 구조는 순차 처리 방식의 구조적 한계(발화 종료 후 처리)를 겨냥한 설계로, 같은 시기 나온 큐원3.8-옴니-플래시나 구글 제미나이 3.8 라이브와 마찬가지로 '실시간성'을 핵심 경쟁 지표로 삼는 흐름과 맞닿아 있다.
  • 맥도날드 사례에서 드러났듯 음성 AI의 실용성은 처리 속도 못지않게 '모호한 상황에서 멈추고 넘기는' 판단 구조가 중요한데, 이번 발표에는 그런 오류 처리나 예외 상황 대응에 대한 설명은 없다.

아직 확인되지 않은 것

  • 2.3초 지연 시간이 어떤 언어쌍, 어떤 조건(문장 길이, 잡음 환경 등)에서 측정됐는지는 나오지 않았다.
  • 구글 제미나이 3.8 라이브 등 경쟁 모델과의 지연 시간·정확도 비교 자료는 확인되지 않았다.
  • 이 모델이 실제 서비스나 제품에 언제, 어떤 형태로 적용되는지에 대한 계획은 밝혀지지 않았다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

미스트랄, 1조 매개변수 모델 '르 총크' 공개
바이라인네트워크 · 2026-10-07

유럽 AI 기업 미스트랄이 매개변수 1조개, 활성 매개변수 490억개를 가진 네이티브 멀티모달 모델을 공개했다. 공식 명칭은 '르 총크(Le Chonk)'이며 모델명은 미스트랄 라지4(ML4)다. 오랜만에 나온 유럽계 오픈웨이트 대형언어모델이라는 점에서 주목받았다. 다만 중국계 오픈웨이…

AI 음악 서비스 수노, 음성 생성 기능 공개
The Verge AI · 2026-10-02

AI 음악 제작 서비스 Suno가 스크립트나 설명 프롬프트를 바탕으로 음성을 생성하는 새 기능 'Speech'를 발표했다. 이 기능은 Suno의 웹과 모바일 플랫폼에서 공개 베타로 제공되며, 음성과 배경음악을 동시에 생성할 수 있다. Suno 최고제품책임자 Jack Brody는 발표문에…

포티투닷, 엔비디아·딥마인드·제노 창시자 영입
ZDNet Korea · 2026-10-02

현대자동차그룹 포티투닷이 분산 컴퓨팅, 음성 AI, 자율주행 분야 전문가 3명을 영입했다고 2일 밝혔다. 오픈소스 통신 프로토콜 '제노' 창시자인 안젤로 코르사로 수석 연구위원은 SDV와 클라우드, 모빌리티 플랫폼의 데이터 연결성 강화를 맡는다. 구글 딥마인드 등에서 음성 대화형 AI를…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
지연 시간
요청을 보낸 시점부터 응답을 받기까지 걸리는 시간을 말한다.
추론
추론(Inference)은 학습이 끝난 인공지능 모델이 새로운 입력을 받아 예측이나 답변 같은 출력을 만들어내는 과정을 말한다.

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →