모델 803건 · 국산 131 · 가격 645 추적 중
멀티모달

영상·음성·음악까지…콘텐츠 제작 바꾸는 특화 AI

IT조선·2026-09-25

요약

유튜브, 인스타그램, 틱톡 등에서 AI로 만든 그래픽과 내레이션이 들어간 영상, AI가 제작한 음악을 흔히 볼 수 있게 됐다. 카페나 음식점에서도 저작권료 부담을 줄이기 위해 AI 음악을 트는 경우가 늘고 있다. 챗GPT나 클로드처럼 언어 중심의 범용 AI만으로는 이런 영상·음성·음악 콘텐츠 제작에 한계가 있어, 각 데이터를 학습한 전용 모델이나 여러 모델을 조합해 활용하는 방식이 쓰이고 있다.

큐레이터 노트

원문에 없는 맥락입니다

범용 언어모델과 별도로 영상·음성·음악에 특화된 모델들이 실제 콘텐츠 제작 현장에서 조합되어 쓰이고 있다는 점을 보여준다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

알리바바, 대화 타이밍 판단하는 전이중 음성 AI 공개
AI타임스 · 2026-09-30

알리바바가 23일(현지시간) 차세대 전이중(Full-Duplex) 음성 모델 '큐원-오디오-3.1-리얼타임'을 출시했다. 이 모델은 단순히 듣고 답하는 것을 넘어 언제 생각하고 행동하고 말할지를 판단하도록 훈련됐다. 사용자의 말을 듣는 동시에 주변 음성을 파악해, 대화를 중간에 끊지 않…

클링 4.0 공개, 영상 일관성·제어력 강화
AI타임스 · 2026-09-29

중국 콰이쇼우의 AI 자회사 클링이 9월 28일 차세대 동영상 생성 모델 '클링 4.0'을 공개했다. 영상 생성 길이를 최대 30초로 늘리고 여러 이미지와 동영상을 동시에 참조할 수 있게 해 제작 정밀도와 일관성을 높였다. 최대 10개의 키프레임을 설정할 수 있고, 텍스트·이미지·기존 …

리퀴드 AI, 추측적 디코딩으로 VLM 추론 가속
AI타임스 · 2026-09-28

리퀴드 AI가 소형 초안 모델이 먼저 여러 토큰을 예측하고 대형 모델이 이를 한꺼번에 검증하는 '추측적 디코딩' 기법을 비전-언어 모델(VLM)에 적용한 '디스파크(DSpark)'를 공개했다. 기존에 텍스트 생성 위주로 쓰이던 추측적 디코딩을 시각 정보 처리가 결합된 멀티모달 영역으로 …

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
학습
학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

IT조선 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →