영상·음성·음악까지…콘텐츠 제작 바꾸는 특화 AI
요약
유튜브, 인스타그램, 틱톡 등에서 AI로 만든 그래픽과 내레이션이 들어간 영상, AI가 제작한 음악을 흔히 볼 수 있게 됐다. 카페나 음식점에서도 저작권료 부담을 줄이기 위해 AI 음악을 트는 경우가 늘고 있다. 챗GPT나 클로드처럼 언어 중심의 범용 AI만으로는 이런 영상·음성·음악 콘텐츠 제작에 한계가 있어, 각 데이터를 학습한 전용 모델이나 여러 모델을 조합해 활용하는 방식이 쓰이고 있다.
큐레이터 노트
원문에 없는 맥락입니다
다른 매체는 이렇게 썼다
같은 사안을 다룬 다른 곳의 보도입니다
유럽 AI 기업 미스트랄이 매개변수 1조개, 활성 매개변수 490억개를 가진 네이티브 멀티모달 모델을 공개했다. 공식 명칭은 '르 총크(Le Chonk)'이며 모델명은 미스트랄 라지4(ML4)다. 오랜만에 나온 유럽계 오픈웨이트 대형언어모델이라는 점에서 주목받았다. 다만 중국계 오픈웨이…
MIT는 2015년부터 도서관장을 맡아온 크리스 버그를 부총장보 겸 '바바라 K. 오스트롬 디렉터'로 임명했다고 발표했다. 오스트롬 동문의 기부로 도서관장 직위에 영구 기금이 마련됐다. 버그는 재임 기간 중 디지털 접근성, 개방적 학술출판, 데이터 집약적 연구 지원을 강조했으며, 생성형…
MIT Technology Review Insights가 제작한 콘텐츠에 따르면, 2026년 기업 AI의 쟁점은 예측 모델의 성능 우위가 아니라 예측 결과를 토대로 스스로 행동하는 자율적 의사결정 시스템으로 옮겨가고 있다. 리서치 기업 Everest Group의 파트너 Vishal Gu…
이 사안의 흐름
같은 주제를 다룬 이 사이트의 기록 — 최신순
- 2026-09-27경기도 AI 콘텐츠 어워즈, 1528편 중 20편 본선 진출전자신문 SW
- 2026-10-07트웰브랩스, 1인칭 영상 이해 VLM '페가수스 1.6' 공개IT조선
- 2026-10-02AI 음악 서비스 수노, 음성 생성 기능 공개The Verge AI
- 2026-10-01노타, 멀티모달 AI 경량화 기술 NeurIPS 채택ZDNet Korea
- 2026-09-30알리바바, 대화 타이밍 판단하는 전이중 음성 AI 공개AI타임스
이 글에 나온 말
- 학습
- 학습은 모델이 데이터를 반복적으로 살펴보며 예측 오차를 줄이는 방향으로 내부 파라미터를 조정해 나가는 과정을 말한다.
이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.
같은 분야의 다른 소식
- ChatGPT, 답변에 그림·차트·버튼 넣는 UI 업데이트The Verge AI · 2026-10-07
- 구글, '나노 바나나 2.1' 이미지 모델 정식 출시ZDNet Korea · 2026-10-07
- 구글, 온디바이스 멀티모달 임베딩 '젬마 2' 공개AI타임스 · 2026-10-07
- 트웰브랩스, 1인칭 영상 이해 VLM '페가수스 1.6' 공개IT조선 · 2026-10-07
- 트웰브랩스, 로봇 학습용 영상AI '페가수스 1.6' 출시전자신문 SW · 2026-10-07
- 트웰브랩스, 로봇 학습용 영상AI '페가수스 1.6' 출시AI타임스 · 2026-10-07