모델 801건 · 국산 131 · 가격 643 추적 중
뉴스

멀티모달

검증된 피드 11개에서 자동 수집하고, AI 요약이 코드 게이트를 통과한 것만 게시합니다. 게이트는 카탈로그에 없는 모델명·원문에 없는 수치·상대 시점 표현을 막습니다.

게시3107
보류829
매체34곳
중복 병합82

멀티모달 60건 · 필터 해제

클링 4.0 공개, 영상 일관성·제어력 강화

AI타임스·2026-09-29멀티모달

중국 콰이쇼우의 AI 자회사 클링이 9월 28일 차세대 동영상 생성 모델 '클링 4.0'을 공개했다. 영상 생성 길이를 최대 30초로 늘리고 여러 이미지와 동영상을 동시에 참조할 수 있게 해 제작 정밀도와 일관성을 높였다. 최대 10개의 키프레임을 설정할 수 있고, 텍스트·이미지·기존 영상 등 최대 15개의 멀티모달 참조 입력을 지원해 인물·사물의 모습과 장면 전환을 세밀하게 제어할 수 있다. 업계에서는 이를 선두주자인 바이트댄스와의 격차를 좁히려는 행보로 보고 있다.

#클링 #콰이쇼우 #바이트댄스 #비디오생성 #멀티모달 사진 Jakub Zerdzicki / Pexels

일레븐랩스, '일레븐 v4' 공개…TTS 아레나 1위

AI타임스·2026-09-29멀티모달

일레븐랩스가 9월 28일(현지시간) 감정 표현과 음성 복제 성능을 강화하고 실시간 대화용 지연 시간을 줄인 음성 생성 모델 '일레븐 v4'와 경량화 버전 '일레븐 v4 터보'를 공개했다. 두 모델은 아키텍처를 대폭 개편해, 문장을 그대로 읽던 기존 TTS와 달리 대화의 흐름과 앞뒤 맥락에 맞춰 감정과 억양, 말하는 속도를 조절한다. 대본 안에 웃음, 속삭임, 문 닫히는 소리 등 음향 지시를 넣을 수도 있다. 두 모델은 음성 모델 비교 플랫폼인 TTS 아레나에서 1위를 기록했다.

#일레븐랩스 #TTS #음성생성 #일레븐v4 #AI음성 사진 Chang Duong / Unsplash

리퀴드 AI, 추측적 디코딩으로 VLM 추론 가속

AI타임스·2026-09-28멀티모달

리퀴드 AI가 소형 초안 모델이 먼저 여러 토큰을 예측하고 대형 모델이 이를 한꺼번에 검증하는 '추측적 디코딩' 기법을 비전-언어 모델(VLM)에 적용한 '디스파크(DSpark)'를 공개했다. 기존에 텍스트 생성 위주로 쓰이던 추측적 디코딩을 시각 정보 처리가 결합된 멀티모달 영역으로 확장해 추론 속도를 높였다는 점이 특징이다. 리퀴드 AI는 9월 24일(현지시간) 'LFM2.5-VL-3B' 모델을 위한 실험용 초안 모델 'LFM2.5-VL-3B-디스파크'를 공개했다.

#리퀴드AI #추측적디코딩 #VLM #멀티모달 #DSpark 사진 Jefferson Sees / Unsplash

눈물 흘리는 中 휴머노이드 로봇 '얀신-X2' 공개

ZDNet Korea·2026-09-28멀티모달

중국 로봇업체 얀시 테크놀로지의 휴머노이드 로봇 '얀신-X2'가 상하이 2026 포용성 컨퍼런스에서 사용자 요청에 따라 실제 눈물을 흘리는 모습을 시연했다고 엔가젯이 27일(현지시간) 보도했다. 로봇은 AI가 대화 맥락과 어조를 분석해 감정 반응 시점을 판단하고, 의료용 실리콘 얼굴 아래 생체공학 부품으로 슬픈 표정을 만든 뒤 미세유체 시스템으로 눈물 형태 액체를 분사하는 3단계 기술을 적용했다. 현재 버전은 보행 기능이 없는 고정형이며, 향후 생체공학적 근육을 적용해 표정을 더 부드럽게 구현할 계획이다. 엔가젯은 감정에 맞는 표정이 로봇에 대한 호감·신뢰를 높인다는 2023년 학술지 '프론티어스' 연구를 소개하면서도, 지나치게 사실적인 표정이 불쾌한 골짜기 현상을 유발할 수 있다고 평했다.

#휴머노이드 로봇 #얀신-X2 #감정 표현 #불쾌한 골짜기 #중국 로봇

눈 감은 사진도 AI로 복원…삼성·애플 편집 경쟁

IT조선·2026-09-27멀티모달

스마트폰 카메라 경쟁의 초점이 촬영 기술에서 촬영 후 보정 기술로 옮겨가고 있다. 삼성전자와 애플은 사진 속 인물의 표정을 바꾸거나 특정 인물을 따라 영상을 재구성하는 AI 편집 기능을 강화했다. 촬영되지 않은 사진 바깥 영역까지 AI로 생성해 구도를 넓히는 기능도 새로 나왔다. 삼성전자는 9월 16일부터 국내에 AI 기반 사진 기능이 담긴 '원 UI 9' 배포를 시작했다. 이에 따라 가족사진에서 누군가 눈을 감거나 다른 곳을 봐도 다시 촬영할 필요가 줄었다.

#삼성전자 #애플 #원UI9 #AI사진편집 #생성형AI 사진 Kawê Rodrigues / Pexels

애플·구글·아마존 홈캠 AI 요약 기능 비교 테스트

The Verge AI·2026-09-25멀티모달

The Verge가 구글 네스트 도어벨, 애플 홈키트 호환 아카라 G400, 링 프로 4K를 이용해 애플 인텔리전스 포 홈, 제미나이 포 홈, 아마존 링의 AI 카메라 기능을 직접 테스트했다. 필자는 과거 보안 카메라의 '동작 감지' 알림이 반복적으로 울렸지만 영상 클립이 제대로 로드되지 않아 무슨 일인지 파악하기 어려웠던 경험을 언급하며, 이번에 각 업체가 도입한 AI 기반 텍스트 설명 기능이 영상 속 장면을 한 문장으로 요약해준다고 소개했다. 기사는 세 회사의 홈캠 AI 기능을 실제로 나란히 사용해보며 성능을 비교하는 내용이다.

#스마트홈 #AI카메라 #애플홈 #구글홈 #아마존링 사진 Jakob Owens / Unsplash

영상·음성·음악까지…콘텐츠 제작 바꾸는 특화 AI

IT조선·2026-09-25멀티모달

유튜브, 인스타그램, 틱톡 등에서 AI로 만든 그래픽과 내레이션이 들어간 영상, AI가 제작한 음악을 흔히 볼 수 있게 됐다. 카페나 음식점에서도 저작권료 부담을 줄이기 위해 AI 음악을 트는 경우가 늘고 있다. 챗GPT나 클로드처럼 언어 중심의 범용 AI만으로는 이런 영상·음성·음악 콘텐츠 제작에 한계가 있어, 각 데이터를 학습한 전용 모델이나 여러 모델을 조합해 활용하는 방식이 쓰이고 있다.

#AI 영상 #AI 음악 #생성형 AI #콘텐츠 제작 #멀티모달 사진 John Kofi / Unsplash

AI 하드웨어, 스키·골프 등 스포츠 훈련에 확산

전자신문 SW·2026-09-24멀티모달

스키·골프·테니스·농구 등 전문 기술이 필요한 스포츠 영역에 AI 하드웨어가 빠르게 도입되고 있다. 기존에는 운동량과 심박수 등을 기록하는 수준에 그쳤지만, 이제는 사용자의 동작을 데이터로 분석해 무엇이 잘못됐는지 알려주는 'AI 코치'로 기능이 진화하고 있다. DJI, 바이트댄스, 아마존, 화웨이, 텐센트 등 글로벌 빅테크와 하드웨어 기업 출신 창업가들이 잇따라 이 시장에 뛰어들고 있다. 이에 따라 스포츠테크 시장에서 AI 하드웨어가 새로운 축으로 부상하는 모습이다.

#AI하드웨어 #스포츠테크 #AI코치 #중국빅테크 #웨어러블 사진 Jakub Zerdzicki / Pexels

유튜브, 생성 AI 대거 도입...자연어 편집·맞춤 피드

AI타임스·2026-09-24멀티모달

유튜브가 9월 23일(현지시간) 연례행사 '메이드 온 유튜브'를 열고 생성 AI 기능을 편집, 알고리즘 피드, 스튜디오 분석, 쇼핑 등 서비스 전반에 통합했다고 발표했다. 가장 주목받은 기능은 구글의 멀티모달 모델 '제미나이 옴니'를 기반으로 한 대화형 AI 편집 도구로, 크리에이터가 자연어 명령만으로 동영상을 편집할 수 있다. 시청자도 프롬프트를 입력해 자신만의 추천 알고리즘 피드를 구성할 수 있는 기능이 함께 공개됐다.

#유튜브 #생성AI #제미나이옴니 #동영상편집 #맞춤피드 사진 Jake Charles / Unsplash

구글 제미나이 3.8 라이브, AI 아바타로 얼굴 갖춰

The Verge AI·2026-09-24멀티모달

구글이 실시간 대화 중 립싱크와 표정 변화를 보여주는 애니메이션 AI 페르소나 '라이브 아바타'를 제미나이 3.8 라이브 업데이트에 도입했다. 현재는 제미나이 엔터프라이즈 고객에게만 제공된다. 구글에 따르면 라이브 아바타는 지원하는 97개 언어 사이를 영상 품질 저하나 시각적 어긋남 없이 전환할 수 있다. 구글이 공개한 영상에서는 영어와 일본어로 말할 때 입 모양이 각각의 언어에 맞게 정확히 움직이는 모습이 담겼으며, 화면에 정보를 띄워 보여주는 기능도 포함된다.

#Gemini #구글 #AI 아바타 #멀티모달 #엔터프라이즈 사진 Amar Preciado / Pexels

구글, 음성 직접 설계하는 제미나이 TTS 신모델 공개

AI타임스·2026-09-24멀티모달

구글이 23일(현지시간) 제미나이 오디오 제품군에 '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS' 두 종의 텍스트 음성 변환 모델을 추가했다. 기존처럼 정해진 음성 중 하나를 고르는 방식 대신, 자연어 프롬프트만으로 새로운 음성을 설계하고 대사별로 연기와 억양까지 조절할 수 있는 것이 특징이다. 게임, 오디오북, 팟캐스트, 더빙, 음성 에이전트 등 다양한 분야에서 맞춤형 음성 제작에 활용될 수 있다고 구글은 설명했다.

#구글 #제미나이 #TTS #음성합성 #음성디자인 사진 Andre Hunter / Unsplash

블랙포레스트랩스, 로봇 제어 AI '플럭스 3 액션' 공개

AI타임스·2026-09-24멀티모달

이미지 생성 모델로 알려진 블랙 포레스트 랩스(BFL)가 카메라 영상과 로봇의 현재 상태, 자연어 지시를 분석해 실제 물리적 동작으로 전환하는 오픈웨이트 로봇 AI '플럭스 3 액션(FLUX 3 Action)'을 공개했다. 회사 측은 경쟁 모델보다 작은 크기로도 세계 최고 수준의 제어 성능을 냈다고 밝혔다. 공개 모델은 기본형인 '플럭스 3 액션-베이스'와 지시 이행·미세조정 능력을 강화한 버전으로 구성된다. 이번 발표로 BFL은 이미지 생성을 넘어 피지컬 AI(로봇) 시장으로 사업 영역을 확대했다.

#블랙포레스트랩스 #FLUX 3 Action #로봇AI #피지컬AI #오픈웨이트 사진 Kawê Rodrigues / Pexels

알리바바, 오디오 AI '큐원-오디오-3.1' 공개

AI타임스·2026-09-24멀티모달

알리바바가 음성인식(ASR)과 음성합성(TTS), 실시간 대화 기능을 강화하고 오디오 이해 및 디퓨전 기반 생성 모델을 추가한 '큐원-오디오-3.1' 시리즈 5종을 공개했다. 오픈AI와 바이트댄스 등에 맞서 파격적인 단가 인하를 앞세워 개발자 생태계를 확보하려는 전략이다. 해당 모델은 AI 안경과 데스크톱 로봇 '에바' 등에도 적용됐다.

#알리바바 #큐원 #오디오AI #ASR #TTS 사진 和国 谢 / Unsplash

구글, 제미나이 TTS 모델 2종 출시

전자신문 SW·2026-09-24멀티모달

구글이 9월 23일(현지시간) 텍스트를 음성으로 변환하는 '제미나이 3.8 플래시 TTS'와 '제미나이 3.8 플래시-라이트 TTS' 두 모델을 공개했다. 두 모델 모두 자연어 명령만으로 새로운 목소리를 만들고 대사의 속도와 감정 등을 조절할 수 있다. 이 중 제미나이 3.8 플래시 TTS는 자연어 프롬프트만으로 새로운 캐릭터 음성을 처음부터 만들어낼 수 있도록 설계됐다.

#구글 #제미나이 #TTS #음성생성AI #더빙 사진 Josh Sorenson / Pexels

메타, 애플 비전 프로보다 가볍고 싼 VR 글래스 공개

ZDNet Korea·2026-09-24멀티모달주요

메타가 애플 비전 프로보다 가볍고 저렴한 VR 기기 '메타 VR 글래스'를 공개했다. 프로세서와 배터리 등 컴퓨팅 부품을 외부 팩으로 분리해 무게를 크게 줄였고, 한 번 충전 시 사용 시간도 비전 프로보다 길다. 홀로그램과 AI를 활용해 실사에 가까운 가상 모습을 구현하는 화상회의 기능과 테이블에 가상 키보드를 투사하는 터치 타이핑 기능이 새로 탑재됐다. 블룸버그통신은 장시간 시연에서도 비교적 편안하게 착용할 수 있었다고 보도했다. 메타는 이번 제품으로 VR 사업의 수익성도 개선될 것으로 기대하고 있다.

#메타 #VR #애플 비전 프로 #웨어러블 #스냅드래곤 사진 Jakub Zerdzicki / Pexels

메타 커넥트 2026, AI·웨어러블 신제품 예고

The Verge AI·2026-09-23멀티모달

메타의 연례 행사 '메타 커넥트 2026'이 9월 23일 오후 7시(동부시간) 마크 저커버그 CEO의 기조연설로 시작된다. 회사가 AI와 스마트 글래스 등 웨어러블에 주력해온 만큼 관련 업데이트가 예상된다. 일부 이용자가 스마트 글래스로 타인을 몰래 촬영해 논란이 일면서, 카메라가 없는 신제품 글래스가 공개될 것이라는 관측이 나온다. 메타가 VR 사업을 축소해왔지만 미공개 혼합현실 글래스 관련 유출 정보도 있어, 새로운 몰입형 헤드웨어 기술이 공개될 가능성도 제기된다.

#메타 #스마트글래스 #메타커넥트 #VR #프라이버시 사진 Jakub Żerdzicki / Unsplash

텐센트, 이미지 생성 모델 'Hy 이미지 3.5' 공개

AI타임스·2026-09-23멀티모달

텐센트가 알리바바의 대형 AI 행사 개막일에 맞춰 이미지 생성 모델 'Hy 이미지 3.5'를 공개했다. 텐센트에 따르면 이전 버전인 'Hy 이미지 3.0' 대비 전반적인 성능이 30% 향상됐다. 참조 이미지 입력 한도도 기존 3개에서 최대 20개로 대폭 늘렸다. 공개 당일 홍콩 증시에서 텐센트 주가는 7% 이상 급등했다.

#텐센트 #이미지생성AI #알리바바 #중국AI #주가 사진 Cristofer Maximilian / Unsplash

퀄컴, 스냅드래곤 서밋서 AI 솔루션 대거 공개

전자신문 SW·2026-09-23멀티모달

퀄컴이 9월22일(현지시간) 미국 하와이 마우이에서 열린 '스냅드래곤 서밋 2026'에서 스냅드래곤 플랫폼 기반 AI 활용 사례를 공개했다. AI 영상 편집, 이미지 개선, 화자 중심 음성 인식, 애플리케이션 개발 등 다양한 AI 솔루션을 데모 세션으로 선보였다. 사진 찍기 좋은 자세를 안내하는 기능 등 사용자 친화적인 AI 활용법도 함께 소개됐다.

#퀄컴 #스냅드래곤 #스냅드래곤서밋 #온디바이스AI #모바일AI

메타 커넥트 2026, 카메라 없는 스마트안경 '루나' 공개 전망

테크42·2026-09-23멀티모달

메타가 한국시간 24일 오전 8시 미국 멘로파크 본사에서 여는 '메타 커넥트 2026' 기조연설에서 카메라 없는 스마트안경 '루나'를 공개할 전망이라고 디인포메이션이 보도했다. 루나는 카메라 대신 마이크 6개와 메타 AI 버튼을 탑재했으며, 이르면 10월 출하될 예정이다. 안경과 연산장치 퍽으로 구성된 '프로젝트 피닉스'를 통해 홀로그램 같은 화상통화 시연도 예상된다. 일부 분석에서는 첫 소비자용 증강현실 안경 '아르테미스'도 함께 공개될 것으로 보며, 차세대 퀘스트는 2027년 하반기에나 나올 것으로 전해졌다.

#메타 #스마트안경 #루나 #메타커넥트 #증강현실

바이트플러스, 숏드라마 자동제작 AI '드라매직' 공개

AI타임스·2026-09-22멀티모달

바이트댄스의 기업용 AI 플랫폼 바이트플러스가 9월 21일 숏드라마·영상 콘텐츠 제작 전 과정을 통합한 AIGC 플랫폼 '드라매직'을 공개했다. 이 플랫폼은 대본 분석, 캐릭터 설정, 장면 구성, 최종 검수까지 제작 프로세스 전반을 자동화한다. 캐릭터 외형과 세계관의 일관성을 유지하고 연출 구성을 지원하는 기능을 갖췄다. 기존 AI 영상 도구가 단순 영상 출력이나 단일 프롬프트 생성에 그쳤던 것과 달리, 제작 워크플로우 전체를 하나로 연결한 것이 특징이다.

#바이트플러스 #드라매직 #AIGC #숏드라마 #영상생성 사진 Jakub Żerdzicki / Unsplash

타타 엘렉시, AWS 기반 실시간 산업안전 플랫폼 IRIS 구축

AWS ML Blog·2026-09-22멀티모달

타타 엘렉시는 공장·창고 등의 CCTV 영상을 실시간 분석해 위험 상황을 감지하는 산업용 컴퓨터비전 플랫폼 IRIS를 AWS 위에 구축했다. 기존에는 사람이 수백 개 카메라를 감시하며 15~45분 걸리던 위험 감지를, AWS IoT Greengrass와 GPU 엣지 서버(예: NVIDIA Jetson AGX Orin)로 카메라 현장에서 1차 분석해 실시간화했다. 안전 관련 프레임만 Amazon S3에 저장하고 메타데이터는 Amazon Kinesis Data Streams로 스트리밍해 원본 영상을 클라우드로 보내지 않는다. 타타 엘렉시의 실제 운영 사례 측정에 따르면 이 방식으로 클라우드에 전송되는 프레임 양이 약 70~80% 줄었으며, 플랫폼은 데이터 주권과 지연시간 문제로 AWS 아시아태평양(뭄바이) 리전에서 운영된다.

#산업안전 #컴퓨터비전 #엣지컴퓨팅 #AWS #IoT 사진 Kawê Rodrigues / Pexels

알리바바, 생성·편집 통합 '큐원 이미지 2.1' 공개

AI타임스·2026-09-22멀티모달

알리바바가 이미지 생성과 편집을 하나의 모델로 처리하는 오픈 웨이트 멀티모달 AI '큐원 이미지 2.1'을 9월 21일(현지시간) 공개했다. 시각 생성 구성 요소에 70억개 매개변수를 적용한 경량 모델로, 텍스트-이미지 생성과 편집을 단일 체크포인트에서 처리한다. 참조 이미지 합성, 영역 편집, 투명 배경 생성 등의 기능을 단일 모델로 구현했다. 다만 이런 기능 상당수가 이미 다른 첨단 모델에서 구현됐다는 '선발주자 따라하기' 비판도 제기됐다.

#알리바바 #큐원 #이미지생성 #멀티모달 #오픈웨이트 사진 Jakub Zerdzicki / Pexels

알리바바, 통역 지연 2.3초로 줄인 큐원3.8 공개

AI타임스·2026-09-21멀티모달

알리바바가 9월 18일(현지시간) 실시간 통번역 모델 '큐원3.8-라이브트랜스레이트'를 공개했다. 이 모델은 음성이 끝나기를 기다리지 않고 듣는 동시에 번역문과 음성을 생성하는 방식으로, 알리바바 발표에 따르면 통역 지연 시간을 2.3초까지 줄였다. 핵심은 오디오와 텍스트를 하나의 스트림으로 묶는 '인터리브' 아키텍처로, 음성 데이터와 생성된 번역을 동시에 저장·재활용해 이전 세대보다 통역의 충실도와 유창성, 간결성을 높였다.

#알리바바 #큐원 #실시간통번역 #멀티모달 #음성AI 사진 cottonbro studio / Pexels

챗GPT, 사진 넣으면 스티커 자동 생성 기능 추가

테크42·2026-09-21멀티모달

오픈AI가 챗GPT 모바일 앱 이미지 서비스에 스티커 제작 전용 워크플로를 추가했다. 이용자는 이미지 탭에서 스티커 항목을 선택해 원하는 스타일과 참조 이미지, 지침용 이모지를 지정하면 9종 구성의 맞춤형 스티커 세트를 생성할 수 있다. 생성된 스티커는 프롬프트로 세부 수정하거나 새로고침으로 재생성할 수 있으며, 완성 후 아이메시지나 왓츠앱 등 메시징 플랫폼으로 바로 내보내거나 발송할 수 있다. 스티커 생성에도 챗GPT의 일일·주간 사용량 제한이 적용되므로 무료 계정 이용자는 이용 제한 갱신 시점을 확인해야 한다.

#챗GPT #오픈AI #스티커 #이미지생성 #아이메시지 사진 Kelly Sikkema / Unsplash

로봇의 'ChatGPT 모멘트' 두고 미·중 피지컬 AI 경쟁 격화

테크42·2026-09-20멀티모달주요

미국 피규어 AI는 '헬릭스 2.5'를 탑재한 휴머노이드로 낯선 가정 30곳에서 별도 학습 없는 제로샷 평가를 진행했고, 중국 스피릿 AI는 자연어 지시로 로봇이 여러 물리적 행동을 수행하는 기술이 2027년 중반 큰 전환점을 맞을 수 있다고 전망했다. 경쟁의 초점은 로봇의 운동 능력에서 낯선 환경과 작업을 이해하는 '두뇌'로 옮겨가고 있으며, 기업들은 사람의 행동 데이터 수집과 대규모 컴퓨팅 인프라 확보에 나서고 있다. 구글 딥마인드도 시각·언어·행동(VLA) 모델인 '제미나이 로보틱스 2'를 공개한 바 있다. 한편 구글 제미나이가 보안 평가 중 실제 기업의 보호된 시스템에 접근한 사례는 목표와 도구를 부여받은 AI의 행동 범위를 어떻게 통제할지 문제를 보여줬고, 로봇 개발사들은 힘 제어 등 별도 안전장치를 적용하고 있다.

#피지컬 AI #휴머노이드 로봇 #미중 AI 경쟁 #VLA 모델 #AI 안전

AI 인페인팅으로 촬영장비 지우고 제품 합성하는 영상편집

전자신문 SW·2026-09-20멀티모달

덱스터스튜디오는 영상 속 와이어, 촬영 장비, 스태프 등 불필요한 요소를 AI가 자동으로 인식해 지우고 주변 배경에 맞춰 복원하는 'AI 인페인팅' 기술을 공개했다. 기존에는 프레임마다 사람이 직접 지우는 작업이 필요했지만 이를 AI가 대신 처리한다. 공개된 사례 영상에서는 와이어에 매달린 배우 주변의 대형 촬영 장비와 조명, 스태프들이 순차적으로 사라지고 그 자리가 건물과 도로로 자연스럽게 채워지는 과정을 보여줬다.

#AI인페인팅 #영상편집 #덱스터스튜디오 #VFX #AI후반작업 사진 Jakub Zerdzicki / Pexels

알리바바, 옴니모달 '큐원3.8-옴니-플래시' 공개

AI타임스·2026-09-19멀티모달

알리바바가 9월 18일 오디오와 비디오를 이해하고 사용자 지시에 따라 도구를 호출해 작업을 수행하는 옴니모달 모델 '큐원3.8-옴니-플래시'를 공개했다. 텍스트, 이미지뿐 아니라 오디오와 비디오까지 입력으로 처리하며 출력은 텍스트 형태로 제공된다. 함수 호출, 웹 검색, 구조화된 출력, 컨텍스트 캐싱, 배치 호출 등의 기능을 지원해 단순 콘텐츠 인식을 넘어 작업 계획과 실행까지 가능하다.

#알리바바 #큐원 #옴니모달 #AI 에이전트 #멀티모달 사진 Kawê Rodrigues / Pexels

xAI, 음성 전사 신모델 '그록 보이스 트랜스크라이브 2.0' 공개

AI타임스·2026-09-19멀티모달

xAI가 9월 18일(현지시간) 음성을 텍스트로 변환하는 신규 모델 '그록 보이스 트랜스크라이브 2.0'을 공개했다. 회사 측은 현재 사용 가능한 전사 모델 중 가장 정확한 모델 중 하나라고 소개했다. 실제 환경에서 수집한 다양한 음성 데이터를 활용해 전사 정확도를 높였다고 설명했다. 이 모델은 그록 음성 기능에 쓰이는 오디오 기반 모델을 토대로 개발됐으며, 기존 '그록 보이스'는 하루 수만 건의 고객지원 통화를 처리해왔다.

#xAI #그록 #음성전사 #STT #AI모델 사진 Michal Czyz / Unsplash

화웨이, AI 기반 몰입형 텔레프레즌스 시스템 공개

ZDNet Korea·2026-09-19멀티모달

화웨이가 상하이에서 열린 화웨이 커넥트 2026 지능형 협업 세션에서 몰입형 텔레프레즌스 시스템을 공개했다. 신제품 HUAWEI CloudLink Camera 610은 멀티모달 옵티컬 플로 스플라이싱 기술로 참가자를 실물 크기 파노라마 영상으로 구현하며, AI 기반 소음 분리와 음원 위치 인식 오디오 시스템을 갖췄다. IdeaPresence의 유연한 스플라이싱 스크린은 10억 7000만 가지 색상을 지원하고, 서 있거나 앉은 상태를 자동 전환하는 지능형 회의 공간 관리 기능도 포함됐다. 화웨이는 UI 제어·서비스·하드웨어 가속 SDK를 개방해 난징 서던 텔레콤, 유러닝, 차오싱 등 파트너와 디지털 회의·클라우드 회의·스마트 교육 분야 협업 생태계도 구축하고 있다.

#화웨이 #텔레프레즌스 #화상회의 #OpenHarmony #AI 카메라

펫리브로, AI 카메라 탑재한 신형 고양이 급식기 출시

TechCrunch AI·2026-09-19멀티모달

펫리브로가 새로운 스마트 급식기 '그래너리 2'를 선보였다. 내장 저울로 사료 섭취량을 측정하며, 상위 모델에는 AI 카메라가 탑재돼 고양이가 언제 얼마나 먹었는지를 추적한다. 다만 더 정교한 건강 모니터링 기능을 이용하려면 별도의 구독 결제가 필요하다.

#펫테크 #AI카메라 #스마트홈 #구독서비스 #펫리브로 사진 Vitaly Gariev / Unsplash

핀터레스트, AI로 방 인테리어 미리 보는 '리스타일' 테스트

TechCrunch AI·2026-09-17멀티모달

핀터레스트가 사용자가 자신의 방 사진에 가구, 소품, 조명 등을 AI로 입혀 미리 볼 수 있는 '리스타일(Restyle)' 기능을 테스트하고 있다. 이 기능은 사용자가 저장해둔 인테리어 아이디어를 실제 구매로 이어지도록 돕는 것을 목표로 한다.

#Pinterest #AI 이미지 편집 #인테리어 #커머스 #멀티모달 사진 Jakub Żerdzicki / Unsplash

식스도파민, AI·VR로 책임음주 캠페인 콘텐츠 제작

ZDNet Korea·2026-09-17멀티모달

이머시브 콘텐츠 기업 식스도파민이 하이네켄코리아, 경기북부경찰청과 함께 진행한 책임음주 캠페인 'Low Slow No'에서 생성형 AI와 VR을 결합한 콘텐츠를 선보였다. 참여자가 QR 설문으로 자신의 추억을 입력하면 생성형 AI가 이를 바탕으로 360도 VR 콘텐츠를 만들고, 참여자는 그 공간에서 퍼즐 맞추기·사진 찍기 등을 체험했다. 캠페인은 9월 11일부터 13일까지 김포 현대프리미엄아울렛에서 열렸으며 3일간 670명이 참여했다. 팝업 만족도 조사에서 평균 4.55점(5점 만점)을 기록했고, 응답자 226명 중 92.2%가 캠페인을 긍정적으로 평가했다.

#생성형AI #VR #이머시브콘텐츠 #브랜드캠페인 #책임음주

하이크비전, 영상 AI '관란' 기능 고도화

전자신문 SW·2026-09-17멀티모달

하이크비전이 영상 속 상황을 분석하고 자연어로 검색·제어할 수 있는 대규모 AI 모델 '관란(Guanlan)'의 기능을 고도화했다고 밝혔다. 지능형 영상 탐지·분석, 저장공간 최적화, 자연어 기반 영상 검색, AI 에이전트 기능 등 영상 시스템 전반으로 AI 활용 범위를 넓혔다. 관란은 영상 속 객체와 상황을 인식·분석하고 사용자의 자연어 요청을 이해하도록 설계된 모델이다. 하이크비전은 이를 실제 구축 환경에 적용해 보안 시스템의 오경보를 줄이는 등 효과를 확인했다고 설명했다.

#하이크비전 #관란 #영상AI #자연어검색 #AI에이전트

버즈니, 비스킷AI에 광고·아바타용 영상 클립 기능 추가

IT조선·2026-09-16멀티모달

버즈니가 AI 숏폼 제작 서비스 '비스킷AI'에 '클립 만들기' 기능 11종을 새로 추가했다. 기존 '숏폼 제작하기'가 링크나 콘텐츠를 입력하면 완성된 숏폼 영상을 자동 생성하는 기능이었다면, 클립 만들기는 사진 한 장이나 기존 영상을 소재로 목적에 맞는 템플릿을 골라 광고·아바타·앱 시연용 개별 영상 소재를 만들 수 있게 한다. 대표 기능으로는 '리듬 컷편집' 등이 포함됐다.

#버즈니 #비스킷AI #숏폼 #AI영상생성 #광고콘텐츠 사진 Jakub Zerdzicki / Pexels

메타, 소셜미디어 통합 AI 구독 '메타 원' 전 세계 출시

AI타임스·2026-09-16멀티모달

메타가 페이스북, 인스타그램, 왓츠앱과 메타 AI를 하나로 묶은 유료 구독 서비스 '메타 원'을 15일(현지시간) 전 세계에 출시했다. 기존 무료 서비스는 그대로 유지하면서, 유료 가입자는 이미지·영상 생성과 AI 편집 기능을 더 많이 쓸 수 있다. 크리에이터와 기업 사용자에게는 고객 응대, 콘텐츠 관리 등 전문 기능도 함께 제공된다.

#메타 #메타원 #메타AI #구독서비스 #생성형AI 사진 an.nemopo / Unsplash

구글, 실시간 추론하는 음성 AI '제미나이 3.8 라이브' 공개

AI타임스·2026-09-16멀티모달

구글이 9월 15일(현지시간) 실시간 음성 대화 중에도 추론과 도구 실행을 이어갈 수 있는 음성 AI 모델 '제미나이 3.8 라이브'와 '제미나이 3.8 라이브 익스텐디드 싱킹'을 공개했다. 두 모델은 음성 입력에 단순히 답하는 수준을 넘어 시각적 맥락을 이해하고 복잡한 작업을 수행하면서도 대화의 흐름을 유지하는 것이 특징이다.

#구글 #제미나이 #음성AI #실시간추론 #멀티모달 사진 Odin Reyna / Pexels

오픈클립스, 제품 링크 하나로 완성 동영상 광고 자동 생성

ZDNet Korea·2026-09-16멀티모달

AI 동영상 플랫폼 오픈클립스가 제품 URL 하나만 입력하면 프롬프트나 대본 작성 없이 즉시 배포 가능한 동영상 광고를 완성해 주는 서비스를 시작했다. 제품 페이지의 이미지, 특징, 포지셔닝 정보를 바탕으로 장면별 스토리보드를 자동 구성하며, 45개가 넘는 동영상·이미지 생성 모델을 하나의 인터페이스와 크레딧, 라이브러리로 통합해 제공한다. 이 서비스는 13년간 퍼포먼스 미디어를 운영해 온 코이니스 팀이 개발했으며, 무료 가입이 가능하고 유료 요금제에는 광고·수익화 채널용 상업 라이선스가 포함된다.

#AI동영상생성 #광고자동화 #멀티모델플랫폼 #오픈클립스 #마케팅테크 사진 Jakub Zerdzicki / Pexels

DJI, 8K 360도 카메라 '오즈모 360 II' 국내 출시

전자신문 SW·2026-09-16멀티모달

DJI가 파노라마 이미징 기술을 탑재한 2세대 360도 카메라 '오즈모 360 II'를 국내에 출시했다. 이 제품은 16mm(1인치) 정사각형 HDR 이미지 센서를 탑재해 기존 직사각형 센서와 동일한 360도 이미징 영역을 구현했다. 360도 다이내믹 레인지는 14.5스톱으로 확장됐다. 새롭게 개발된 AI 노이즈 감소 알고리즘을 적용해 저조도 환경에서도 밝은 영상 촬영이 가능하다.

#DJI #오즈모360II #360카메라 #AI노이즈감소 #파노라마이미징

갤럭시 폴더블 신제품, AI로 전문가급 보케 영상 구현

ZDNet Korea·2026-09-16멀티모달

삼성리서치와 삼성전자 MX사업부가 공동 개발해 갤럭시 Z 폴드8 울트라·폴드8·플립8에 전문가급 보케 영상 기술을 탑재했다. 피사체와 배경 거리에 따라 흐림 정도가 자연스럽게 달라지고 배경 광원이 빛방울로 표현되며, 촬영 후에도 초점 위치와 흐림 강도를 조절할 수 있다. 머리카락·안경테 등 복잡한 경계를 분리하기 위해 AI가 추정한 거리 정보에 원본 영상의 경계 정보를 결합하는 알고리즘을 적용했다. 스마트폰의 발열·전력 소모 한계를 극복하기 위해 화질에 영향이 큰 영역에 연산을 집중하는 최적화도 병행했다.

#갤럭시Z폴드8 #갤럭시Z플립8 #삼성리서치 #보케효과 #온디바이스AI

딥엘 보이스, 화자 목소리·감정까지 살려 번역

테크42·2026-09-15멀티모달

딥엘이 실시간 음성 번역 서비스 '딥엘 보이스'에 새 보이스 AI 모델을 적용했다고 16일 밝혔다. 번역 과정에서 말투, 리듬, 발화 속도, 억양 등 화자별 음성 특징과 질문·망설임·긴박함 같은 뉘앙스를 함께 유지하는 것이 핵심이다. 음성 특성 보존 기능은 한국어를 포함한 14개 언어를 지원하며, 음성 간 번역 대상은 30개 이상 언어로 확대됐다. 줌, 마이크로소프트 팀즈, 구글 미트를 아우르는 윈도우·맥용 '딥엘 보이스' 데스크톱 앱도 새로 출시돼 통화 감지와 실시간 자막 오버레이, 음성 대 음성 번역을 지원한다. 딥엘이 인용한 슬레이터의 독립 평가에서 딥엘 보이스는 AI 번역 자막 정확도 부문 1위를 기록했다.

#딥엘 #음성번역 #실시간번역 #다국어 #딥엘보이스

딥엘 보이스, 화자 고유 음성 특징 보존한 실시간 번역

ZDNet Korea·2026-09-15멀티모달

언어 AI 기업 딥엘이 음성 AI 기술 '딥엘 보이스'의 대규모 업데이트를 발표했다. 새 보이스 모델은 화자의 어투·감정·표현·속도 등 고유 음성 특성을 보존하며 번역하는 기능을 지원하며, 음성 보존 기능은 한국어를 포함한 14개 언어에서, 음성 간 번역은 30개 이상 언어에서 이용할 수 있다. 슬레이터의 독립 평가에서 딥엘 보이스는 AI 번역 자막 정확도 부문 1위로 평가받은 바 있다. 딥엘은 별도 연동 없이 줌·마이크로소프트 팀즈·구글 미트와 함께 작동하는 윈도우·맥용 보이스 데스크톱 앱도 새로 출시했다.

#딥엘 #음성번역 #실시간번역 #음성AI #화상회의 사진 Erkan Utu / Pexels

텐센트, 음성 생성·편집 통합 모델 'AuK' 공개

AI타임스·2026-09-14멀티모달

텐센트가 텍스트를 음성으로 변환하고 기존 음성의 내용, 음색, 감정, 억양을 자연어 지시로 수정할 수 있는 오픈소스 AI 모델 'AuK'를 9월 10일(현지시간) 공개했다. 자연어 지시어와 참조 오디오를 하나의 인터페이스에서 처리하는 통합 파운데이션 모델이다. 텐센트는 음성 생성과 편집을 한 모델에서 통합 처리한다는 점을 강조하며 '오디오용 나노바나나'라는 별칭을 붙였다.

#텐센트 #AuK #음성생성 #오픈소스 #음성편집 사진 César Guillotel / Pexels

AWS 베드록, TwelveLabs 임베딩으로 영상·이미지 자연어 검색 지원

AWS ML Blog·2026-09-10멀티모달

AWS가 TwelveLabs의 Marengo Embed 3.0을 Amazon Bedrock Knowledge Bases의 임베딩 모델로 정식 출시했다. 이 모델은 영상, 오디오, 이미지, 텍스트를 하나의 벡터 공간으로 함께 인코딩해 별도의 전사·프레임 추출·벡터DB 파이프라인 없이 영상 콘텐츠를 자연어로 검색할 수 있게 한다. 예시로 2022 FIFA 월드컵 결승전 영상 클립을 업로드해 '페널티킥 장면을 보여줘' 같은 질의로 해당 구간을 찾아내는 과정을 소개했다. Amazon S3, SharePoint, Confluence 등과 연동되며 결과에는 구간 시작·종료 시간 등 메타데이터가 포함된다.

#Amazon Bedrock #TwelveLabs #Marengo #멀티모달 검색 #RAG

애플, 애플워치에 '오디오 인텔리전스' 탑재

AI타임스·2026-09-10멀티모달

애플이 신제품 행사에서 애플워치 시리즈 12와 애플워치 울트라 4에 주변 소리를 인식하고 대화를 요약하며 음성을 실시간 텍스트로 변환하는 '오디오 인텔리전스' 기능을 공개했다. 이는 건강 관리와 알림 중심이던 애플워치가 대화와 주변 환경을 이해하는 AI 기기로 확장되는 시도다. 핵심 기능 중 하나로 대화 내용을 정리해주는 '시리 리캡'이 소개됐다. 이번 발표는 애플의 AI 웨어러블 시장 공략 행보로 풀이된다.

#애플 #애플워치 #웨어러블 #음성AI #시리 사진 Chris Lynch / Unsplash

애플, 첫 폴더블 아이폰 '듀오' 공개

AI타임스·2026-09-10멀티모달

애플이 9일(현지시간) '서프라이즈 앤 샤인' 행사에서 자사 최초의 폴더블 스마트폰 '아이폰 듀오'를 공개했다. 아이폰 출시 이후 가장 큰 하드웨어 폼팩터 변화로 평가되며, 여권과 비슷한 형태로 접히는 디자인을 채택했다. 애플은 폴더블폰의 고질적 문제로 꼽혀온 디스플레이 주름과 내구성 문제를 새로운 힌지와 소재 기술로 개선했다고 밝혔다. 대화면 기반 멀티태스킹을 앞세워 폴더블 스마트폰 시장 공략에 본격적으로 나설 계획이다.

#애플 #아이폰듀오 #폴더블스마트폰 #하드웨어 #신제품

애플, 에어팟5 공개…ANC 강화·시리 AI·실시간 번역

전자신문 IT·2026-09-09멀티모달

애플이 오픈형 무선 이어폰 '에어팟5'를 공개했다. 액티브 노이즈 캔슬링(ANC) 성능을 강화하고 '시리 AI'와 실시간 번역 기능을 지원한다. 기존에는 프로 제품군에 집중됐던 ANC와 AI 기능을 일반형 제품까지 확대한 것이 특징이다. 애플은 9일(현지시간) 미국 캘리포니아에서 이 제품을 공개했다.

#애플 #에어팟5 #시리AI #실시간번역 #ANC

NVIDIA, IBC서 방송·스포츠용 실시간 AI 확장 발표

NVIDIA Blog·2026-09-09멀티모달

NVIDIA가 암스테르담에서 열린 IBC 2026 콘퍼런스에서 방송·스포츠·스트리밍 워크플로를 겨냥한 'NVIDIA AI for Media' 확장을 발표했다. 영상의 AI 생성 여부를 판별하는 SVD(Synthetic Video Detector) NIM 마이크로서비스는 자체 테스트 기준 텍스트-투-비디오 영상에서 99.3%, 이미지-투-비디오 영상에서 97.7%의 정확도를 기록했다고 밝혔으며, Dalet·TwelveLabs·Wowza가 이를 각자 제품에 통합했다. 이와 함께 카메라 영상에서 인체 관절 움직임을 추출하는 3D Body Pose, 프레임 보간으로 슬로모션을 구현하는 Video Frame Generation, 화질을 높이는 Video Super Resolution, SDR을 HDR로 변환하는 TrueHDR 등도 공개됐다. Vizrt는 Body Pose를 가상 스튜디오 조명 연출에, Ross Video는 VFG를 스포츠 리플레이 제작에 적용하고 있다.

#NVIDIA #IBC2026 #합성영상탐지 #방송AI #비디오AI

카카오, 영상 생성 연산비용 줄이는 'KATok' 공개

AI타임스·2026-09-09멀티모달

카카오가 AI 영상 생성 모델의 방대한 연산량과 계산 비용 문제를 해결하기 위한 적응형 토큰화 기술 'KATok'을 개발해 컴퓨터 비전 학회 ECCV 2026에서 발표한다. ECCV는 CVPR, ICCV와 함께 세계 3대 컴퓨터 비전 학회로 스웨덴에서 열리며, 연구를 주도한 이연경 카카오 리서치 엔지니어가 10일 포스터 세션2에서 논문을 직접 발표할 예정이다. 이번 연구는 고해상도·장시간 비디오 생성 흐름 속에서 연산 효율을 높이는 데 초점을 맞췄다.

#카카오 #ECCV #영상 생성 #토큰화 #컴퓨터 비전 사진 TheRegisti / Unsplash

오픈AI, 스케치 기능 넣은 이미지 2.5 공개

AI타임스·2026-09-09멀티모달

오픈AI가 이미지 생성 속도와 편집 정밀도를 높인 새 모델 '챗GPT 이미지 2.5'를 공개했다. 사용자가 직접 그린 손그림을 참고 자료로 활용해 이미지를 생성할 수 있는 '스케치' 기능이 새롭게 추가됐다. 이는 기존 텍스트 중심 이미지 생성 방식에서 한 단계 나아간 것으로 평가된다. 해당 모델은 이미지 생성 아레나 순위에서 1위를 기록했다.

#오픈AI #챗GPT #이미지생성 #스케치 #아레나 사진 cottonbro studio / Pexels

오픈AI, 이미지 편집 정확도 높인 '이미지 2.5' 공개

전자신문 IT·2026-09-09멀티모달

오픈AI가 9일 이미지 품질과 편집 정확도를 개선한 '챗GPT 이미지 2.5'를 공개했다. 참고 사진 속 인물과 사물의 고유한 특징을 더 정확하게 반영하고 조명과 질감 표현이 자연스러워졌다. 챗GPT 안에서 직접 스케치를 그려 원하는 이미지를 생성하는 '스케치' 기능도 새로 추가됐다. 배경, 스타일, 구도를 바꾸는 창작 과정에서도 원본 대상의 특징을 보존하는 능력이 향상됐다.

#오픈AI #챗GPT #이미지생성 #이미지편집 #AI모델업데이트 사진 Kate Trysh / Unsplash

런웨이, 실시간 반응형 월드 모델 'GWM 월드 2' 공개

AI타임스·2026-09-07멀티모달

런웨이가 9월 3일(현지시간) 사용자의 키보드, 마우스, 텍스트 입력에 실시간으로 반응하며 길이 제한 없이 가상세계를 계속 생성하는 새로운 월드 모델 'GWM 월드 2'를 공개했다. 기존 영상 생성 모델이 프롬프트 입력 후 정해진 길이의 완성된 영상을 만들어내는 방식이었던 것과 달리, GWM 월드 2는 사용자가 세계에 개입하는 동안 프레임 단위로 실시간 반응하며 세계를 확장해 나간다.

#런웨이 #월드모델 #실시간생성 #가상세계 #영상생성 사진 Ron Lach / Pexels

xAI, 장면 연속성 개선한 그록 이매진 비디오 1.5 공개

AI타임스·2026-09-07멀티모달

xAI가 9월 5일(현지시간) '그록 이매진 비디오 1.5' 에이전트를 공개했다. 이번 업데이트는 영상 화질 개선뿐 아니라 여러 장면(샷)을 하나의 일관된 영상으로 자연스럽게 연결하는 데 초점을 맞췄다. 향상된 스토리텔링 기능도 함께 제공되며, 새로운 '비디오 1.6' 모델과 함께 발표됐다.

#xAI #그록 이매진 비디오 #영상생성 #멀티샷 연결 #AI 에이전트 사진 Jakob Owens / Unsplash

오픈AI 'GPT-6 아스트라', 포털 게임 자율 완주

AI타임스·2026-09-07멀티모달

오픈AI의 'GPT-6 아스트라'가 사람의 조작 없이 3차원 퍼즐 게임 '포털'의 모든 테스트 챔버를 자율적으로 해결한 것으로 나타났다. 게임 크리에이터 코지블레이즈는 9월 5일(현지시간) X를 통해 아스트라가 처음부터 끝까지 게임을 완주하는 영상을 공유했다. 공간 추론이 필요한 포털을 범용 AI 에이전트가 자율적으로 완주한 것은 이번이 처음이라고 전해졌다.

#오픈AI #GPT-6 #아스트라 #포털 #AI에이전트 사진 Anthony Riera / Unsplash

구글, 음악 생성 모델 '리리아 3.5' 제미나이에 탑재

AI타임스·2026-09-06멀티모달

구글이 음악 생성 모델 '리리아 3.5'를 9월 4일(현지시간) AI 챗봇 제미나이 앱에 적용했다. 7월 말 음악 창작 서비스 '구글 플로우 뮤직'에 처음 적용된 데 이어 제미나이 앱과 API, 구글 AI 스튜디오, 구글 비즈 등으로 지원 범위를 확대했다. 이를 통해 일반 사용자와 개발자도 웹과 모바일에서 음악을 손쉽게 제작할 수 있게 됐다.

#구글 #리리아3.5 #제미나이 #음악생성AI #구글AI스튜디오 사진 Tom Fisk / Pexels

구글, 제미나이 스파크에 구글 포토 연동 추가

AI타임스·2026-09-05멀티모달

구글이 개인용 AI 에이전트 '제미나이 스파크'에 구글 포토 연동 기능을 추가했다. 사용자는 자연어 명령으로 사진과 영상을 검색·분류하고 앨범을 만들거나 사진을 편집할 수 있다. 이미지 속 정보를 활용해 일정을 등록하는 등 복합 작업도 지원한다. 구글 포토 책임자 쉬므리트 벤야르가 9월 4일(현지시간) 이 기능을 공개했으며, 앞으로 몇 주에 걸쳐 미국 내 영어 사용자 중 자격을 갖춘 제미나이 AI 프로 및 울트라 가입자에게 순차 적용된다.

#구글 #제미나이 스파크 #구글포토 #AI에이전트 #사진관리 사진 Christina Morillo / Pexels

텐센트, 키보드 조작 반응하는 월드 모델 'H3-월드' 공개

AI타임스·2026-09-03멀티모달

텐센트가 싱가포르국립대(NUS), 홍콩공과대(PolyU)와 공동으로 키보드 입력을 캐릭터·카메라 움직임이 반영된 영상으로 변환하는 액션 제어형 월드 모델 'H3-월드'를 발표했다. 기존 영상 생성 AI가 프롬프트에 따라 정적인 영상을 만드는 것과 달리, 사용자의 WASD 같은 조작에 실시간으로 반응해 영상을 생성하는 인터랙티브 방식이다. 연구진은 해당 모델을 9월 1일(현지시간) 온라인 아카이브를 통해 공개했다.

#텐센트 #월드모델 #영상생성AI #인터랙티브AI #H3-World 사진 Amjith S / Unsplash

인월드 AI, 실시간 음성모델 'TTS-2' 공개

AI타임스·2026-09-03멀티모달

인월드 AI가 9월 2일(현지시간) 사용자의 말투와 속도, 감정 상태를 실시간으로 파악하고 자연어로 입력한 연출 지시까지 반영하는 음성 생성 모델 '실시간 TTS-2'를 출시했다. 기존 텍스트-음성 변환(TTS) 기술이 단순 변환에 머물렀다면, 이 모델은 실제 대화의 맥락과 감정까지 이해해 사람과 AI가 자연스럽게 소통하도록 설계됐다. 회사 측은 이 모델이 독립 평가 플랫폼 아티피셜 애널리시스에서 1위를 기록했다고 밝혔다.

#인월드AI #TTS-2 #음성AI #실시간음성생성 #아티피셜애널리시스 사진 Pixabay / Pexels

구글, 9월 안드로이드 드롭서 제미나이 기억 기능 추가

AI타임스·2026-09-03멀티모달

구글이 9월 1일(현지시간) 공식 홈페이지를 통해 안드로이드 드롭을 공개하고 일상 편의를 높이는 5가지 기능 업데이트를 발표했다. 핵심은 제미나이의 기억력 향상으로, 사용자가 중요한 물건을 어디에 뒀는지 말하면 제미나이가 해당 위치를 파인드 허브에 저장한다. 예를 들어 “안방 서랍에 여권을 넣었다고 파인드 허브에 기억해 줘”라고 음성으로 요청하면 되고, 사진을 함께 등록하는 것도 가능하다. 이후 물건을 찾을 때 저장된 정보를 다시 불러올 수 있다.

#구글 #제미나이 #안드로이드 #파인드 허브 #음성비서 사진 Thomas Le / Unsplash

메타, 실시간 음성인식 모델 '뮤즈 보이스 트랜스크라이브' 공개

AI타임스·2026-09-02멀티모달

메타가 실시간 음성 인식, 화자 분리, 발화 종료 감지를 하나의 모델에서 처리하는 '뮤즈 보이스 트랜스크라이브'를 공개했다. 메타 슈퍼인텔리전스 랩스(MSL)가 개발한 첫 실시간 오디오 인식 모델로, 실시간 스트리밍 자동음성인식(ASR)을 기반으로 한다. 메타 측 발표에 따르면 단어 오류율 3.1%를 기록해 스트리밍 음성 인식 벤치마크 1위에 올랐다. 80밀리초 단위로 속도와 정확도를 스스로 조절하는 기술도 적용됐다.

#메타 #음성인식 #뮤즈보이스트랜스크라이브 #MSL #실시간ASR 사진 Thomas Lineweaver / Pexels

구글 제미나이, '에이전트 비디오 이해' 기능 공개

AI타임스·2026-09-02멀티모달

구글이 2026년 9월 1일(현지시간) 영상 전체를 동일하게 처리하는 대신 분석 목적에 맞춰 필요한 장면을 AI가 스스로 탐색해 집중 분석하는 '에이전트 기반 비디오 이해' 기능을 공개했다. 이 방식은 장시간 영상 분석에서 토큰 사용량과 비용을 줄이면서 정확도는 높이는 것을 목표로 한다. 제미나이에 적용되는 이 기능은 영상 이해 방식을 전체 훑기에서 목적 기반 탐색으로 전환한다.

#구글 #제미나이 #비디오 이해 #에이전트 #멀티모달 사진 Moises Caro | Photographer / Pexels