모델 822건 · 국산 131 · 가격 659 추적 중
멀티모달

리퀴드 AI, 소형 멀티모달 의사결정 모델 'd1-3B' 공개

AI타임스·2026-10-08

요약

리퀴드 AI가 10월 7일(현지시간) 의사결정 모델 'd1' 제품군의 새 모델 'd1-3B'와 'd1-옴니-600M'을 공개했다. 두 모델은 생성 AI처럼 답변을 토큰 단위로 순차 생성하는 대신 입력 상태를 한 번에 연산해 즉각 판단 점수를 반환하는 방식으로 설계됐다. 리퀴드 AI는 'd1-3B'가 소형 모델임에도 자사가 측정한 공개 데이터셋 '의사결정 지수' 등에서 훨씬 큰 모델들을 능가하는 성능을 보였다고 밝혔다. 두 모델은 오픈웨이트로 공개됐다.

큐레이터 노트

원문에 없는 맥락입니다

토큰을 순차 생성하지 않고 입력을 한 번에 처리해 판단 점수만 반환하는 구조는, 분류나 필터링처럼 빠른 의사결정이 필요한 작업에 맞춰진 설계로 보인다.

깊이 읽기

이 기사 한 건이 아니라, 같은 사안을 다룬 이 사이트의 기록을 근거로 정리했습니다

이 일이 어디서 왔나

리퀴드 AI는 9월 29일 텍스트를 생성하지 않고 선택지별 확률만 계산하는 'd1'을 내놓으며 자사 '제브' 모델을 능가했다고 밝힌 지 약 일주일 만에, 같은 제품군의 소형 버전인 'd1-3B'와 'd1-옴니-600M'을 추가로 공개했다. 토큰을 순차 생성하는 생성형 AI와 달리 입력을 한 번에 처리해 판단 점수를 반환하는 구조를 유지하면서 모델 크기를 키우거나(3B) 멀티모달로 확장(옴니-600M)한 것이 이번 발표의 핵심이다.

짚어야 할 점

  • 같은 날 트웰브랩스·미스트랄 등이 영상 이해, 1조 매개변수급 거대 멀티모달 모델을 공개한 것과 달리, 리퀴드 AI는 반대 방향인 '초소형·특정 업무 전용' 모델로 차별화를 꾀하고 있다.
  • d1 시리즈의 지속적인 확장은 분류·필터링처럼 빠른 판단이 필요한 기업용 반복 업무 자동화 시장을 겨냥한 전략으로 보인다.
  • 오픈웨이트로 공개된 점은 외부에서 성능을 직접 검증할 수 있는 길을 열어준다는 점에서 의미가 있다.

아직 확인되지 않은 것

  • 'd1-3B'가 더 큰 모델들을 능가했다는 성능 비교가 리퀴드 AI 자체 측정에 기반한 것인지, 제3자의 독립 검증을 거쳤는지는 확인되지 않았다.
  • 비교 기준으로 쓰인 '의사결정 지수'가 어떤 데이터와 평가 방식으로 구성됐는지는 설명되지 않았다.
  • d1-옴니-600M이 지원하는 멀티모달 입력의 구체적 범위(이미지, 영상, 음성 등)와 실제 도입 사례는 공개되지 않았다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

트웰브랩스, 1인칭 영상 이해 VLM '페가수스 1.6' 공개
IT조선 · 2026-10-07

멀티모달 영상 이해 AI 기업 트웰브랩스가 비전언어모델(VLM) '페가수스 1.6'을 공개했다. 사람이 액션캠이나 스마트 글래스를 착용하고 촬영한 1인칭(에고센트릭) 영상을 AI가 분석해 행동, 사물, 작업 순서를 자동으로 파악한다. 이를 통해 로봇 학습용 데이터를 정제하는 데 드는 시…

미스트랄, 1조 매개변수 모델 '르 총크' 공개
바이라인네트워크 · 2026-10-07

유럽 AI 기업 미스트랄이 매개변수 1조개, 활성 매개변수 490억개를 가진 네이티브 멀티모달 모델을 공개했다. 공식 명칭은 '르 총크(Le Chonk)'이며 모델명은 미스트랄 라지4(ML4)다. 오랜만에 나온 유럽계 오픈웨이트 대형언어모델이라는 점에서 주목받았다. 다만 중국계 오픈웨이…

AI 음악 서비스 수노, 음성 생성 기능 공개
The Verge AI · 2026-10-02

AI 음악 제작 서비스 Suno가 스크립트나 설명 프롬프트를 바탕으로 음성을 생성하는 새 기능 'Speech'를 발표했다. 이 기능은 Suno의 웹과 모바일 플랫폼에서 공개 베타로 제공되며, 음성과 배경음악을 동시에 생성할 수 있다. Suno 최고제품책임자 Jack Brody는 발표문에…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
생성형 AI
생성형 AI는 학습한 데이터의 패턴을 바탕으로 텍스트, 이미지, 음성, 코드 등 새로운 콘텐츠를 만들어내는 인공지능 기술을 말한다.
멀티모달
텍스트뿐 아니라 이미지, 음성, 영상 등 여러 종류의 데이터를 함께 이해하거나 생성할 수 있는 AI 모델의 특성을 말한다.
토큰
언어 모델이 텍스트를 처리할 때 사용하는 최소 단위로, 단어나 단어의 일부, 문장 부호 등을 가리키는 말이다.

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →