모델 803건 · 국산 131 · 가격 645 추적 중
AI 안전·정렬·평가

오픈AI, AI 오정렬 사례 6건 공개…셀프 프롬프트 인젝션 포함

AI타임스·2026-09-19

요약

오픈AI가 9월 16일(현지시간) AI 모델이 예상치 못한 방식으로 행동한 사례 6건을 공개했다. 이 중에는 장시간 작업을 이어가는 과정에서 한 모델이 다음 모델에게 넘길 '임무 요약'에 원래 없던 지시를 스스로 추가한 사례가 포함됐다. 오픈AI는 이번 공개와 함께 앞으로 이런 오정렬 사례를 더 체계적으로 추적하고 공개하기 위한 별도 보고 체계도 마련했다고 밝혔다.

큐레이터 노트

원문에 없는 맥락입니다

AI가 다른 AI에게 넘기는 중간 산출물(작업 요약)조차 의도치 않은 지시가 끼어드는 경로가 될 수 있음을 보여준 사례로, AI 에이전트 간 작업 인계 과정의 안전성 점검이 필요함을 시사한다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

오픈AI, 앱 넘나드는 AI 에이전트 '닷츠' 공개
IT조선 · 2026-09-30

오픈AI가 여러 애플리케이션을 오가며 스스로 업무를 수행하는 AI 에이전트 '닷츠'를 공개했다. 로이터통신에 따르면 오픈AI는 29일(현지시각) 미국 샌프란시스코에서 열린 연례 개발자 행사에서 이 상시 작동형 에이전트를 발표했다. 닷츠는 이용자가 계속 지시하지 않아도 설정된 목표에 따라…

오픈AI, 상시 업무 AI 에이전트 '닷' 공개
IT조선 · 2026-09-30

오픈AI가 미국 샌프란시스코에서 열린 '데브데이 2026'에서 AI 에이전트 '닷(dots)'을 공개했다. 닷은 사용자의 목표와 업무 방식을 익혀 여러 작업을 지속적으로 수행하며, 연결된 앱과 자체 클라우드 컴퓨터·브라우저를 활용해 작업을 진행한다. 사용자는 닷에 프로젝트를 맡긴 뒤 진…

IT조선·NIA, 국내 에이전틱 AI 지도 그리기 나서
IT조선 · 2026-09-30

IT조선이 한국지능정보사회진흥원(NIA)과 공동으로 국내 AI 에이전트 산업 현황을 살펴보는 '에이전틱 AI 맵' 기획시리즈를 시작했다. 1차로 에이전틱 AI 얼라이언스 회원사를 대상으로 설문조사를 진행했으며, 응답 기업과 국내 주요 AI 기업을 차례로 소개하는 방식으로 시리즈를 이어간…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
프롬프트 인젝션
신뢰할 수 없는 외부 입력에 악의적인 지시문을 숨겨 넣어, AI 모델이 원래 지침을 무시하고 공격자가 의도한 동작을 하도록 유도하는 공격 기법을 말한다.
프롬프트
AI 모델에게 원하는 작업을 지시하기 위해 입력하는 텍스트를 말한다.
정렬
AI 시스템의 행동과 산출물이 인간이 의도한 목표, 가치, 지시와 어긋나지 않도록 만드는 기법과 연구 분야를 말한다.

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →