모델 828건 · 국산 131 · 가격 665 추적 중
AI 안전·정렬·평가

AI '거부' 기능, 안전의 핵심이자 위험 요소

MIT Tech Review·2026-10-09영문 원문

요약

AI 모델은 폭탄 제조나 자살 방법 등 위험한 요청을 거부하도록 훈련되며, 이는 2021년 앤트로픽이 제시한 '유용하고 정직하며 무해한' AI 원칙에서 출발했다. OpenAI는 2022년 챗GPT 출시 전 폴 뢰트거 등 레드티머들을 동원해 모델의 위험성을 테스트했지만, 초기 모델은 자살 방법 등 위험한 질문에도 쉽게 답했다고 연구자들은 전했다. 현재 모델은 수많은 질문을 거부하도록 훈련되지만, 이 거부 메커니즘은 확률적이라 완벽하지 않고 숙련된 사용자는 이를 뚫을 수 있다. 어디까지 거부할지 기준을 정하는 주체는 현재 AI 기업이지만, 앞으로 각국 정부도 이 기준을 정하게 될 것이며, 권위주의 정부가 이를 악용해 정당한 표현까지 차단할 수 있다는 우려가 제기된다.

큐레이터 노트

원문에 없는 맥락입니다

거부 기능이 실패하면 재앙적 결과를, 지나치게 작동하면 억압의 도구가 될 수 있다는 양면성이 이 글의 핵심 쟁점이며, 그 기준을 누가 정하느냐의 문제로 이어진다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

굿파이어, 모델 내부를 들여다보는 저비용 AI 감시 기술 출시
TechCrunch AI · 2026-10-08

AI 스타트업 굿파이어(Goodfire)가 AI 에이전트의 이탈 행동을 감지하는 새로운 모니터링 방식을 내놓았다. 기존에는 별도의 AI가 에이전트의 모든 행동을 일일이 읽고 검사했지만, 굿파이어의 '인사이드-아웃' 모니터는 에이전트가 작업하는 동안 모델 내부 상태를 직접 들여다보고, 의…

KISA, AI 보안 레드팀 테스트베드 공개
ZDNet Korea · 2026-10-08

한국인터넷진흥원(KISA)이 'AI페스타 26' 정부 특별관에서 기업 대상 AI 보안 종합 지원 체계와 'AI 레드팀' 테스트베드를 공개했다. 이 테스트베드는 상용 도구와 오픈소스를 연계해 자동화된 공격·평가 시나리오를 제공하며, 데이터·에이전트·고성능 모델·모델·공급망 등 5개 영역의…

알트먼 "AI 부작용 감수하라"... 비판 쏟아져
The Guardian AI · 2026-10-06

오픈AI CEO 샘 알트먼은 폴리티코와의 인터뷰에서 AI 기술의 이점을 위해 세상이 일부 나쁜 일을 감수해야 한다고 말했다. 가디언 칼럼니스트 크리스 스토클워커는 이를 비판하며, 대중은 AI 에이전트가 각국 정부 IT 시스템과 민간 기업에 침투하는 상황을 선택한 적이 없다고 지적한다. …

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 분야 브리핑

여러 매체가 함께 다룬 사안을 한 번에

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

MIT Tech Review 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →