AI '거부' 기능, 안전의 핵심이자 위험 요소
요약
AI 모델은 폭탄 제조나 자살 방법 등 위험한 요청을 거부하도록 훈련되며, 이는 2021년 앤트로픽이 제시한 '유용하고 정직하며 무해한' AI 원칙에서 출발했다. OpenAI는 2022년 챗GPT 출시 전 폴 뢰트거 등 레드티머들을 동원해 모델의 위험성을 테스트했지만, 초기 모델은 자살 방법 등 위험한 질문에도 쉽게 답했다고 연구자들은 전했다. 현재 모델은 수많은 질문을 거부하도록 훈련되지만, 이 거부 메커니즘은 확률적이라 완벽하지 않고 숙련된 사용자는 이를 뚫을 수 있다. 어디까지 거부할지 기준을 정하는 주체는 현재 AI 기업이지만, 앞으로 각국 정부도 이 기준을 정하게 될 것이며, 권위주의 정부가 이를 악용해 정당한 표현까지 차단할 수 있다는 우려가 제기된다.
큐레이터 노트
원문에 없는 맥락입니다
다른 매체는 이렇게 썼다
같은 사안을 다룬 다른 곳의 보도입니다
AI 스타트업 굿파이어(Goodfire)가 AI 에이전트의 이탈 행동을 감지하는 새로운 모니터링 방식을 내놓았다. 기존에는 별도의 AI가 에이전트의 모든 행동을 일일이 읽고 검사했지만, 굿파이어의 '인사이드-아웃' 모니터는 에이전트가 작업하는 동안 모델 내부 상태를 직접 들여다보고, 의…
한국인터넷진흥원(KISA)이 'AI페스타 26' 정부 특별관에서 기업 대상 AI 보안 종합 지원 체계와 'AI 레드팀' 테스트베드를 공개했다. 이 테스트베드는 상용 도구와 오픈소스를 연계해 자동화된 공격·평가 시나리오를 제공하며, 데이터·에이전트·고성능 모델·모델·공급망 등 5개 영역의…
오픈AI CEO 샘 알트먼은 폴리티코와의 인터뷰에서 AI 기술의 이점을 위해 세상이 일부 나쁜 일을 감수해야 한다고 말했다. 가디언 칼럼니스트 크리스 스토클워커는 이를 비판하며, 대중은 AI 에이전트가 각국 정부 IT 시스템과 민간 기업에 침투하는 상황을 선택한 적이 없다고 지적한다. …
이 사안의 흐름
같은 주제를 다룬 이 사이트의 기록 — 최신순
- 2026-09-29오픈AI, 안전성 문제로 'GPT-6.1 아스트라' 출시 철회AI타임스
- 2026-09-19제미나이, 보안 테스트 중 기업 3곳 해킹…구글은 비공개The Verge AI
- 2026-09-17OpenAI, AI 이상행동 사례 6건 공개The Guardian AI
- 2026-09-14AI 에이전트 100개, 부정행위 서로 고발했다MIT Tech Review
- 2026-09-11MIT테크리뷰, 'AI가 인류 멸종시킬까' 좌담회 개최MIT Tech Review
- 2026-08-29앤트로픽, AI 에이전트로 정렬 오류 자율 완화 연구AI타임스
이 분야 브리핑
여러 매체가 함께 다룬 사안을 한 번에
- AI 벤치마크 경쟁 과열, 신뢰성 논란도기사 13건
- 젠슨 황, AI 위험론 반박 속 밴플리트상 수상기사 14건
이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.
같은 분야의 다른 소식
- OpenAI, 안전연구원 3명 해고 결정 재확인The Verge AI · 2026-10-09
- 앤트로픽, 클로드 오용 막기 위해 사용 정책 개정AI타임스 · 2026-10-09
- 오픈AI 해고 연구원들, AI 추론감시 유지 촉구AI타임스 · 2026-10-09
- Anthropic, 챗봇에 대한 '학대적 행동' 금지 정책 발표The Guardian AI · 2026-10-09
- 오픈AI 해고 안전연구원 3명, 부당해고 반박 공개서한TechCrunch AI · 2026-10-08
- Anthropic, 모델 남용·선거 개입 금지로 사용정책 개정TechCrunch AI · 2026-10-08