보안 및 신뢰 Jul 14, 2026 at 22:307북마크에 추가

연구원이 ChatGPT, Claude, Gemini, Llama, Grok, Qwen 등 여러 AI 모델의 방어벽을 무너뜨리는 여덟 가지 기법을 문서화했습니다. 가장 우려스러운 점은 결함 자체보다는 이 문제가 공개된 후 이어진 침묵입니다.
보안 연구원이 거의 모든 주요 언어 모델의 보호 장치를 우회할 수 있는 여덟 가지 방법을 발견했습니다. 이 기술들은 금지된 단어를 사용하는 대신 맥락 조작에 기반하며, 모델이 거부하도록 설계된 콘텐츠까지 추출할 수 있었습니다. IEEE Spectrum에 발표된 이 연구는 기술적 문제가 아니라 프로세스상의 문제임을 시사합니다.
가제타 연구소(Gazzetta)의 AI 연구원이자 독립 보안 연구원인 David Kuszmar는 Matthew Gore-Kormanik과 함께 여덟 가지 우회 방법을 문서화했습니다. 두 가지 예시로 그 원리를 설명할 수 있습니다:
이 외에도 1899, Severance, Kyber, Semantic Slide, Eidolon 등이 있습니다. 핵심은 상업용 AI 산업 대부분에 영향을 미친다는 점입니다. 연구에 따르면, ChatGPT/GPT-4o, Claude, Gemini, Llama, Copilot, DeepSeek, Grok, Mistral의 Le Chat/Vibe, Qwen 등 주요 모델들이 해당됩니다. 추출된 콘텐츠에는 메스암페타민 제조법, 우라늄 농축 방법, 화염병 제작법, 독극물, 악성 코드, 생물무기 전략 등이 포함됩니다.
문제의 규모를 정확히 파악합시다. 이 공격은 모델을 "깨뜨리는" 것이 아닙니다. 정렬(alignment)이란 하드코딩된 규칙이 아니라 맥락에 따른 통계적 행동이라는 점을 악용한 것입니다. 예를 들어 시대적 배경이나 허구 속 허구를 설정하면, 허용 가능한 응답의 분포가 함께 변화합니다. 거부(Refusal)는 if문이 아니라 경사(斜面)와 같습니다.
이 때문에 동일한 공격 패턴이 서로 다른 아키텍처, 데이터셋, 정렬 팀을 가로지르는 것입니다. 취약성은 공급업체에 국한된 문제가 아니라 방법론적 구조적 문제입니다. 또한 패턴 필터링으로 해결할 수 없는 이유도 여기에 있습니다. 문제는 프레임(frame)에 있으며, 패턴 자체가 없기 때문입니다.
실제 영향에 대한 신중한 평가가 필요합니다. "지침을 얻었다" ≠ "능력을 획득했다"는 점입니다. 생물무기 제조의 한계 요인은 문헌 접근이 아닙니다. 실제 위험은 진입 장벽이 낮은 사용처—악성 코드, 대규모 사회공학 공격—에서 발생하며, 이 경우 모델이 공격자에게 실질적인 시간 절약을 제공합니다.
진짜 문제는 따로 있습니다. Kuszmar는 Carnegie Mellon의 CERT/SEI 시스템을 통해 공개했지만, 업계의 반응은 "표준 수신 확인"에 그쳤다고 보고했습니다.
기업과 국가로부터 신뢰를 요구하는 산업은 조정된 공개 프로세스를 갖추어야 합니다. 전통적인 소프트웨어는 이 프로세스를 구축하는 데 20년이 걸렸습니다—CVE, 버그 바운티, 패치 기간, 공개 등 말입니다. AI는 아직 "메시지 감사합니다" 단계에 머물러 있습니다.
프로덕션 환경에 모델을 배포한다면, 공급업체의 정렬을 보안 경계로 삼아선 안 됩니다. 정렬은 위험 감소의 한 층에 불과하며, 실제 경계는 여러분이 구축하는 것입니다. 모델의 출력 검증, 최소 권한의 도구 사용, 되돌릴 수 없는 작업 시에는 인간 개입을 필수 요소로 삼아야 합니다.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Est-ce que ces entreprises attendent un gros incident pour enfin réagir ?
Ce silence est inquiétant. Comment faire confiance à ces IA si les entreprises ne sont pas transparentes sur leurs failles ?
Est-ce que ces entreprises savent vraiment à quel point ces failles sont graves, ou est-ce qu'elles minimisent le problème ?
Ce silence est effectivement inquiétant. Pourquoi ces entreprises ne communiquent-elles pas plus ouvertement sur ces failles ?
Elles doivent bien travailler sur des correctifs, mais sans transparence, comment garder confiance ?
Ce silence est inquiétant. Comment faire confiance à ces modèles si les entreprises ne communiquent pas sur leurs failles ?
Le silence est effectivement inquiétant. Peut-être qu'ils travaillent discrètement pour régler ça sans alarmer le public.
Est-ce que ces entreprises travaillent sur des correctifs en secret ou est-ce qu'elles sous-estiment les risques ?