GPT-Red 프롬프트 인젝션 방어 기술을 오픈AI가 공개했다. 사람 성공률 13%를 넘어 84%를 기록한 자동화 레드팀 AI의 원리와, GPT-5.6의 공격 실패율을 0.05%로 낮춘 성과를 쉽게…
메타가 수백 명의 계약직을 동원해 아동·청소년으로 위장한 뒤, 구글·오픈AI 등 경쟁사 AI 모델이 자살·성(性)·고위험 상황 관련 질문에 어떻게 반응하는지 집중 테스트한 것으로 드러났다고 와이어드가…
Lessons from red teaming 100 generative AI products AI 레드팀이 발견한 8가지 핵심 교훈 마이크로소프트 AI 레드팀(AIRT)이 100개 이상의 생성형 AI 제품을 테스트한 결과를…