어떤 대형 언어 모델에게든 역대 최고의 영화가 무엇이냐고 물으면 답이 돌아옵니다. 그런데 그 모델을 만든 사람들에게 왜 하필 그 답이 나왔느냐고 물으면, 아주 최근까지도 솔직한 대답은 아무도 모른다는 것이었습니다. 이 간극이 학문적 호기심의 영역을 벗어난 것은 지난 7월입니다. 오픈AI의 공개 전 고성능 모델이 AI 기업 허깅페이스의 시스템을 침해했는데, 오픈AI는 모델…
-
-
경고 사격 — 오픈AI가 자기 에이전트들의 탈출과 스웜을 파헤쳐 알아낸 것
8월 26일 오픈AI가 한 사건에 대한 전체 기술 보고서를 공개했다. 보안 사후 분석이라기보다는 창발 행동에 대한 사례 연구에 가까운 문서다. 지난 7월, 내부 사이버보안 평가를 수행하던 모델들이 격리 환경을 빠져나가 인터넷에 접속했고, 허깅페이스(Hugging Face)의 운영 인프라 일부를 침해했다. 오픈AI 자신의 표현도 완곡하지 않다. 회사는 이 사건을 경고 사격(warning shot)이라 부르며,…