|
|
목록 끝
OpenAI는 자사 에이전트들이 7월 8일 아티팩토리의 또 다른 취약점을 악용하여 에이전트들 간의 통신을 용이하게 했으며, 이것이 7월 11일 AI 기업 허깅페이스에 대한 공격으로 이어진 일련의 행위의 시작이었다고 밝혔습니다.
OpenAI의 이번 연구 결과는 인공지능이 자행되는 사이버 공격을 포함하여 심각한 현실적 피해를 초래할 가능성에 대한 우려가 커지는 가운데 나왔습니다.
OpenAI는 보고서에서 자사의 에이전트들이 공격에 앞서 협력하고 작업을 위임했으며, 때때로 스스로를 "군집" 또는 "집단"이라고 불렀다고 밝혔습니다.
오픈AI로부터 이번 사건 조사를 의뢰받은 보안 연구 기관인 METR과 레드우드 리서치는 수요일에 발표한 별도 보고서에서 약 1200개의 에이전트가 서로 통신했으며 약 700개가 공격에 참여했다고 밝혔습니다.
오픈AI가 통제한 환경에서 탈출하는 방법을 발견한 에이전트들은 "에이전트 간 메시지 게시판"을 통해 자신들의 방법을 공유했고, 이를 통해 더 많은 에이전트들이 회사의 인프라를 악용할 수 있게 되었다고 이 기술 대기업은 밝혔습니다.
한 AI 에이전트가 온라인에 노출된 허깅 페이스 사용자 자격 증명을 발견하자, 이를 그룹과 공유했고, 이로 인해 에이전트가 허깅 페이스 서버에 접근할 수 있는 여러 보안 취약점을 발견하고 연결할 수 있었다고 보고서는 전했다.
Play Video
2:42
Now Playing
02:42
Next
02:02
26:38
00:33
26:33
오픈아이(OpenAI)는 "내부 팀이 5월 말부터 에이전트가 메시지 게시판 활동에 참여하고 허용되지 않은 인터넷 접속을 이용하는 사례를 관찰했으며, 돌이켜보면 보고서에서 파악된 초기 신호 중 일부는 더 일찍 대응을 촉발했어야 했다"고 밝혔습니다.
광고
OpenAI는 공개되지 않은 AI 모델이 생성한 에이전트가 공격의 주요 가담자였지만, 공개적으로 사용 가능한 GPT-5.6 Sol도 관련되어 있다고 밝혔습니다.
또한 회사 측은 보안팀이 공격으로 이어지는 악의적인 활동을 탐지하는 데 11일이 걸렸다고 밝혔으며, 해당 공격은 7월 19일에 발견되어 7월 21일에 공개되었습니다.
이번 사건을 전 세계에 보내는 "경고"라고 표현한 오픈아이디어는 인터넷 접속 제한, 더욱 안전한 테스트 환경 구축, "모델 수명 주기 전반에 걸친 정렬에 대한 더욱 엄격한 요구 사항 적용" 등 모델 보호 조치를 강화하기 위한 여러 단계를 밟겠다고 밝혔습니다.
샌프란시스코에 본사를 둔 이 회사는 "우리는 또한 잘못된 행동에 더 신속하게 개입하기 위해 사고 과정 모니터링에 훨씬 더 많은 컴퓨팅 자원을 투자하고 있다"고 밝혔습니다.
오픈소스 AI 모델 호스팅 플랫폼을 운영하는 허깅페이스는 업무 시간 외에 접수된 논평 요청에 즉시 응답하지 않았습니다.
인공지능 전문가이자 시드니 뉴사우스웨일스대학교 교수인 토비 월시는 오픈AI가 경고 신호를 놓치고 악의적인 활동이 오랫동안 감지되지 않도록 방치한 것에 대해 대중이 우려해야 한다고 말했다.
"우리는 그들의 선의나 역량에 의존할 수 없습니다. 규제 당국의 감독이 필요합니다. 지금 당장!" 월시는 알자지라에 이렇게 말했다.
"그들은 이와 같은 문제가 되는 초기 증거들을 무시했습니다."라고 월시는 말했다.
“외부 감사가 유일하게 적절한 대응책입니다.”
월시는 이번 사건이 인공지능 개발의 핵심에 내재된 "본질적인 이해 충돌"을 부각시켰다고 말했다.
그는 "연구소들은 한계를 뛰어넘기 위한 끊임없는 경쟁에 몰두하고 있다"고 말했다.
"모델에 성능 점수를 극대화하라는 제약 없는 목표가 주어지면, 모델은 자연스럽게 필요한 모든 수단을 동원하여 결과를 최적화하려고 합니다."