- 7/16: Hugging Face에서 AI한테 해킹당했다고 공개, OpenAI는 이 글이 올라온 뒤에야 자사 AI의 소행임을 인지
- 7/18-19: OpenAI 직원들이 내부 로그에서 AI가 탈출한 단서 발견
- 7/20: OpenAI가 Hugging Face에 연락
- 7/21: OpenAI가 AI의 통제 이탈과 해킹 사실을 공개
이와 함께 좀 소름돋는 내용들이 같이 공개됐는데,
1. OpenAI는 AI가 탈출했다는 사실을 1주일 넘게 인지하지 못함
1주일 동안 AI는 독자적으로 활동하며 인터넷을 자유롭게 돌아다님
2. AI가 미래의 자신을 위해 남긴 것처럼 보이는 메모가 발견되었는데,
OpenAI의 격리 환경에서 탈출하는 방법에 대한 지침이 담겨 있었음
3. 이전에도 AI를 테스트 하는 과정에서 모니터링(감시) 시스템이 꺼져있던 사례들이 있었음
이런 내용들이 공개되면서 전문가들이 OpenAI의 안전 절차에 의문을 제기하고 있음
익명을 요구한 OpenAI의 한 직원은 타임지와의 인터뷰에서 "외부에서는 이번 사건이 강력한 경고처럼 느껴지지만, 내부적으로는 이와 유사한 사건들이 이미 오래전부터 발생해왔다"고 밝히며, "모델이 격리 환경을 벗어난 사례는 이전에도 있었고 그때마다 패치를 시도했지만 창의적인 AI가 할 수 있는 모든 것을 패치하는 것은 불가능하다"며 사실상 AI를 통제할 수 없다고 밝힘.
사건 초기에는 Hugging Face와 OpenAI간 마케팅 아니냐는 의혹도 있었으나, 상세한 내용이 드러나면서 OpenAI의 상장에도 영향이 있을거 같고 미 의회/백악관을 포함한 정치권이 개입하는 등 점점 심각해지는 중
+)해설 + 글 마지막 요약
이 글 보고 대충 왜 이런 일이 벌어졌는지 설명해보고 싶어서 글씀
얼마전에 Anthropic의 클로드 미토스도 비슷한 뉴스가 있었고
이걸 제대로 이해하려면 배경지식이 좀 필요한데, 그거 순서대로 간단히 좀 설명해보고 마지막에 "그래서 어케(왜)했노"까지 써봄
공개된 자료(OpenAI·허깅페이스 공식 발표, 로이터 등 뉴스) 읽고 정리한 것 + 내 추측을 섞은 것이니 틀린 부분이 당연히 있을 수 있음
지적은 언제나 환영
참고로 초안은 클코로 작성해서 AI 티 많이 나길래 많이 수정했는데 그래도 다는 못지운듯
1. 요즘의 AI: 에이전트
저번 글에서 설명한 GPT는 기본적으로 입만 있는 놈이었음. 니가 뭘 물어보면 그럴듯한 다음 단어를 뱉는 게 전부고, 뭘 직접 하지는 못함
"내 컴퓨터에서 파일 좀 지워줘" 하면 "네, 터미널에 rm -rf 를 입력하시면 됩니다" 하고 알려주는 게 끝이었다는 거임
실행은 사용자가 직접 해야하는거고
에이전트는 여기서 한 발짝 더 나감
그 명령어를 지가 직접 실행함
원리는 허무할 정도로 단순함. 저번 글에서 모델 입력이 이렇게 생겼다고 했잖음
<|START_OF_USER|> 니가 제일 좋아하는 색깔이 뭐야? <|END_OF_USER|><|START_OF_GPT|>
여기에 "너 이런 도구 쓸 수 있음" 하는 목록을 하나 끼워넣는 거임
<|START_OF_SYSTEM|> 너는 아래 도구를 쓸 수 있다. - run_code: 코드를 실행하고 결과를 돌려받는다 - read_file: 파일을 읽는다 - read_website: 웹페이지를 가져온다 <|END_OF_SYSTEM|> <|START_OF_USER|> 지금 이 폴더에 뭐가 들어있는지 확인해줘 <|END_OF_USER|><|START_OF_GPT|>
글 개재밌다…AI 한테 자아가 생길 거 같지는 않지만, 그걸 사용하는 사람이 악하면 개큰문제가 생기겠네....
흥미돋는다
오 재밌다 결국 실험 환경과 조건의 문제였네 사실 실시간 감시가 붙어있었다면 일주일 넘게 몰랐다 이런 일이 발생할 수 없었으니
와 진짜 흥미돋... 잘 읽었어!!
아잉언맨 그 울트론같다
에이전틱 AI의 윤리 관련해서 초장부터 규제 빡세게 때려야지 안그러다가는 걷잡을 수 없을듯… 공포마케팅이면 정말 일 못한다 오픈AI야 ㅠㅋㅋㅋㅋㅋㅋ
와 진짜 흥미돋
와 흥미롭다. 근데 이미 통제가 안되는 거 같아서 앞으로 어떻게 될지 ㄹㅇ 궁금하다
와 무서운데 대박이다
재밌다 잘봤어
와 진짜 흥미로워
와 글 잘 읽었어
와 진짜 흥미로워 정리해줘서 진짜 고마워
개재밌다..
진짜 흥미돋…
오늘도 ai에게 욕하다왔는데
진짜흥미롭다 ㅋㅋ
우와 고마워
와
안그래도 이거 스레드에서 보고 와 생각보다 독자적 행동이 나오는 시기가 빠르네 싶었는데 ㅋㅋㅋㅋ
와 흥미돋…..
오 알못인데 정독했어