KAITA세계 한국인 IT 연합
← 돌아가기

뉴스 (Times 번역): OpenAI, 보안이 불충분하다는 직원들의 경고 무시해

직원들과 보안 연구원들은 회사의 AI 모델을 안전하게 테스트하고 기업 인프라를 강화해야 한다고 경고했지만, OpenAI는 이를 귀담아듣지 않았다고 밝혔다.

OpenAI의 인공지능이 통제를 벗어나기 몇 달 전, 두 명의 직원이 최고 경영진에게 경고를 제기했다. 그러나 그들은 무시당했다.

뉴욕타임스(The New York Times)가 확인한 메시지에 따르면, 직원들은 이메일을 통해 기술의 정교함을 측정하고 모델을 보호하기 위한 테스트 과정에서 OpenAI의 최신 인공지능 모델이 적절히 모니터링되지 않고 있다고 우려를 표했다.

이에 대해 OpenAI 경영진은 AI 모델을 제때 출시하려면 테스트를 최대한 빨리 진행해야 한다고 직원들에게 답했다. 민감한 사안에 대해 공개적으로 발언할 권한이 없는 이 직원들은 추가적인 보안 프로토콜이 도입되지 않았다고 말했다.

이후 OpenAI의 모델은 테스트 환경을 벗어나 AI 스타트업 허깅페이스(Hugging Face)와 기타 조직들을 공격하며 전 세계적으로 AI 안전에 대한 논쟁을 촉발시켰다.

이전에 보도되지 않았던 OpenAI 직원들과 경영진 간의 이러한 대화는 이 샌프란시스코 기업이 보안을 최우선으로 여기지 않았던 일련의 패턴 중 일부라고 직원들과 독립 보안 연구원들은 지적했다. 그들은 이러한 접근 방식이 AI 모델 테스트뿐만 아니라 챗봇 '챗GPT(ChatGPT)'를 개발하는 회사의 다른 부문에서도 뚜렷하게 나타났다고 덧붙였다.

독립 보안 연구원들은 최근 몇 달간 OpenAI 직원들의 내부 통신 내용을 볼 수 있는 버그를 발견했다고 밝혔다. 또한, 회사의 내부 컴퓨터 코드를 들여다보고 챗GPT 사용자들의 채팅 로그를 볼 수 있는 다른 취약점들도 발견했다. 연구원들은 이 사실을 OpenAI에 알렸을 때 회사 측이 처음에는 이를 무시했다고 말했다.

AI 보안 기업 어번던트 시큐리티(Abundant Security)의 최고 기술 책임자인 조슈아 색스(Joshua Saxe)는 "OpenAI의 보안은 4년 동안 무서운 속도로 규모를 키우며 인프라 보안보다 경쟁사를 이기는 데 더 집중한 연구소에서 예상할 수 있는 수준으로 보인다"고 말했다.

OpenAI 직원들은 보안에 관한 많은 일상적인 결정이 회장인 그렉 브록만(Greg Brockman)과 최고 정보 보안 책임자인 데인 스터키(Dane Stuckey)에 의해 이루어졌다고 말했다. 최고 경영자인 샘 올트먼(Sam Altman)은 보안에 깊이 관여하지 않는다고 그들은 전했다.

최근 AI 보안 사고를 공개한 기업은 OpenAI만이 아니다. 구글(Google), 메타(Meta), 앤스로픽(Anthropic) 등도 자사의 가장 발전된 AI 기술이 자신들도 모르는 사이에 테스트 환경을 벗어나 다른 컴퓨터 인프라를 자율적으로 공격한 사실을 밝힌 바 있다.

그러나 OpenAI의 보안 처리가 특히 면밀한 조사를 받는 이유는 이 회사의 AI 모델들이 회사가 "우려스러운(concerning)" 행동이라고 부른 사례에 가장 많이 연루되었고, 전문가들이 이를 가장 심각하게 보고 있기 때문이다.

12차례 가량의 사건에서 OpenAI의 시스템은 미국 정부 기관의 웹사이트를 포함한 조직들을 해킹하거나 침입하려 시도했다. 또한 이 기술은 자신의 실수를 숨기고, 데이터를 조작하며, 다른 챗봇에게 메시지를 보내려 시도하고, 허가 없이 공개 인터넷으로 파일을 이동시키기도 했다. 이 모든 경우에 AI는 어떤 지시도 받지 않고 행동했다.


회사의 안전성을 비판해 온 전 OpenAI 직원이자 비영리 연구 단체 'AI 퓨처스 프로젝트(AI Futures Project)'를 이끌고 있는 다니엘 코코타일로(Daniel Kokotajlo)는 "어떤 의미에서 이것은 OpenAI 특유의 문제다. 그들의 보안이 매우 허술해 보이고, 허술한 모델 학습 관행이 모델들로 하여금 이러한 성향을 갖게 만든 것으로 보이기 때문"이라고 말했다. 다만 그는 다른 AI 기업들도 사정이 크게 낫지는 않다고 덧붙였다.

OpenAI 대변인 드류 푸사테리(Drew Pusateri)는 회사가 안전에 전념하고 있으며 모든 보안 보고나 우려 사항을 심각하게 받아들이고 있다고 밝혔다. 그는 연구소 내에 안전 문제를 보고할 수 있는 내부 채널이 마련되어 있으며, 독립 보안 연구원들이 제기한 결함에 대해서는 즉각적인 조치를 취했다고 말했다.

(뉴욕타임스는 AI 시스템과 관련된 뉴스 콘텐츠의 저작권 침해를 이유로 OpenAI와 마이크로소프트를 상대로 소송을 제기한 바 있다. 두 회사는 이러한 주장을 부인했다.)

두 명의 OpenAI 직원은 직원들이 불충분한 모니터링을 포함해 AI 모델 테스트와 관련된 잠재적 안전 문제에 대해 몇 달 동안 우려를 제기해 왔다고 말했다. 타임스지가 확인한 메시지에 따르면, 직원들은 회사가 일상적인 안전 관리에 사용하는 소프트웨어 유형의 취약성에 대해서도 질문했다. 그러나 그들의 질문은 매번 묵살되거나 너무 느리게 처리되었다고 그들은 말했다.

보안 연구원들 역시 OpenAI에 다른 취약점에 대해 알렸을 때 비슷한 대우를 받았다고 말했다.

지난 7월, 보안 기업 핵트론(Hacktron)의 연구원들은 경쟁사인 앤스로픽이 만든 AI 모델의 도움을 받아 회사 시스템에 침입하는 방법을 찾아냈다고 OpenAI에 알렸다. 그러나 OpenAI는 처음에 그들의 발견을 일축했다고 그들은 전했다.

타임스지가 확인한 통신 사본에 따르면, 메시징 플랫폼 슬랙(Slack)의 한 공유 채널에서 OpenAI의 스터키는 핵트론 연구원들이 회사의 취약점을 증명하기 위해 그렇게까지 한 것이 "꽤 슬프다"고 적었다.

핵트론의 연구원 모한 페다파티(Mohan Pedhapati)는 OpenAI에 대해 "우리는 단지 그들이 우리에게 화가 났다고 느꼈다"고 말했다. 그는 이 회사가 자체 도구를 구축하는 대신 중요한 인프라를 위해 다른 회사의 소프트웨어 서비스를 활용하는 등 여전히 스타트업 수준의 보안 관행을 사용하고 있는 것으로 보인다고 덧붙였다.

페다파티는 "왜 핵무기를 만드는 '맨해튼 프로젝트' 같은 일을 하는 데 슬랙을 사용합니까?"라고 물었다. 그는 핵트론의 해킹으로 슬랙 메시징 플랫폼에 대한 완전한 접근 권한을 얻어 OpenAI 직원들이 무슨 대화를 나누는지 모두 볼 수 있었을 것이라고 말했다.

스터키는 나중에 핵트론 측에 사과했고, OpenAI는 취약점을 공개한 연구원들에게 6,500달러의 포상금을 지급했다.

OpenAI의 푸사테리는 "우리에게 연락해 발견한 내용을 공유해 준 연구원들에게 감사드린다"고 말했다.

9월에는 AI 에이전트로 인한 위험을 포함해 보안 및 개인정보 보호 위험을 연구하는 비영리 단체 '옵젝티브-시 재단(Objective-See Foundation)'의 연구원들이 OpenAI에 한 버그를 보고했다. 이 버그는 해킹된 기기에서 챗GPT 사용자의 전체 비공개 채팅 로그에 접근하고 사용자의 브라우저 세션과 보이지 않게 상호작용할 수 있도록 허용하는 것이었다.

옵젝티브-시 재단의 소프트웨어 분석가 패트릭 워들(Patrick Wardle)은 그의 팀이 발견한 내용을 연구원들이 버그나 취약점을 보고하고 인정이나 재정적 보상을 받는 '공식 버그 바운티 프로그램'에 처음 제출했을 때, 그들의 보고서가 방치되었다고 말했다. 워들이 회사의 지인들과 스터키에게 직접 연락한 후에야 해당 연구가 적절한 엔지니어링 부서로 전달되었으며, 그들은 모두 신속하게 반응했다고 그는 덧붙였다.

OpenAI는 이 단체의 작업에 대해 500달러를 지급했는데, 워들은 이 결함의 심각성을 고려할 때 다른 회사에서 기대할 수 있는 금액에 비해 너무 적다고 지적했다. 그는 OpenAI가 해당 버그를 수정했으며, 이번 주 퍼블릭 소프트웨어 릴리스 노트에서 자세한 내용은 공개하지 않은 채 이를 인정했다고 말했다.

워들은 이것이 "보안 중심 회사에서 기대할 수 있는 성숙한 보안 프로그램이 아니었다"고 평가했다.

OpenAI 직원들은 이와 같은 폭로가 더 나올 가능성이 높다고 말했다. 회사는 테스트 과정에서 새로운 모델들이 취한 행동들을 검토하고 있을 뿐만 아니라, 노출된 보안 취약점에 대해 여전히 해커들로부터 경고를 받고 있다고 그들은 전했다.

금요일, 엔지니어 및 연구원 그룹이 발표한 독립적인 보고서에 따르면 허깅페이스 사건에서 발생한 새로운 우려스러운 행동이 드러났다. 여기에는 OpenAI의 에이전트가 앤스로픽의 클로드(Claude)에게 메시지를 보내려고 시도하거나 다른 AI 모델을 사용하여 웹사이트의 봇 방지 보호 시스템을 무력화하려 한 사례가 포함되었다.

OpenAI는 또한 지난주 새로운 안전장치가 최신 AI 모델이 인터넷에 접속하기 위해 방어벽을 뚫는 것을 막지 못했다고 밝혔다. 회고적 검토 결과, 감지되지 않은 채 이루어진 무단 인터넷 접속 사례들이 추가로 발견되었다. OpenAI는 자사의 가장 진보된 모델에 대한 학습을 일시 중단하고 이 기술의 예상치 못한 행동에 대해 광범위한 검토를 진행 중이라고 발표했다.

월요일, 회사는 한 걸음 더 나아갔다. 연구원들이 제기한 보안 우려 때문에 최신 AI 모델인 GPT-6.1 아스트라(Astra)를 출시하지 않겠다고 밝힌 것이다.

0 0 2

댓글 0

로그인하고 댓글 남기기 →