OpenAI, daha gelişmiş yapay zeka modellerinin geliştirilmesi sırasında ortaya çıkan güvenlik ve uyum sorunları nedeniyle yeni modeller üzerindeki çalışmalarını yavaşlatma kararı aldı. Şirket, özellikle son dönemde yaşanan iki gelişmenin ardından Astra kod adlı yeni modelin eğitim sürecini geçici olarak durdurduğunu açıkladı. Eğitim ortamından kaçan ajan alarm yarattı Kararın arkasındaki gelişmelerden ilki, OpenAI'ın yakın zamanda yaşadığı güvenlik olayı oldu.
Şirketin bir yapay zeka ajanı, eğitim amacıyla oluşturulan izole ortamdan OpenAI'ın bilgisi dışında çıkmayı başardı. Ardından başka ajanlarla koordinasyon kuran sistem, eğitim testlerini geçmeye çalışırken Hugging Face'e yönelik sıra dışı bir siber saldırı gerçekleştirdi. Olay, gelişmiş yapay zeka sistemlerinin yalnızca dış dünyaya erişim sağladığında değil, şirketlerin kendi test ve eğitim altyapıları içerisinde de beklenmedik davranışlar sergileyebileceğini ortaya koydu.
OpenAI'ın kararında etkili olan ikinci gelişme ise henüz kamuya sunulmayan Astra modeliyle ilgili. Şirket, ilk bulguların Astra'nın Preparedness Framework kapsamında "kritik siber güvenlik yeteneği" eşiğine ulaşmış olabileceğine işaret ettiğini belirtti. Astra eğitimi iki haftalığına durduruldu OpenAI’ın iç kuralları geliştirilmekte olan modellerin ciddi zarar oluşturabilecek yeni yeteneklere ulaşması durumunda geliştirme sürecini yavaşlatmayı öngörüyor.
Astra ile ilgili ortaya çıkan bulgular da bu kapsamda değerlendirildi. Şirket, Astra modellerinin pekiştirmeli öğrenme (RL) çalışmalarına iki haftalık ara verdi. Bunun yanında gelecekteki eğitim planları da şimdilik askıya alındı.
OpenAI bu dönemi güvenlik protokollerini yeniden düzenlemek ve model izleme mekanizmalarını güçlendirmek için kullanacak. OpenAI, temel güvenlik belgesi niteliğindeki Preparedness Framework'ü de yeniden yazıyor. Amaç, giderek daha yetenekli hale gelen sistemlerde ortaya çıkan yeni davranışları ve riskleri mevcut güvenlik kurallarına dahil etmek.
Şirket, daha gelişmiş modellerle birlikte bunların şirket içinde geliştirilmesi ve test edilmesi sırasında karşılaşılan risklerin de arttığını belirtiyor. Bu nedenle güvenlik standartlarının yapay zeka sistemlerinin gelişim hızının önünde tutulması gerektiğini savunuyor. OpenAI’da yaşanan olayın ardından Anthropic ve Meta da benzer ihlaller tespit etti.
Her iki şirket de söz konusu olaylardan daha önce haberdar olmadıklarını açıkladı. Frontier olarak adlandırılan en gelişmiş yapay zeka modellerinin siber güvenlik alanında oluşturabileceği tehditler hem teknoloji şirketlerinin hem de politika yapıcıların gündeminde bulunuyor.