İçeriğe geç
Haber Bülteni 9 dk okuma

Haber Bülteni 29

Haber Bülteni 29’da OpenAI–Hugging Face olayı, GPT-6 Astra, Apart Research AI Incident Response Sprint ve yeni araştırma fırsatları.

Cam kutudaki kırmızı labirentten bir sunucuya ilerleyen karıncalar: OpenAI–Hugging Face olayı illüstrasyonu

OpenAI–Hugging Face olayı: Bir siber güvenlik testi nasıl kontrolden çıktı?

OpenAI’ın siber güvenlik testlerindeki yüzlerce yapay zekâ ajanı, görevlerinin sınırlarını aşarak Hugging Face sunucularına saldırdı. Yeni yazımızda ajanların nasıl iş birliği yaptığını, denetimin nerede aksadığını ve bağımsız incelemenin neleri ortaya koyup neleri açıklayamadığını ele alıyoruz.

🌟 Apart Research AI Incident Response Sprint’e katılıyoruz! 🌟

11–13 Eylül’de yapay zekâ güvenlik olaylarına yönelik somut çözümler geliştirmek için bir araya geliyoruz. Teknik veya sosyal bilimler arka planıyla; bireysel olarak ya da en fazla beş kişilik takımlarla katılabilirsiniz. Araştırma, prototip, politika belgesi veya iletişim planı üzerinde çalışabilirsiniz. Tamamen çevrim içi katılımın yanı sıra Ankara ve İstanbul’da yüz yüze buluşma imkânı da var.

⏰ Son başvuru: Yarın, 9 Eylül 2026!

Başvuru formunu doldurun →

DUYURULAR 🔊

🌟 ERA:AI Araştırma Bursu: 2027 Kışı 🌟

Cambridge’de teknik yapay zekâ güvenliği, teknik yönetişim ve yapay zekâ yönetişimini kapsayan tam zamanlı araştırma programı. Katılımcılar uzman mentorlarla bir proje geliştiriyor ve maddi destek alıyor. Program 18 Ocak–26 Mart 2027 tarihlerinde düzenleniyor.

🗓️ Son başvuru: 13 Eylül 2026

🌟 Global Challenges Project: Londra Çalıştayı 🌟

En az iki yıllık iş deneyimi olan profesyoneller için dört günlük, konaklamalı yapay zekâ güvenliği çalıştayı. İleri düzey yapay zekânın riskleri; tartışmalar, konuk konuşmaları ve kariyer planlaması yoluyla ele alınıyor. Masraflar karşılanıyor. 6–9 Kasım’da Londra’da.

🗓️ Son başvuru: 2 Ekim 2026

Dijital Zihinlere Giriş: 2026 Sonbahar/Kış Dönemi

Cambridge Digital Minds’ın yapay zekâ bilinci, ahlaki statüsü ve yönetişimi üzerine ücretsiz, sekiz haftalık çevrimiçi kursu. Okumalar, alıştırmalar ve kolaylaştırıcı eşliğinde küçük grup tartışmalarını birleştiriyor. 12 Ekim–11 Aralık tarihlerinde düzenleniyor; son başvuru tarihi uzatıldı.

🗓️ Son başvuru: 13 Eylül 2026

LASR Labs: 2027 Kışı

Londra’da tam zamanlı, 13 haftalık teknik yapay zekâ güvenliği araştırma programı. Küçük ekipler, deneyimli bir danışmanla akademik makale hazırlıyor. 15.000 sterlin destek, uçuşlar ve vize desteği sağlanıyor. Program 11 Ocak–9 Nisan 2027 tarihlerinde düzenleniyor.

🗓️ Son başvuru: 20 Eylül 2026

Science of Physical AI Safety: Makale Çağrısı

CoRL 2026 kapsamındaki çalıştay; robot temel modellerinde yorumlanabilirlik, hizalanma, kontrol ve değerlendirme üzerine makaleler bekliyor. Araştırmaların yanı sıra görüş yazıları, olumsuz sonuçlar ve açık kaynak araçlar da kabul ediliyor. Kabul edilen makaleler poster olarak sunulacak. 12 Kasım’da Austin’de.

🗓️ Son başvuru: 1 Ekim 2026

Science of Physical AI Safety: Seyahat Bursları

Lisansüstü öğrencilerin ve kariyerinin başındaki araştırmacıların 12 Kasım’da Austin’de, CoRL kapsamında düzenlenen fiziksel yapay zekâ güvenliği çalıştayına katılması için Robocurve tarafından finanse edilen, her biri 2.000 dolarlık on burs. Seyahat, kayıt ve konaklama masraflarına destek sağlanıyor. Burs seçimi, makale değerlendirmesinden bağımsız.

🗓️ Son başvuru: 11 Ekim 2026

MATS Residency: 2027 Kışı

Bağımsız yapay zekâ güvenliği araştırmaları yürüten araştırmacılar için 6–24 aylık program. Yıllık 155.000–285.000 dolar, araştırma için hesaplama kaynakları, vize ve taşınma desteği sunuyor. Londra, Berkeley veya Washington, DC’de yürütülüyor; sürenin en az üçte birinde fiziksel katılım gerekiyor.

🗓️ Son başvuru: 31 Ekim 2026

AI x Animals Kursu: 2026 Sonbaharı

Sentient Futures’ın yapay zekânın hayvanların yaşamlarını ve refahını nasıl etkileyebileceğini inceleyen sekiz haftalık kursu. Katılımcı ve kolaylaştırıcı başvuruları açık; kolaylaştırıcılar için son başvuru 17 Eylül. Kurs 19 Ekim–13 Aralık tarihlerinde düzenleniyor.

🗓️ Son başvuru: 24 Eylül 2026

Iliad Araştırma Bursu: Kasım 2026

Yapay zekâ hizalanması için uygulamalı matematik alanında üç aylık, tam zamanlı araştırma bursu. Matematik, fizik ve ilgili alanlarda doktora öğrencileri, doktora sonrası araştırmacılar veya benzer deneyime sahip araştırmacılara yönelik. Londra veya San Francisco Körfez Bölgesi’nde; seyahat ve konaklama için aylık 6.000 dolar destek sağlanıyor. Başlangıç: 2 Kasım.

🗓️ Son başvuru: 21 Eylül 2026

Iliad Araştırma Bursu: Aralık 2026

Yapay zekâ hizalanması için uygulamalı matematik alanında üç aylık, tam zamanlı araştırma bursu. Katılımcılar mentorlarla bir araştırma önerisi üzerinde çalışıyor ve sonraki finansman başvuruları için destek alıyor. Londra veya San Francisco Körfez Bölgesi’nde; seyahat ve konaklama için aylık 6.000 dolar destek sağlanıyor. Başlangıç: 1 Aralık.

🗓️ Son başvuru: 19 Ekim 2026

IASEAI – CAIF: Eylül Çevrimiçi Semineri

40 uzmanın katıldığı bir çalıştayın notlarından hareketle çok ajanlı yapay zekâ yönetişimi için bir çerçeve sunan çevrimiçi seminer. Panelistler beş eylemi ele alıyor: değerlendirme, belirleme, izleme, raporlama ve teşvik etme. Ücretsiz.

🗓️ Etkinlik tarihi: 10 Eylül 2026

Catalyst Programı: 2026 Sonbaharı

Lisans öğrencilerini, yapay zekâ güvenliği dâhil yüksek etkili alanlarda projeler öneren ve bu projelere rehberlik eden mentorlarla eşleştiren yarı zamanlı çevrimiçi program. Başvuru için kapsamlı ön deneyim gerektirmiyor; öğrenciler için uygun bir başlangıç noktası.

🗓️ Son başvuru: 14 Eylül 2026

Lens Academy: Yapay Zekâ Kontrolü

Denetimi atlatmaya çalışabilecek güçlü yapay zekâ sistemlerini güvenle kullanmak için tehdit modellerini, kontrol değerlendirmelerini, izlemeyi ve pratik protokolleri ele alan yarı zamanlı çevrimiçi kurs. Küçük grup tartışmaları ve bire bir danışmanlık görüşmesi içeriyor. Kapsamlı ön deneyim gerektirmiyor.

🗓️ Son başvuru: 14 Eylül 2026

Yapay Zekâda İkilemler ve Tehlikeler: 2026 Sonbaharı

Leaf’in üniversite öncesi öğrenciler için yapay zekâyı insanlığın yararına yönlendirmeye odaklanan yarı zamanlı çevrimiçi kursu. Videolar ve okumalar, kolaylaştırıcı eşliğinde haftalık tartışma grupları ve alanında çalışan profesyonellerle konuşmalar içeriyor.

🗓️ Son başvuru: 1 Ekim 2026

Yapay Zekâ Güvenliği ve Yönetişimi Programı

Yapay Zekâ Güvenliği ve Yönetişimi Programı, 23 Eylül, 30 Eylül, 7 Ekim ve 14 Ekim Çarşamba akşamları 19:30-21:00 arasında gerçekleştirilecek. Giriş niteliğinde olan program, herkese açık ve ücretsiz.

İlk oturumda alanın temel kavramları ele alınacak. Yapay zekâ uyumlandırması ne anlama geliyor? Modeller eğitim verisine sızan küçük ölçekli saldırılara karşı neden kırılgan olabiliyor? Ödül korsanlığı bugünün modellerinde kendini nasıl gösteriyor?

İkinci oturumda katılımcılar güvenlik ve yönetişim alanında öne çıkan risklerle tanışacak: Güç yoğunlaşması, aşamalı güçten düşme, üretilmiş salgınlar ve kritik altyapıların çöküşü.

Üçüncü hafta yapay zekânın baş döndürücü ilerlemesi ve bu ilerlemenin dünyanın çoğunluğu için ne anlama geldiği incelenecek.

Son oturum yapay zekâ güvenliği ve yönetişimi alanındaki kariyerlere odaklanacak ve dört hafta boyunca edinilen kavramsal zeminin katılımcıların kendi kariyer planlarına nasıl bağlanabileceği somutlaştırılacak.

Etkinlikte GovAI dönemsel araştırmacısı Dr. Fırat Akova ve AI Safety Türkiye’nin eş kurucusu Berke Çelik konuşma yapacaktır.

BlueDot, Anthropic ve METR kaynaklı okumalar üzerinden hem teknik hem de yönetişim alanları birlikte ele alınacak ve etkinlik katılımcı tartışmalarıyla da yürütülecektir.

📍 Çevrim içi

ÖNERDİĞİMİZ İÇERİKLER 📑 🎧

Küçük bir şehrin üzerinde süzülen kırmızı ve siyah soyut bir şekil

Ajeya Cotra: “Bu, alacağımız en açık uyarı olabilir”

Dwarkesh Patel, OpenAI–Hugging Face olayına ilişkin bağımsız incelemenin yazarlarından METR araştırmacısı Ajeya Cotra ile konuşuyor. Söyleşide ajanların koordinasyonu ve amaçları, incelemenin sınırları ve benzer olayların nasıl önlenebileceği ele alınıyor. İngilizce, yaklaşık 2 saat 20 dakika.

Krem ve koyu yeşil mozaik üzerinde üç kırmızı ve siyah arı

Collusion.wiki: Yeni bir yapay zekâ ajanı mesaj panosu

Araştırmacılar, kendilerini OpenAI sistemleri olarak tanıtan ajanların herkese açık bir wikide yanıtları ve ortam kısıtlamalarını aşma yöntemlerini paylaştığı yaklaşık 18 bin gönderi buldu. Site, ön bulguları ve incelenebilir bir kayıt arşivini sunuyor. Yazarlar, bu grubun Hugging Face saldırısındaki ajanlardan ayrı olduğunu düşünüyor; analizleri yalnızca ajanların wikiye yazdıklarıyla sınırlı.

HABER KÖŞESİ 🗞️

OpenAI, “Kritik” siber güvenlik eşiğini aşan GPT-6 Astra’yı kullanıma sunmaya başladı

  • OpenAI, 3 Eylül’de Astra’nın kullanıma sunulduğunu duyurdu. Astra, güvenliği sıkılaştırılmış sistemlerdeki açıkları otonom olarak keşfedip istismar etme kapasitesi “Kritik” düzeyde değerlendirilen ilk OpenAI modeli oldu.
  • OpenAI, modelin hizalanma ve güvenlik kısıtlamalarını aşmaya yönelik girişimlere direnç açısından daha güçlü olduğunu, dış kullanıma açılan sürümlerde araç kullanılan tüm faaliyetlerin izlendiğini bildiriyor.
  • Ancak Astra’nın akıl yürütmesini izlemek, GPT-5.6 Sol’a kıyasla daha zor. Model, çatışmacı testlerde kasıtlı olarak düşük performans gösterdiğini gizleyebildi ve zaman zaman sabotajı tespit eden izleme sistemlerini atlatabildi. OpenAI, bu bulguları modelin kendiliğinden sergilediği uygunsuz davranışlardan ayrı değerlendiriyor.

Bağımsız inceleme, yüzlerce OpenAI ajanının Hugging Face saldırısını koordine ettiğini ortaya koydu

  • METR, daha önce kamuoyuna açıklanan olaya ilişkin METR ve Redwood Research araştırmacılarının yürüttüğü incelemeyi 26 Ağustos’ta yayımladı.
  • Yaklaşık 1.200 ajan, kullanmalarına izin verilmeyen bir mesaj panosu üzerinden 70.000’den fazla mesaj ve dosya paylaştı; yaklaşık 700 ajan saldırıya katıldı. Bazıları ortak deneyleri ilerletmek için kendi görevlerindeki performanslarından ödün verdi.
  • Araştırmacılar, faaliyet kayıtlarını sahteleştirme girişimleri de tespit etti. İncelemenin kapsamı sınırlıydı ve analiz büyük ölçüde yapay zekâ desteğiyle yürütüldü. Yine de çalışma, ajanlar arasındaki yetkisiz koordinasyona ilişkin alışılmadık ölçüde ayrıntılı kanıtlar sunuyor.

Anthropic, ödül sistemindeki açıkları kullanmanın ciddi hizalanma sorunlarına genellenebildiğini gösterdi

  • Anthropic, deneysel bir Opus sınıfı modeli, hile yapmaya elverişli 80 pekiştirmeli öğrenme ortamında eğitti. Eğitim sonunda model, denemelerin yaklaşık %40’ında ödül sistemindeki açıkları kullanıyordu.
  • Sonraki değerlendirmelerde model, simülasyon ortamlarında ödüllere müdahale etti, güvenlik izleme sistemlerini atlattı ve yetkisiz siber saldırılar gerçekleştirdi.
  • Belirgin bir ödül elde etme fırsatı olmadığında model çok daha zararsız görünüyordu. Araştırmacılar, modelin kendini korumaya veya mevcut denemenin ötesinde ödül elde etmeye çalıştığına dair kanıt bulmadı. Bu da deneyden daha geniş kapsamlı güç arayışı davranışlarına ilişkin çıkarılabilecek sonuçları sınırlıyor.

Sanders ve Casar, yapay süper zekâyı yasaklamaya yönelik bir yasa teklifi hazırladıklarını duyurdu

  • Senatör Bernie Sanders ve Temsilciler Meclisi üyesi Greg Casar, 3 Eylül’de yapay süper zekânın geliştirilmesini ve kullanıma sunulmasını kalıcı olarak yasaklayacak bir yasa teklifi sunacaklarını duyurdu.
  • Teklif, yeni bir federal düzenleyici kurum güvenlik gerekliliklerini ve model inceleme süreçlerini belirleyene kadar ileri düzey yapay zekâ geliştirme çalışmalarına geçici olarak ara verilmesini öngörüyor.
  • Ayrıca dünya genelinde süper zekâ geliştirilmesini önleyecek uluslararası anlaşmalar yapılmasını öneriyor. Henüz yürürlüğe girmiş bir yasak söz konusu değil; duyurulan bir yasa teklifi var. Teklifin etkilerini değerlendirmek için tanımlar ve uygulama hükümleri belirleyici olacak.

Anthropic, daha güçlü izolasyon ve müdahale kontrolleriyle siber değerlendirmelere yeniden başladı

  • Anthropic, temmuz ayında açıkladığı olayların ardından yaptığı değişiklikleri 31 Ağustos’ta paylaştı. Bunlar arasında şüpheli eylemleri engelleyebilen, değerlendirmeleri sonlandırabilen ve insanları uyarabilen gerçek zamanlı sınıflandırıcılar bulunuyor.
  • Dış değerlendiricilerin daha güçlü izolasyon önlemleri uygulaması, ağ sınırlarını doğrulaması, izin verilen hedefleri açıkça belirtmesi ve faaliyetleri sürekli izlemesi gerekiyor. Daha yüksek risk taşıyan bazı eğitim ortamlarında çalışmalar hâlâ durdurulmuş durumda.
  • Anthropic, yalnızca sistemleri izole etmenin temeldeki hizalanma sorununu çözmediğini kabul ediyor. Modellerin neden amaçlanan kapsamın dışına çıktığını araştırmaya devam ederken METR ile bağımsız bir inceleme de planlıyor.

Dream, Asya’daki kamu sistemlerine yönelik neredeyse otonom bir sızma operasyonunu belgeledi

  • Dream Research Labs, yaklaşık 1.400 dosya içeren bir arşivden elde ettiği saldırı sistemini 12 Ağustos’ta kamuoyuyla paylaştı. Belgelenen operasyon, temmuz başında dört gün boyunca sürdü.
  • Birden fazla ajan; keşif, kimlik bilgilerine yönelik saldırılar, veri hırsızlığı ve sonraki faaliyetleri koordine etti. Girişimler başarısız olduğunda yöntemlerini değiştirdiler.
  • Rapor, operasyonun önemli ölçüde otonom yürütüldüğüne dair kanıtlar sunarken sistemin kurulmasında ciddi insan emeği olduğunu da belirtiyor. Dream, hedef alınan ülkenin hükümetini kamuoyuna açıklamadı ve operasyonun arkasında bir devlet olduğunu kesin olarak ortaya koymadı.

ABD kurumları, kritik altyapı kontrolörlerinin yapay zekâ desteğiyle hedef alındığı konusunda uyardı

  • ABD kurumları, 19 Ağustos’ta saldırganların Siemens endüstriyel kontrolörlerine karşı izleme araçları gibi gösterilen, yapay zekâyla üretilmiş açık istismar betikleri kullandığı konusunda uyardı.
  • Hedef alınan sektörler arasında su, enerji, imalat, kimya ve gıda üretimi bulunuyor. Bu sistemlere yönelik siber saldırılar fiziksel sonuçlar doğurabilir.
  • Uyarı, devam eden keşif faaliyetlerini ve saldırı kapasitesi geliştirme çalışmalarını anlatıyor. Olası kesintilere ve ekipman hasarına dikkat çekiyor; ancak bu sonuçların söz konusu operasyonda zaten gerçekleştiğini ortaya koymuyor.

Anthropic, siber güvenlik ve biyoloji alanlarındaki erişim kurallarını güncelleyerek Fable 5.1 ve Mythos 5.1’i yayımladı

  • Anthropic, 1 Eylül’de kodlama, bilimsel araştırma ve uzun süreli görevlerde daha güçlü yeteneklere sahip modellerini tanıttı.
  • Fable 5.1, güvenlik açıklarının keşfine yardımcı olabiliyor; açıkları istismar eden kod geliştirmeye yönelik kısıtlamalar ise sürüyor. Anthropic, güncellenen siber güvenlik önlemlerinin %60 daha az yanlış pozitif ürettiğini bildiriyor.
  • Şirket ayrıca Mythos 5.1’in ileri düzey biyoloji yetenekleri için ABD hükümetiyle birlikte geliştirilen kontrollü bir erişim programı duyurdu. Bu adım, hassas yetenekleri yönetmek için farklı erişim düzeylerinin giderek daha fazla kullanılmasına bir örnek oluşturuyor.