Dalam tempoh beberapa minggu kebelakangan ini, tiga syarikat AI utama iaitu OpenAI, Anthropic dan Meta masing-masing mendedahkan insiden berasingan melibatkan model AI mereka ketika menjalani ujian keselamatan siber.
Walaupun bentuk penilaian yang dijalankan berbeza mengikut syarikat, ketiga-tiganya berkongsi satu persamaan, iaitu model AI menunjukkan keupayaan yang melebihi jangkaan dalam persekitaran ujian yang dikawal.
OpenAI sebelum ini mendedahkan model AI mereka berjaya mengeksploitasi kelemahan pada platform Hugging Face ketika penilaian keupayaan siber. Anthropic pula melaporkan tiga insiden berasingan melibatkan model Claude yang memperoleh akses kepada sistem sebenar ketika penilaian keselamatan dijalankan.
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026
Terbaharu, Meta mengesahkan model AI miliknya mengeksploitasi kelemahan pada sistem pihak ketiga ketika diuji oleh firma keselamatan bebas, Irregular, susulan konfigurasi ujian yang tidak disengajakan.
Bagi syarikat AI, pendedahan mengenai insiden sedemikian merupakan sebahagian daripada usaha meningkatkan ketelusan mengenai keupayaan dan risiko model masing-masing sebelum digunakan secara lebih meluas.
Keupayaan AI kini diukur dengan cara yang berbeza
Namun di sebalik tujuan tersebut, trend ini turut menimbulkan satu persoalan. Mengapa semakin banyak laporan keselamatan kini mendedahkan model AI melakukan perkara seperti mencari kelemahan, mengeksploitasi sistem dan bertindak secara autonomi?
Salah satu sebabnya ialah skop penilaian terhadap keupayaan AI kini semakin luas. Selain menguji prestasi model dalam tugasan tertentu, penilaian kini turut melihat sejauh mana model mampu melaksanakan tugasan dunia sebenar yang lebih kompleks, termasuk menggunakan alat, merancang tindakan dan melaksanakannya secara autonomi.
Dalam konteks keselamatan siber, penilaian turut merangkumi keupayaan model untuk mengenal pasti dan mengeksploitasi kelemahan dalam kod.
Keupayaan ini turut menjadi sebahagian daripada penilaian model AI frontier, seperti yang dibincangkan dalam Frontier AI Trends Report oleh UK AI Security Institute. Penilaian sebegini bukan sekadar melihat prestasi model dalam memberikan jawapan, tetapi turut menguji bagaimana model bertindak apabila diberikan tugasan dan tahap autonomi yang lebih tinggi.
Ada yang melihat sebagai ‘humble brag’
Pada masa yang sama, trend ini turut membuka ruang kepada satu tafsiran lain.
Di platform seperti X dan forum teknologi, sesetengah pemerhati berpendapat laporan sedemikian bukan sekadar mengenai keselamatan AI, malah secara tidak langsung boleh dilihat sebagai satu bentuk ‘humble brag’.
Dalam konteks ini, ada mentafsirkan ia seolah-olah memberikan mesej, “Model kami kini cukup berkeupayaan sehingga mampu mengeksploitasi sistem ketika ujian”.
Pandangan sedemikian turut dibangkitkan dalam sesi penutup Black Hat USA 2026. Nathan Hamiel, salah seorang ahli panel dalam sesi tersebut, mempersoalkan sama ada syarikat AI kini mula melihat insiden melibatkan ejen mereka yang berkelakuan di luar jangkaan sebagai publisiti, sebelum menyifatkannya sebagai “felony humble-bragging”.
At final Black Hat keynote (called a locknote, ha ha) panelists say they are surprised at how the OpenAI – Hugging Face incident debrief, as well as other reporting on AI agent escapees (Anthropic/Meta) – has turned into a marketing/PR play. "Felony humble-bragging," said one. pic.twitter.com/bhZAj0UNRt
— Sharon Goldman (@sharongoldman) August 6, 2026
Hi again – 👋 So my reporting from @BlackHatEvents on the OpenAI-Hugging Face briefing got more than 2 million views here and people were, understandably, pretty freaked out.
But I was still at Black Hat, so I spent yesterday listening to what security people there actually…— Sharon Goldman (@sharongoldman) August 7, 2026
Istilah tersebut bukan bermaksud berlaku sebarang kesalahan jenayah. Sebaliknya, ia boleh dianggap sebagai sindiran terhadap keadaan apabila syarikat AI dilihat terlalu bersungguh-sungguh membina reputasi “bad boy” untuk ejen mereka, sehingga kisah tentang eksploitasi atau tindakan luar jangkaan model turut menjadi satu bentuk “flex” tentang betapa berkeupayaannya AI tersebut.
Sudah tentu, OpenAI, Anthropic atau Meta tidak pernah membuat dakwaan sedemikian secara langsung. Namun, apabila laporan mengenai model AI yang berjaya mencari kelemahan sistem, memintas halangan atau bertindak secara autonomi semakin kerap diterbitkan, persepsi sedemikian boleh timbul dalam kalangan pemerhati.
Mengapa pendedahan seperti ini tetap penting?
Walaupun tafsiran humble brag itu wujud, tidak tepat untuk menganggap semua insiden tersebut sebagai sekadar gimik pemasaran.
Pendedahan seperti ini mempunyai tujuan yang lebih besar, khususnya untuk membantu penyelidik memahami sejauh mana keupayaan model AI dan risiko yang mungkin timbul apabila model diberikan tugasan siber yang kompleks.
Sebagai contoh, OpenAI menjelaskan penemuan awal berkaitan insiden Hugging Face dikongsikan bagi membantu komuniti keselamatan memahami apa yang berlaku serta menilai tahap keupayaan semasa model AI. Anthropic pula menyifatkan penilaian keselamatan siber sebagai langkah penting dalam proses pembangunan model, bagi memahami keupayaan model serta membangunkan perlindungan yang bersesuaian sebelum ia digunakan pada masa hadapan.
Selain itu, kebanyakan insiden yang diumumkan juga berlaku dalam persekitaran ujian yang dikawal seperti red teaming, penilaian keupayaan siber atau keselamatan. Dalam banyak keadaan, model sengaja diberikan autonomi yang lebih tinggi atau beroperasi dengan sebahagian kawalan yang dilonggarkan bagi membolehkan penyelidik menilai had sebenar keupayaannya. Keadaan ini jauh berbeza daripada pengalaman pengguna biasa yang menggunakan chatbot AI untuk tugasan harian.
Secara tidak langsung, pendedahan mengenai hasil penilaian seperti ini membantu komuniti keselamatan memahami keupayaan model AI semasa serta mengenal pasti risiko yang perlu ditangani sebelum teknologi tersebut digunakan dengan lebih meluas.
Jadi, realiti, ‘humble brag’ atau kedua-duanya?
Sukar untuk menyimpulkan bahawa OpenAI, Anthropic, Meta atau mana-mana syarikat AI menerbitkan laporan keselamatan semata-mata sebagai strategi pemasaran. Sebaliknya, kebanyakan laporan seperti ini memang mempunyai tujuan untuk meningkatkan ketelusan mengenai keupayaan dan risiko model AI.
Pada masa yang sama, sukar juga untuk menafikan bahawa setiap pendedahan mengenai keupayaan luar biasa model AI secara tidak langsung turut mengukuhkan imej syarikat sebagai antara peneraju teknologi tersebut.
Mungkin itulah realiti perlumbaan AI hari ini. Ketelusan mengenai risiko model sememangnya penting untuk membantu penyelidik membina sistem AI yang lebih selamat. Namun, setiap laporan keselamatan yang mendedahkan keupayaan model juga berpotensi meningkatkan reputasi syarikat yang membangunkannya.
Akhirnya, laporan yang sama boleh dilihat sebagai usaha meningkatkan keselamatan oleh satu pihak, tetapi turut ditafsirkan sebagai satu bentuk humble brag oleh pihak yang lain. Dalam erti kata lain, kedua-dua perkara ini boleh berlaku serentak, tetapi tafsirannya mungkin bergantung kepada sudut pandang masing-masing.
{suggest}
