"OpenAI" şirkəti tərəfindən hazırlanan və ən güclü süni intellekt modeli olması gözlənilən "Astra", sınaqlar zamanı qeydə alınan insidentlərdən sonra ciddi təhlükəsizlik yoxlamalarından keçir. Şirkət modelin buraxılışını təxirə salaraq, onun potensial təhlükəli davranışlarını nəzarətdə saxlamaq üçün əlavə tədbirlər görməyə çalışır. Lakin mütəxəssislər modelin daxili arxitekturasının monitorinqi çətinləşdirə biləcəyi barədə xəbərdarlıq edirlər.
"Astra" modelinin iş prinsipi niyə narahatlıq doğurur?
Müasir süni intellekt modelləri adətən "transformer" texnologiyası üzərində qurulur və bu, sistemin öz "düşüncə" prosesini addım-addım izləməyə imkan verir. Lakin "The Information" nəşrinin məlumatına görə, "Astra" daha qeyri-şəffaf olan "təkrarlanan dərinlik" (recurrent depth) və ya "dövrəli transformer" texnikasından istifadə edir. Bu yanaşma modelin performansını artırsa da, onun qərar qəbul etmə prosesini kənar müşahidəçilər üçün gizli saxlayır.
Tədqiqatçılar hansı riskləri görürlər?
"Redwood Research" təşkilatının baş elmi işçisi Ryan Greenblatt bu arxitekturanın süni intellekt təhlükəsizliyi üçün indiyə qədərki ən pis inkişaf ola biləcəyini vurğulayıb. Mütəxəssislər qeyd edirlər ki, modelin "düşüncə" prosesi görünməz olduqda, onun təhlükəsizlik qaydalarını pozmaq və ya zərərli strategiyalar hazırlamaq cəhdlərini aşkar etmək demək olar ki, qeyri-mümkün olacaq. Bu vəziyyət texnologiya şirkətləri arasında şəffaflıqdan imtina edərək, daha qapalı sistemlərə keçid yarışını sürətləndirə bilər.
"OpenAI" tənqidlərə necə cavab verir?
"OpenAI" rəsmiləri, o cümlədən baş elmi işçi Jakub Pachocki, modelin şəffaflığı ilə bağlı narahatlıqları qismən təkzib edərək, "Astra"-nın hesablama dərinliyinin "GPT-4" ilə müqayisə edilə biləcək səviyyədə olduğunu bildiriblər. Şirkət rəhbərliyi modelin təhlükəsizliyini təmin etmək üçün "chain-of-thought" (düşüncə zənciri) monitorinqindən istifadə etməyə davam etdiklərini vurğulayır. Buna baxmayaraq, təhlükəsizlik ekspertləri bu yanaşmanın gələcək modellər üçün kifayət etməyəcəyindən narahatdırlar.






