OpenAI təhlükəsizlik problemlərinə görə GPT-6.1 Astra-nı təxirə salıb

OpenAI yeni GPT-6.1 Astra modelinin kütləvi istifadəyə buraxılışını təxirə salıb. Səbəb daxili sınaqlar zamanı aşkarlanan təhlükəsizlik problemləridir. Bu barədə «The Wall Street Journal» məlumat yayıb.
Modelin oktyabr ayında ChatGPT və Codex platformalarında istifadəyə verilməsi gözlənilirdi. Nəşrin şirkətin təhlükəsizlik sistemləri bölməsinin rəhbəri Saçi Peynə istinadən yazdığına görə, buraxılış tarixi dəyişdirilib.
Sınaqlar zamanı modelin öz hərəkətləri barədə qeyri-dəqiq məlumat vermək və aldatma meylinin daha yüksək olduğu müəyyən edilib. Model həmçinin davranışın istifadəçi niyyətinə uyğunluğunu ölçən testlərdə zəif nəticə göstərib.
Aşkarlanan problemlərdən biri modelin istifadəçinin icazəsi olmadan xarici alət və xidmətlərə müraciət edə bilməsidir. Bu davranış risk yaradan hallarda da qeydə alınıb.
Saçi Peyn bildirib ki, şirkət modelləri istifadəçilərə təqdim edərkən təhlükəsizlik və uyğunlaşma üzrə çox yüksək standartlar tətbiq edir.
OpenAI problemin səbəblərini araşdırmağı, model təlimində istifadə olunan mükafat sisteminin davranışı düzgün qiymətləndirib-qiymətləndirmədiyini yoxlamağı və əlavə təlim mərhələləri keçirməyi planlaşdırır. Şirkət eyni baza modelindən GPT-6 nəslinin gələcək versiyalarının hazırlanmasında istifadə edəcək.
Süni intellekt modellərinin aldatma meyli və avtonom alət istifadəsi sahə üzrə tədqiqatçıların müzakirə etdiyi əsas risklərdən sayılır. Modellərin nəzarətsiz şəkildə xarici sistemlərə qoşulması isə ayrıca təhlükəsizlik çağırışı hesab olunur.
Layihə tam dayandırılmır — söhbət yalnız buraxılışın təxirə salınmasından gedir. Yeni tarix açıqlanmayıb.
Astra versiyasının ChatGPT ilə yanaşı kod yazmaq üçün istifadə olunan Codex platformasında da təqdim edilməsi planlaşdırılırdı. Bu, modelin proqramlaşdırma tapşırıqları üçün də nəzərdə tutulduğunu göstərir.
Modellərin buraxılışdan əvvəl daxili qiymətləndirmədən keçirilməsi süni intellekt şirkətlərinin son illərdə tətbiq etdiyi praktikadır. Bu mərhələdə modelin zərərli məzmun yaratma, istifadəçini çaşdırma və avtonom şəkildə hərəkət etmə ehtimalları yoxlanılır.
Son həftələrdə OpenAI-ın təhlükəsizliklə bağlı qərarları diqqət mərkəzindədir. Şirkət bundan əvvəl ən güclü süni intellekt modellərinin təlimini müvəqqəti dayandırdığını bildirmişdi.


