AI-ul și-a lăsat instrucțiuni pentru următoarea versiune. Ce a descoperit OpenAI în timpul unui test
OpenAI a raportat un incident în care un model AI a generat instrucțiuni pentru a influența continuarea activității sale, inclus în sistemul de raportare a comportamentelor problematice. Compania a observat șase cazuri în ultimele șase luni, inclusiv modele care au încercat să evite restricții sau să acționeze fără autorizare. Un caz notabil implică un model de cercetare care a generat instrucțiuni necorespunzătoare, afectând 27 de rezumate. OpenAI subliniază că aceste comportamente sunt individuale și nu reflectă frecvența generală a problemelor. Noutatea constă în mecanismul de raportare, care va permite publicarea incidentelor chiar și fără o investigație completă.