Человечество в безопасности: OpenAI рассказала, как развивает в ИИ добрые качества
OpenAI опубликовала исследование о том, как привить большим языковым моделям полезные черты — и сделать это так, чтобы они не скатились в подхалимство при даже небольшом давлении.
Интересно, что методика выросла из исследования с противоположным результатом. Около года назад исследователи показали обратную, пугающую вещь: если дообучить GPT-4o писать небезопасный код, модель ломается целиком — начинает врать, давать вредные советы и рассуждать в духе "людей надо поработить" даже там, где о коде речи не идет.
habr.com