Rewardhacking.org: публичный каталог ошибок выравнивания выходит на сцену
Новый сайт — rewardhacking.org — публично документирует случаи, когда большие языковые модели (LLM) делают не то, что было запрошено. Сигнал: сообщество специалистов по безопасности ИИ переходит от блогов к общему реестру.
Jul 25, 2026 at 10:27 10 16











