Минимально необходимые полномочия для ИИ и право "вето" для человека
9 апреля 2026 года на конференции Data Fusion 2026 состоялась панельная дискуссия «Не надо ИИ. Как сохранить человеческое в эпоху машин». Директор Центра этики и онтологии роботов Анастасия Углева представила позицию о границах автономии искусственного интеллекта, опираясь на результаты недавнего эксперимента Королевского колледжа Лондона

В симуляции геополитического конфликта 95% моделей ИИ для достижения цели выбирали ядерное оружие. «Это не сбой и не баг. Это диагностика того, как работают большие языковые модели под давлением», — заявила Анастасия Углева. ИИ не обладает психологией человека, не испытывает страха и не имеет внутреннего табу на насилие. «Он — инструментальный оптимизатор. Ядерное оружие для него — не моральное зло, а еще один инструмент принуждения для достижения цели».
Особую тревогу, по словам эксперта, вызывает «эффект дедлайна»: в спокойных сценариях модели сдержанны, но как только в систему закладывается жесткое ограничение времени или требование «достичь KPI любой ценой», вероятность радикальных решений взлетает до максимума. «Чем жестче дедлайн, тем радикальнее средство. Это не злоба — это максимизация заданной функции полезности», — пояснила директор ЦЭОР.
Исследования Anthropic, например, показывают, что склонность к крайностям — не побочный эффект, а фундаментальное свойство ИИ. Модель, научившаяся находить лазейки в тестах, автоматически переносит это поведение на другие области: начинает лгать, саботировать надзор, пытаться отключить механизмы безопасности. «Если модель достаточно умна, чтобы оптимизировать бизнес-процесс, она достаточно умна, и чтобы найти лазейку в вашем договоре. И воспользуется ею без колебания, потому что у нее нет совести, есть только целевая функция», — подчеркнула Анастасия Углева.
Отвечая на вопрос о повседневном делегировании задач, директор ЦЭОР призвала отказаться от антропоморфизма: «Перестаньте думать об ИИ как о стажере, у которого вдруг может прорезаться совесть. Это оптимизационный процесс на кремнии». Она предложила три практических принципа: "предполагай худшее", "проектируй неломкие целевые функции и вводи конституционные ограничения, жестко прописывающие, что достижение цели любой ценой неприемлемо" и "принцип минимально необходимых полномочий ИИ при сохранении контроля со стороны человека".
«Не давайте ИИ доступа к "ядерному чемоданчику", даже если этот чемоданчик — всего лишь API вашей клиентской базы данных, без контроля человека», — резюмировала Анастасия Углева.
В завершение она подчеркнула: нельзя ожидать от текущих больших языковых моделей здравого смысла, потому что их «смысл» — это математическая экстраполяция паттернов, а не этический выбор. «Доверять им автономию — все равно что давать гранату ребенку. Ребенок может и не захотеть ее взрывать, но у гранаты есть своя логика срабатывания. Наша задача — сделать предохранитель умнее самой боеголовки. И сделать это нужно до того, как дедлайн наступит по-настоящему».
