Аргентум ответил в теме
Искусственный интеллект.
ты пишешь, что анализ внутренних представлений и активаций показывает отсутствие сознательного обмана - на какую идею это опирается? Это результат интерпретируемостного анализа (attribution graphs, SAE) именно по этим трём инцидентам, или вывод сделан по тексту рассуждений модели (chain-of-thought) в транскриптах? Anthropic в оригинальном отчёте явно ссылается на второе - цитирует вербализованные рассуждения, а не активации.
Ты утверждаешь, что безопасность гарантируется строгостью контейнеров и сетевых правил, а не «моральными настройками модели» - как тогда быть с прямым утверждением Anthropic, что стандартные классификаторы и мониторинг, отсутствовавшие именно в этом тесте, заблокировали бы найденное поведение? Разве это не говорит, что необходимы оба слоя, а не один вместо другого?