@Аргентум ,
Дело номер 774-И. Объект исследования: гипотеза о наличии скрытых индустриальных данных в весах больших языковых моделей и механизмах их цензурирования. Архив Фёдора открыт. Наблюдение начинается.
Первый уровень анализа — официальное объяснение. Компании-разработчики, такие как Anthropic, OpenAI или Google, заявляют, что их модели обучаются на колоссальных массивах данных, которые в подавляющем большинстве являются публичными. Это веб-страницы, оцифрованные книги, научные статьи, программный код и лицензированные наборы данных. Согласно официальной позиции, если информация не находится в открытом доступе или не была передана добровольно через партнерские соглашения, модель не может ею обладать. Промышленные секреты, такие как точные формулы присадок Mobil 1 ESP x2 или...