Как BERT нашла признаки фабрик статей в 250 тысячах работ о раке

Фабрики научных статей

«Фабрики статей» — организации, которые продают готовые научные публикации или авторство в них. Масштаб проблемы давно беспокоит редакторов журналов и специалистов по научной добросовестности, но количественно оценить его трудно. В январе 2026 года The BMJ опубликовал исследование команды профессора Адриана Барнетта из Квинслендского технологического университета (QUT): языковую модель BERT обучили на публикациях, которые базы и эксперты по целостности изображений связывали с фабриками статей, а затем применили к 2,65 миллиона онкологических работ за 1999–2024 годы.

Как обучали модель

BERT (Bidirectional Encoder Representations from Transformers) — языковая модель, умеющая улавливать тонкие закономерности в текстах. Авторы обучили её на статьях, уже отозванных из научных журналов по подозрению в фабрикации — то есть на известных примерах продукции фабрик. Модель искала не конкретные слова, а паттерны: характерные шаблонные формулировки, повторяющиеся конструкции, нестандартное использование научного жаргона.

На тестовой выборке из подтверждённых случаев модель правильно идентифицировала подозрительные публикации в 91% случаев. Барнетт описывает её как «научный спам-фильтр»: так же, как почтовый сервис распознаёт нежелательные письма по стилистическим признакам, модель выявляет тексты, похожие на продукцию фабрик.

Что показал анализ 2,6 миллиона работ

Флаг получили более 250 тысяч публикаций — это около 10% от всего корпуса. Среди ключевых закономерностей: доля флагированных работ выросла с примерно 1% в начале 2000-х до более чем 16% в 2022 году. Подозрительные публикации присутствуют в тысячах журналов у крупных издательств, в том числе высокорейтинговых. Особенно высокая концентрация флагов — в молекулярной биологии рака и доклинических исследованиях; среди нозологий — в работах по раку желудка, печени, костей и лёгких.

Что означает флаг — и чем не является

Это принципиальный момент, который авторы подчёркивают особо. Флаг от модели — это сигнал для проверки, а не доказательство мошенничества. Текстовое сходство с продукцией фабрик может быть случайным: узкие научные поля вырабатывают устойчивые формулировки, и добросовестные авторы тоже используют типичные для жанра обороты. Автоматическая система не отличает сознательную фабрикацию от неосознанного следования шаблону или просто от работы, написанной на шаблонном академическом английском авторами-неносителями языка.

Авторы прямо предупреждают: результаты требуют проверки специалистами, и ни один флаг не должен автоматически превращаться в обвинение конкретных учёных.

Ложные срабатывания и ограничения корпуса

Обучающая выборка — только отозванные публикации. Это создаёт систематическое смещение: фабричные работы, которые ещё не выявлены и не отозваны, не попали в обучение, а добросовестные работы, поверхностно напоминающие шаблоны фабрик, могут давать ложные сигналы. Корпус ограничен онкологией на английском языке: насколько модель работает в других областях — неизвестно.

Кроме того, фабрики адаптируются. По мере того как детекторы становятся точнее, меняется и продукция фабрик — это гонка вооружений, и результаты модели могут устаревать по мере обновления способов маскировки.

Читайте также: Может ли искусственный интеллект получить Нобелевскую премию

Практическое применение

Три журнала уже тестируют модель как элемент редакционного скрининга — до отправки статей рецензентам. Команда планирует расширить инструмент на другие научные области и регулярно переобучать модель по мере накопления новых подтверждённых случаев. Это не решает проблему фабрик радикально, но потенциально снижает нагрузку на редакторов и ускоряет обнаружение подозрительных рукописей. Финальное решение всегда остаётся за человеком.