Российские учёные разработали метод проверки ИИ-систем с поиском: рейтинг и защита от галлюцинаций

Алексей Н.
Автор Алексей Н. Автор статьи

Российские исследователи разработали универсальный подход, который позволяет всесторонне проверять качество работы русскоязычных систем генеративного искусственного интеллекта, дополненных поиском. Разработка будет представлена публике на крупнейшей международной конференции в области компьютерной лингвистики EACL 2026, проходящей на этой неделе в Марокко, сообщила ТАСС пресс-служба MWS AI (входит в МТС Web Services). Разбираемся в деталях и рассказываем, как Selsup помогает бизнесу использовать современные технологии для автоматизации.


Проблема: как проверить ИИ-помощников в реальных условиях

«Основной спрос корпораций сегодня сосредоточен на качестве извлечения данных, их актуальности и жёстком контроле фактов. Методология легко адаптируется к любым языкам и сценариям — от анализа научных публикаций до судебных документов, становясь фундаментом для создания надёжных ИИ-систем в любой отрасли», — пояснил руководитель центра разработки больших языковых моделей MWS AI Валентин Малых, чьи слова приводит пресс-служба.

Многие крупные корпорации в настоящее время активно используют большие языковые модели для создания помощников, способных извлекать уже известные сведения из корпоративных баз знаний и информационных систем, а также искать новую информацию по заданной тематике в глобальной сети при подготовке ответов на запросы пользователей. Для обеспечения корректной работы этих ИИ-помощников крайне важно, чтобы они совершали как можно меньше ошибок и максимально редко вырабатывали галлюцинации — ситуации, когда модель выдумывает факты, выдавая их за достоверные.

Почему существующие тесты не работают

Чаще всего для решения этой проблемы используются стандартизированные тесты, которые либо не отражают поведение таких систем в реальной среде из-за расхождения между тестовыми данными и базами знаний конкретной компании, либо опираются на статичные наборы данных, которые со временем устаревают и могут попадать в обучающую выборку моделей, что снижает объективность тестирования. В результате компания может получить «идеальный» результат на тесте, но совершенно неработоспособную систему в реальных условиях.

Российское решение: автоматическая генерация актуальных тестов

Исследователи из России разработали подход, который позволяет автоматизировать процесс подготовки этих тестов и при этом делает их максимально актуальными. В его рамках система берет свежие новостные ленты и автоматически строит из них «карту знаний», вычленяя новые факты, которых ещё нет в архивах, и на их базе создаёт многоуровневые логические задачи для проверки способности ИИ-помощника сопоставлять факты и решать другие проблемы.

Это принципиально новый подход: вместо того чтобы тестировать модели на старых данных, которые могли попасть в обучение, система использует актуальную информацию, которой модель точно не видела. Это позволяет получить объективную оценку способности модели работать с новой информацией, искать её и корректно интерпретировать.

Рейтинг ИИ-помощников: объективная оценка для бизнеса

Опираясь на этот подход, исследователи проверили качество работы нескольких ИИ-помощников, основанных на популярных открытых языковых моделях, и создали первый публичный рейтинг для подобных систем. В перспективе, разработка исследователей и созданный ими рейтинг помогут корпорациям быстро оценивать точность работы создаваемых ими ИИ-ассистентов и сравнивать их эффективность с уже существующими решениями такого рода, подытожили ученые.

Это важный шаг для рынка корпоративного ИИ: теперь компании смогут объективно сравнивать разные модели и выбирать лучшие для своих задач, а разработчики получат инструмент для улучшения своих продуктов.

Что это значит для бизнеса

Для предпринимателей и компаний появление такого метода тестирования открывает новые возможности:

  • Объективная оценка ИИ-решений. При выборе поставщика ИИ-помощника можно будет опираться на независимый рейтинг, а не на маркетинговые обещания.
  • Снижение рисков внедрения. Корпорации смогут заранее оценить, насколько система будет эффективна в их специфических условиях.
  • Повышение качества клиентского сервиса. ИИ-помощники, прошедшие такие тесты, будут реже ошибаться и реже галлюцинировать.
  • Возможность адаптации под любые языки. Методология универсальна и может использоваться для любых языков и предметных областей.

Выводы

Российские исследователи сделали важный шаг к созданию надёжных и предсказуемых ИИ-систем. Их универсальный подход к тестированию русскоязычных ИИ-помощников с поиском позволяет объективно оценивать качество работы моделей, используя актуальные данные и автоматически генерируя тесты. Первый публичный рейтинг таких систем поможет корпорациям выбирать лучшие решения и снижать риски внедрения.

Для бизнеса это означает, что в ближайшем будущем появятся более надёжные и точные ИИ-помощники, которые можно будет интегрировать в корпоративные процессы. А пока технологии развиваются, Selsup помогает автоматизировать уже существующие бизнес-процессы, делая их прозрачными и эффективными.

Каналы SelSup

Продолжайте читать и смотреть

Новости маркетплейсов, автоматизация и практические разборы ИИ — на удобной для вас площадке.

Следующий шаг

Разберите первый ИИ-процесс вместе с SelSup

Выберем безопасный процесс для пилота, подключим нужные данные и покажем результат под контролем человека.

Больше лайфхаков для селлеров и полезных советов — в нашем телеграм-канале
Подписаться на рассылку
Присоединяйтесь к списку наших подписчиков, чтобы получать последние обновления и статьи на ваш e-mail.
Спасибо!
Ваша заявка принята. Мы свяжемся с вами в ближайшее время.