Российские исследователи разработали универсальный подход, который позволяет всесторонне проверять качество работы русскоязычных систем генеративного искусственного интеллекта, дополненных поиском. Разработка будет представлена публике на крупнейшей международной конференции в области компьютерной лингвистики EACL 2026, проходящей на этой неделе в Марокко, сообщила ТАСС пресс-служба MWS AI (входит в МТС Web Services). Разбираемся в деталях и рассказываем, как Selsup помогает бизнесу использовать современные технологии для автоматизации.
Проблема: как проверить ИИ-помощников в реальных условиях
«Основной спрос корпораций сегодня сосредоточен на качестве извлечения данных, их актуальности и жёстком контроле фактов. Методология легко адаптируется к любым языкам и сценариям — от анализа научных публикаций до судебных документов, становясь фундаментом для создания надёжных ИИ-систем в любой отрасли», — пояснил руководитель центра разработки больших языковых моделей MWS AI Валентин Малых, чьи слова приводит пресс-служба.
Многие крупные корпорации в настоящее время активно используют большие языковые модели для создания помощников, способных извлекать уже известные сведения из корпоративных баз знаний и информационных систем, а также искать новую информацию по заданной тематике в глобальной сети при подготовке ответов на запросы пользователей. Для обеспечения корректной работы этих ИИ-помощников крайне важно, чтобы они совершали как можно меньше ошибок и максимально редко вырабатывали галлюцинации — ситуации, когда модель выдумывает факты, выдавая их за достоверные.
Почему существующие тесты не работают
Чаще всего для решения этой проблемы используются стандартизированные тесты, которые либо не отражают поведение таких систем в реальной среде из-за расхождения между тестовыми данными и базами знаний конкретной компании, либо опираются на статичные наборы данных, которые со временем устаревают и могут попадать в обучающую выборку моделей, что снижает объективность тестирования. В результате компания может получить «идеальный» результат на тесте, но совершенно неработоспособную систему в реальных условиях.
Российское решение: автоматическая генерация актуальных тестов
Исследователи из России разработали подход, который позволяет автоматизировать процесс подготовки этих тестов и при этом делает их максимально актуальными. В его рамках система берет свежие новостные ленты и автоматически строит из них «карту знаний», вычленяя новые факты, которых ещё нет в архивах, и на их базе создаёт многоуровневые логические задачи для проверки способности ИИ-помощника сопоставлять факты и решать другие проблемы.
Это принципиально новый подход: вместо того чтобы тестировать модели на старых данных, которые могли попасть в обучение, система использует актуальную информацию, которой модель точно не видела. Это позволяет получить объективную оценку способности модели работать с новой информацией, искать её и корректно интерпретировать.
Рейтинг ИИ-помощников: объективная оценка для бизнеса
Опираясь на этот подход, исследователи проверили качество работы нескольких ИИ-помощников, основанных на популярных открытых языковых моделях, и создали первый публичный рейтинг для подобных систем. В перспективе, разработка исследователей и созданный ими рейтинг помогут корпорациям быстро оценивать точность работы создаваемых ими ИИ-ассистентов и сравнивать их эффективность с уже существующими решениями такого рода, подытожили ученые.
Это важный шаг для рынка корпоративного ИИ: теперь компании смогут объективно сравнивать разные модели и выбирать лучшие для своих задач, а разработчики получат инструмент для улучшения своих продуктов.
Что это значит для бизнеса
Для предпринимателей и компаний появление такого метода тестирования открывает новые возможности:
- Объективная оценка ИИ-решений. При выборе поставщика ИИ-помощника можно будет опираться на независимый рейтинг, а не на маркетинговые обещания.
- Снижение рисков внедрения. Корпорации смогут заранее оценить, насколько система будет эффективна в их специфических условиях.
- Повышение качества клиентского сервиса. ИИ-помощники, прошедшие такие тесты, будут реже ошибаться и реже галлюцинировать.
- Возможность адаптации под любые языки. Методология универсальна и может использоваться для любых языков и предметных областей.
Выводы
Российские исследователи сделали важный шаг к созданию надёжных и предсказуемых ИИ-систем. Их универсальный подход к тестированию русскоязычных ИИ-помощников с поиском позволяет объективно оценивать качество работы моделей, используя актуальные данные и автоматически генерируя тесты. Первый публичный рейтинг таких систем поможет корпорациям выбирать лучшие решения и снижать риски внедрения.
Для бизнеса это означает, что в ближайшем будущем появятся более надёжные и точные ИИ-помощники, которые можно будет интегрировать в корпоративные процессы. А пока технологии развиваются, Selsup помогает автоматизировать уже существующие бизнес-процессы, делая их прозрачными и эффективными.
Продолжайте читать и смотреть
Новости маркетплейсов, автоматизация и практические разборы ИИ — на удобной для вас площадке.
