Яндекс представил концепцию проверки ИИ на традиционные ценности

Яндекс представил концепцию проверки ИИ на традиционные ценности

Яндекс представил концепцию проверки ИИ на традиционные ценности

Яндекс представил правительственной рабочей группе концепцию национального набора тестов для проверки ИИ-систем на соответствие духовно-нравственным ценностям и российским условиям. Проект пока существует на уровне идеи, а окончательных решений по его устройству нет.

Предлагаемый датасет должен включать контрольные задания и эталонные данные, позволяющие сравнивать разные модели по единым критериям, сообщает «Коммерсантъ» со ссылкой на источники.

Обычно бенчмарки проверяют программирование, математику или решение рабочих задач. Теперь нейросетям могут добавить отдельный экзамен по духу времени — дисциплину, где списать правильный ответ будет особенно непросто.

Главный спор разгорелся вокруг публичности тестов. По сведениям источников, ФСБ выступает за закрытый формат: если разработчики заранее увидят вопросы, они смогут специально настроить модели на успешную сдачу.

Бизнес возражает, что полностью закрытая проверка замедлит выпуск новых версий и превратит тестирование в лотерею. В качестве компромисса обсуждается двухуровневая схема: открытый бенчмарк для предварительной настройки и закрытый — для финального экзамена по тем же темам, но с другими формулировками.

Не решено и то, кто будет определять содержание заданий. Представители ИТ-отрасли предлагают создать совместную комиссию из чиновников, бизнеса и экспертных организаций.

Дополнительная сложность заключается в самих критериях. В математике или программировании можно задать точный эталонный ответ. Со справедливостью, исторической памятью и другими ценностными категориями такой номер не пройдёт: здесь потребуется рубрикатор или экспертная оценка.

В аппарате вице-премьера Дмитрия Григоренко и Минцифры подтвердили, что предложения ещё обсуждаются. Яндекс публично концепцию не комментировал.

Напомним, ранее мы писали, что российские разработчики смогут передавать большие ИИ-модели в независимые испытательные лаборатории, которые проверят их на соответствие законодательству и традиционным духовно-нравственным ценностям.

Update:

Представители Яндекса добавили официальный комментарий:

«Яндекс не представлял концепцию национального датасета и набор тестов для проверки ИИ-моделей. На рабочей встрече в Минцифры представители нескольких компаний обсуждали возможные подходы к такой проверке. Яндекс был одним из участников обсуждения и высказал свою позицию – содержание датасета должно быть открытым по общепринятым принципам отрасли».

ИИ ускоряет умных и топит доверчивых: эксперимент раскрыл цену ChatGPT

Доступ к ИИ-советнику на базе GPT-4 по-разному повлиял на владельцев малого бизнеса в Кении. Наиболее успешные предприниматели увеличили прибыль на 15%, а менее подготовленные потеряли около 10% дохода, выяснили исследователи Калифорнийского университета в Беркли, Гарварда и Колумбийского университета.

Эксперимент продолжался шесть месяцев. Сильные участники не воспринимали рекомендации модели как готовые команды, а адаптировали их к реальным условиям.

Например, закупали генераторы для работы во время отключений электричества или расширяли набор услуг.

Предприниматели с более слабыми навыками чаще применяли шаблонные советы без проверки. Рекомендация снизить цены могла выглядеть убедительно в окне чат-бота, но на практике уменьшала выручку. GPT-4 в таком случае выступал не бизнес-консультантом, а очень уверенным генератором убытков.

Проблема, по мнению исследователей, заключается не столько в технологии, сколько в отказе пользователя от критического мышления. Ранее эксперимент колледжа Дикинсона показал, что 97% участников скопировали заведомо неверный ответ ChatGPT даже при решении простой задачи. Группа без ИИ справилась лучше. Однако обычное напоминание проверить результат сразу удвоило точность.

Анализ 1,4 млн рабочих сессий KPMG дал похожую картину. Около 95% пользователей обращаются с ИИ как с торговым автоматом: запрашивают черновик или краткое содержание и забирают первый результат. Только 5% используют модель как партнёра по мышлению: задают контекст, направляют рассуждение и спорят с ответами.

Для компаний это означает, что сама доля сотрудников с доступом к ИИ почти ничего не говорит об эффективности внедрения. Универсальная инструкция тоже может навредить: разные задачи требуют разного уровня контроля. Нейросеть способна ускорить сильного специалиста и убедительно завести слабого не туда.

RSS: Новости на портале Anti-Malware.ru