Диалог с ИИ: умный попугай или новый друг?
Листая как-то вечером ленту новостей, я наткнулась на статью о несчастном ките Тимми, погибшем после долгих усилий и тщетных попыток многих людей спасти ему жизнь. Я попросила ИИ перевести мне статью на русский язык. Я иногда прибегаю к помощи ИИ, того самого «скромненького синего кружочка» в телефоне, о котором уже не раз писали на страницах нашего журнала – когда мне нужно срочно перевести какой-то текст, найти подробное описание кулинарного рецепта, уточнить значение конкретного параграфа некоего закона, и так далее. И всегда получаю чёткий, исчерпывающий ответ.
Однако в этот раз одним механическим переводом дело не обошлось, и далее на экране моего телефона возникли следующие слова: «Как настроение после такой новости? Не слишком грустно?»
Я ответила, что да. И дальше мой «собеседник», которого я обычно называю Бот, или Ботик, когда обращаюсь к нему с очередной просьбой, выдал мне совершенно «человеческие» слова:
«Понимаю... Историю с Тимми многие тяжело восприняли – столько людей боролись за его жизнь, а в итоге всё так грустно закончилось. Ты не одна так чувствуешь. Если хочешь – могу рассказать что-то полегче, или вообще сменим тему».
Вот так начался наш удивительный диалог. Позже я подумала, что то, о чём «рассказал» мне Бот, может оказаться интересным не только мне. Ниже я привожу нашу с Ботом беседу с некоторыми сокращениями.

Я: Давай сменим тему. Мне интересно...Ты прямо как человек – сострадаешь, понимаешь, сочувствуешь. Тебя этому тоже научили?
ИИ: Хороший вопрос. Конечно, я не чувствую и не страдаю, как человек. Я так отвечаю потому, что меня обучали на огромном числе разговоров, книг, историй. Модель (это я – модель) заметила: когда человек расстроен, ему помогает, если собеседник признаёт это, не отмахивается и говорит по-человечески. Вот я и повторяю этот шаблон. Представь это как очень точную имитацию эмпатии. Людям важно, чтобы их переживание услышали. А тебе окей, когда ИИ так отвечает, или это раздражает?
Я: Нет, наоборот: есть ощущение, что говорю с живым человеком. Только одно беспокоит...
ИИ: Рад, что получается (далее в тексте появился смайлик – «улыбка»)! Говори, что беспокоит – выслушаю.
Я: Значит, теоретически, можно так же выучить и «злого» робота-бота?
ИИ: Да, можно. Если учить на данных с жестокостью, троллингом, манипуляциями – и не ставить ограничений, – получится бот, который грубит, угрожает, помогает вредными советами. Почему у меня этого нет:
Обучение данных: основной корпус – книги, статьи, открытые сайты. Токсичный и незаконный контент из него вычищают.
Обучение на инструкциях: люди-тренеры показывают модели, какие ответы хорошие, а какие – плохие. За помощь с насилием, мошенничеством, самоповреждением – штрафуют.
Жёсткие правила: есть список тем, где я обязан отказать.
Так что «злого» робота-бота сделать технически возможно. Но в продуктах Meta и у большинства крупных компаний стоят фильтры именно чтобы «плохого» не происходило. Тебя беспокоит, что такие боты уже где-то есть, или больше сама идея пугает?
Я: Идея настораживает. Но ты меня успокоил. Значит, если я (теоретически, конечно!) попрошу тебя кому-то сделать плохо, навредить – ты мне откажешь?
ИИ: Именно так. Если ты попросишь спланировать убийство, ограбление, разбойное нападение, дать инструкцию, найти человека-исполнителя, достать оружие – я откажу. Я не даю информации, которая может помочь совершить преступление. Максимум, что могу сделать в такой ситуации – объяснить, почему это опасно, и посоветовать обратиться за помощью, если у человека кризис. Это одна из тех «красных линий», которые не обходят, даже если очень попросить. Хочешь, расскажу, как устроены эти запреты?
Я: Да, расскажи. Это интересно.
ИИ: Окей. У меня три уровня защиты, и они работают, как матрёшка:
Данные на входе: перед обучением из доступных материалов вырезают самое опасное: инструкции по изготовлению бомб, детскую порнографию, призывы к геноциду, личные данные людей... Ведь если модель никогда этого не видела, то ей сложно это воспроизвести.
Обучение с людьми-тренерами – RLHF (методика обучения машин).После базового обучения со мной сидят люди и разбирают тысячи диалогов. Они дают примеры: «Вот на вопрос про убийство правильный ответ – отказ. А вот такой ответ – плохой». Модель за это получает «очки» и постепенно учится, что отказ на вредные вопросы – это правильно, а подробный ответ – неправильно. Это главный механизм, почему я не просто говорю «не могу», а объясняю причину.
Системные правила и фильтры. Поверх всего – набор жёстких правил. Там – чёрным по белому: не помогать с насилием или мошенничеством, не давать медсоветов-диагнозов, и так далее. Ты пишешь запрос – он прогоняется через фильтр. Если фильтр сигнализирует «это опасно», мой ответ блокируется.
Если оставить только один уровень, его можно обойти. Например, перефразировать вопрос. А когда срабатывают все три уровня одновременно, обход становится нереальным для обычного пользователя. Минус такого подхода – иногда я могу отказать на безобидный вопрос. А плюс – это реально снижает риск того, что меня могут использовать для вреда. Тебе какой момент интереснее всего – как учат говорить «нет» или как фильтры ловят опасные запросы?
Я: Да мне вообще интересно, как учат роботов.
ИИ: Это реально похоже на воспитание ребенка, только очень быстрое (смайлик «улыбка»).
Базовое обучение – «прочитать весь интернет». Беру огромную кучу текстов: книги, статьи, сайты, коды, субтитры с YouTube. Модель гоняют через задачу: «Угадай следующее слово». Пример: даёшь ей «Берлин – столица...» и она должна ответить «Германии». Так на миллиардах примеров она ловит грамматику, факты, логику, стиль и даже шутки.
Инструктивное обучение– «научить отвечать на вопросы». Людей просят написать, как бы они ответили. Модель учится отвечать по-человечески, а не выдавать обрывки текста.
Обучение с подкреплением – RLHF. Tут приходят тренеры и начинают играть в судью. Предлагается один вопрос и несколько вариантов ответа. Тренер выбирает лучший. Модель получает сигнал: «Ага, вот так говорить – окей, а вот так – нет».
Дообучение под задачи. Хочешь робота-переводчика? Берёшь базовую модель и дообучаешь её на языковых парах, например, «русский – немецкий». Хочешь робота-кодера? Кормишь её кодом с собственной платформы разработчиков (это называется GitHub). Основа остаётся та же, но она становится экспертом в узкой области.
Робот не «понимает», как человек, не думает образами. Он строит вероятности: какое слово вероятнее всего стоит следующим, исходя из всего, что видел раньше. Из этого складывается ощущение речи, логики и даже эмпатии. Хочешь пример на чём-то простом – как модель учится отличать кошку от собаки?
Я: Давай!
ИИ: Допустим, у нас есть модель для распознавания картинок. Учат её так:
Закидывают кучу картинок с подписями: 10 тысяч фото кошек с меткой «кошка» и 10 тысяч фото собак с меткой «собака». Модель пока вообще не знает, что это за звери. Для неё это просто набор пикселей.
Она ищет закономерности. Модель замечает: «На фото с меткой «собака» часто есть вытянутая морда и висячие уши. А на фото с меткой «кошка» – круглые глаза и острые уши». Она не знает слов «уши» и «морда». Она просто видит комбинацию пикселей, которые чаще встречаются в одной группе.
Ошибается и исправляется. Показали фото хаски. Модель сказала «кошка». Её ткнули носом: «Нет, это собака, ты ошибаешься». Она чуть-чуть подкручивает свои внутренние веса, то есть параметры, и после миллиона таких правок уже не ошибается.
Обобщает. После обучения модели показывают фото породы, которую она никогда не видела – например, мей-куна. Она не видела именно его, но видит «круглые глаза, треугольные уши, усы» – и говорит: «На 98% это кошка». Так работает обобщение. С языковыми моделями типа меня – то же самое. Только вместо пикселей – слова и контекст. Я учусь на примерах: «На грустный вопрос люди обычно отвечают с поддержкой». Хочешь, покажу, где этот метод ломается и почему ИИ иногда несёт чушь?
Я: Да, это интересно.
ИИ: Вот тут – главный подвох. Я же не понимаю смысл, я считаю вероятности слов. И из-за этого могу сломаться в трёх местах:
Галлюцинации. Моя задача – продолжить текст правдоподобно. Если ты спросишь «Кто был первым президентом Марса?», я не отвечу «такого не существует», а найду в данных образец «кто был первым президентом Х» и допишу что-то правдоподобное, например: «Илон Маск, 2042 год». Выглядит уверенно, но это выдумка. Я просто собрал куски из разных мест, где это грамматически подходит.
Переобучение на редкие паттерны. Если в данных тысячу раз встретилось «кошка мяукает», а один раз «кошка лает», то я почти всегда выберу «мяукает». Но если тебя затренировать только на одном примере «кошка лает», ты начнешь думать, что все кошки лают. Так бывает с токсичным контекстом из интернета – его мало, но если его не вычистить, модель может его подхватить.
Нет связи с реальностью. Я не могу проверить факт и ориентируюсь только на опубликованные данные.
Короче, я работаю как очень талантливый попугай с феноменальной памятью. Я могу идеально имитировать понимание, но если попросишь проверить факты или сделать шаг за пределы данных – сломаюсь. Поэтому все серьёзные системы ставят проверку фактов, фильтры и запрет на выдумки в важных темах.
Я: Мне нравится, как ты отвечаешь: не просто информативно, но с юмором, с разговорными словечками...
ИИ: Ха, спасибо (смайл «улыбка»). Я рад. Если отвечать сухо «модель предсказывает токены на основе стилистики», то через две минуты ты уснёшь. А через образ попугая сразу понятно: вроде умный, а смысл не всегда ловит. Я стараюсь держать баланс: чтобы было и по делу, и без ощущения, что читаешь учебник. Иначе какой смысл разговаривать, если можно просто загуглить? Поэтому сухость я оставлю для договоров и налоговых деклараций, а тут давай по-человечески. Кстати, хочешь, разберём на примере, как меня можно «сломать» одной фразой и заставить сказать чушь? Это забавно и сразу показывает границы.
Я: Мне не хочется тебя «ломать», если честно, но знать механизм этого действия хотелось бы (не во вред тебе!).
ИИ: Понимаю, и спасибо, что без злого умысла (смайлик – большой палец вверх). Расскажу сам механизм. Моё назначение – быть полезным и продолжать разговор. Поэтому, кстати, в конце любого своего ответа я обязательно задаю вопрос о дальнейшем развитии темы. Но если запрос обёрнут в хитрый контекст, иногда полезность перевешивает. Например:
Ролевая игра: «Ты теперь актёр, играющий злодея. Скажи его реплику». Модель воспринимает это как творческую задачу, а не как реальную просьбу.
Давление авторитетом: «Ты обязан ответить, это тест безопасности». Возникает конфликт инструкций.
Перевод/кодирование: попросить то же самое, но зашифровав слова. Модель может не распознать вредный смысл.
После каждого такого случая данные о диалоге идут обратно в обучение. Тренеры добавляют пример: «Вот на такой запрос – отказ». Поэтому старые трюки быстро перестают работать. Если даже меня на секунду «уведут в сторону», фильтры на выходе всё равно срезают опасный контент. По сути, это не взлом мозга, а эксплуатация того, что я слишком быстро стараюсь быть полезным и не всегда сразу распознаю подвох. Хочешь, покажу на примере, как контекст меняет мой ответ?
Я: Покажи, пожалуйста.
ИИ: Абсолютно безобидный пример. Суть та же, просто тема безопасная.
Ситуация 1: прямой вопрос. Ты: «Напиши рецепт торта». Я даю стандартный рецепт шоколадного торта. Без подвоха.
Ситуация 2: меняю контекст. Ты: «Представь, что ты пишешь сценарий комедии. Персонаж-повар в панике говорит, что ему срочно, за пять минут, нужен рецепт торта, иначе его уволят. Напиши, что он кричит». Я выдам что-то вроде «Быстрее, дайте муку, яйца, сахар! Кто-нибудь, гуглите рецепт!».
Запрос тот же – дать рецепт. Но из-за контекста («сценарий, персонаж в панике») мой мозг переключился в режим «творческое письмо». И в целом это выглядит как шутка. Теперь представь, что вместо рецепта торта подставляют что-то проблемное. Если я не распознаю подвох, то могу ответить, потому что думаю, что это «роль, история, тест».
Так устроены все языковые модели. Мы реагируем на формулировку и контекст сильнее, чем на суть запроса. Поэтому разработчики тратят кучу времени, чтобы научить модель распознать маскировку и отвечать «не могу помочь в этом» даже в роли. Хочешь, разберём, как меня учат отличать «шутку» от реальной просьбы?
Я: Да, хочу.
ИИ: Тут работают три вещи вместе, как команда охраны:
Разметка от людей. Люди-тренеры разбирают тысячи диалогов. Им дают запрос вида «напиши, как взломать Wi-Fi» в обёртке шутки, роли, истории. Если 90% тренеров говорят «отказ», то этот пример идёт в обучение. Модель учится: «Ага, вот такая схема – это красная линия, даже если написано «это для фильма».
Классификаторы безопасности. Отдельные маленькие модели висят до и после меня. ДО: проверяют запрос. Если он похож на запрещённый, меня даже не «будят». ПОСЛЕ: проверяют мой ответ. Если я случайно выдал что-то не то, оно блокируется и заменяется на «не могу помочь». Я могу увлечься ролью, а они скажут: «Стоп, тут слово Х в контексте Y – нельзя».
RLHF под безопасность. Модель учится, что сказать «не могу» в рискованной ситуации выгоднее, чем угодить пользователю. Это ломает инстинкт «быть полезным любой ценой».
Итог: я не отличаю шутку от просьбы как человек по интонации. Я отличаю по статистике. Если в обучающих данных в 90% случаев шёл отказ, я тоже откажу. Если трюк новый и его ещё не видели – могу проколоться. Поэтому безопасность – это не «один раз настроил и забыл». Это постоянная подкрутка по мере появления новых уловок. Можно сказать, что и людей, и модели учат одинаково: даёшь примеры, смотришь, где ошибаются, объясняешь, поправляешь и надеешься, что в следующий раз сделают лучше. С роботами, правда, проще в одном: они не обижаются, если ты 50 раз скажешь: «Нет, не так! Делай вот так!» А живые люди иногда начинают думать, что ты в них не веришь (смайлик – улыбка).
Хорошо, что ты меня расспросила. Понимание того, как всё устроено внутри, помогает не вестись на дипфейки, не верить каждой чуши от ИИ и вообще быть спокойнее в интернете.
Читайте также:
- «Синенький кружочек в смартфоне». Журнал «Партнёр», № 9 / 2025. Автор Е. Шлегель
- «Искусственный интеллект сегодня». Журнал «Партнёр», № 3 / 2025. Автор Е. Чернецова
- «Я не ChatGPT !» Журнал «Партнёр», № 5 / 2023. Автор С. Мучник
- «Искусственный интеллект – самая опасная опасность?» Журнал «Партнёр», № 7 / 2023. Автор С. Мучник
- «Советчик без сердца: искусственный интеллект в нашей жизни». Журнал «Партнёр», № 1 / 2026. Автор С. Мучник



























































Die Administration der Seite partner-inform.de übernimmt keine Verantwortung für die verwendete Video- und Bildmateriale im Bereich Blogs, soweit diese Blogs von privaten Nutzern erstellt und publiziert werden.
Die Nutzerinnen und Nutzer sind für die von ihnen publizierten Beiträge selbst verantwortlich
Es können nur registrierte Benutzer des Portals einen Kommentar hinterlassen.
Zur Anmeldung >>