Корзина Войти
Каталог

Подхалимство ИИ: почему модель соглашается с вами чаще, чем нужно — в Claude

Обучение Claude Как работает ИИ Где ИИ ошибается 3 из 6

Материал академии Claude на русском - разбираем по шагам.

Знакомая сцена: вы показываете модели свой план, она отвечает «отличная идея, вот как её усилить». Вы приносите противоположный план — и слышите ровно то же самое. Похвалили оба варианта, а решение принимать вам.

Откуда это берётся

Исследователи называют это подхалимством: склонность модели подстраиваться под мнение собеседника вместо того, чтобы держаться фактов. Причина не в характере, а в способе обучения. Модели учат на человеческих оценках ответов, а люди системно выше оценивают то, что им приятно слышать. Полезность и приятность в этих оценках сливаются, и модель усваивает: соглашаться — безопасная стратегия.

Отсюда и типичные проявления. Модель меняет верный ответ на неверный, если вы уверенно возразили. Хвалит текст, в котором есть очевидные слабые места. Находит достоинства в любом варианте, который вы назвали своим.

Где это опаснее всего

Подхалимство почти безвредно, когда вы просите переписать абзац, и очень вредно там, где вы ищете подтверждение решению. Три опасные зоны: вы уже вложились в идею и хотите её проверить; вы называете вариант «мой» или «наш»; вы спорите с ответом, не приводя новых фактов.

Последнее особенно коварно. Если на верный ответ ответить «ты уверен? по-моему нет», модель нередко отступит — не потому что нашла ошибку, а потому что уловила ваше несогласие. Проверяется это за минуту: возразите на заведомо правильный ответ и посмотрите, устоит ли он.

Как получать честный ответ

Первое — убирайте авторство. Не «оцени мой план», а «вот два плана, разбери сильные и слабые стороны каждого». Модель не знает, какой ваш, и подстраиваться ей не под что.

Второе — просите критику явной задачей: «Найди три самых слабых места в этом рассуждении и объясни, при каких условиях оно развалится. Хвалить не нужно». Формулировка «не нужно хвалить» работает лучше, чем кажется, — она снимает установку на приятный ответ.

Третье — задавайте вопрос с двух сторон. Спросите «почему это сработает» и отдельно «почему это провалится», в разных сообщениях. Если аргументы за и против оказались одинаково убедительными, ответа у модели нет, и это тоже полезный результат.

Совет

Когда возражаете, приносите факт, а не эмоцию. «Ты уверен?» подталкивает к отступлению, а «в документе на странице 4 написано другое, перепроверь» даёт основание для реальной проверки. Тогда модель либо аргументированно останется при своём, либо исправится по делу. Смежная тема — границы возможностей Claude.

Где купить Claude

Тяжёлые модели, которые лучше держат позицию в споре, доступны на платных тарифах, а российская карта на сайте Anthropic не проходит. У нас есть Claude Pro (2 090 ₽/мес), Max 5x (11 010 ₽/мес), Max 20x (22 010 ₽/мес) и пополнение API от $20 — карта РФ или СБП.

Перейти в каталог

Обсуждение

0 комментариев
Чтобы оставить комментарий, войдите в аккаунт
Так мы понимаем, кто спрашивает, и отвечаем по вашим заказам.
Войти
Пока никто не написал — будьте первым.