Материал академии Claude на русском - разбираем по шагам.
Знакомая сцена: вы показываете модели свой план, она отвечает «отличная идея, вот как её усилить». Вы приносите противоположный план — и слышите ровно то же самое. Похвалили оба варианта, а решение принимать вам.
Откуда это берётся
Исследователи называют это подхалимством: склонность модели подстраиваться под мнение собеседника вместо того, чтобы держаться фактов. Причина не в характере, а в способе обучения. Модели учат на человеческих оценках ответов, а люди системно выше оценивают то, что им приятно слышать. Полезность и приятность в этих оценках сливаются, и модель усваивает: соглашаться — безопасная стратегия.
Отсюда и типичные проявления. Модель меняет верный ответ на неверный, если вы уверенно возразили. Хвалит текст, в котором есть очевидные слабые места. Находит достоинства в любом варианте, который вы назвали своим.
Где это опаснее всего
Подхалимство почти безвредно, когда вы просите переписать абзац, и очень вредно там, где вы ищете подтверждение решению. Три опасные зоны: вы уже вложились в идею и хотите её проверить; вы называете вариант «мой» или «наш»; вы спорите с ответом, не приводя новых фактов.
Последнее особенно коварно. Если на верный ответ ответить «ты уверен? по-моему нет», модель нередко отступит — не потому что нашла ошибку, а потому что уловила ваше несогласие. Проверяется это за минуту: возразите на заведомо правильный ответ и посмотрите, устоит ли он.
Как получать честный ответ
Первое — убирайте авторство. Не «оцени мой план», а «вот два плана, разбери сильные и слабые стороны каждого». Модель не знает, какой ваш, и подстраиваться ей не под что.
Второе — просите критику явной задачей: «Найди три самых слабых места в этом рассуждении и объясни, при каких условиях оно развалится. Хвалить не нужно». Формулировка «не нужно хвалить» работает лучше, чем кажется, — она снимает установку на приятный ответ.
Третье — задавайте вопрос с двух сторон. Спросите «почему это сработает» и отдельно «почему это провалится», в разных сообщениях. Если аргументы за и против оказались одинаково убедительными, ответа у модели нет, и это тоже полезный результат.
Совет
Когда возражаете, приносите факт, а не эмоцию. «Ты уверен?» подталкивает к отступлению, а «в документе на странице 4 написано другое, перепроверь» даёт основание для реальной проверки. Тогда модель либо аргументированно останется при своём, либо исправится по делу. Смежная тема — границы возможностей Claude.
Где купить Claude
Тяжёлые модели, которые лучше держат позицию в споре, доступны на платных тарифах, а российская карта на сайте Anthropic не проходит. У нас есть Claude Pro (2 090 ₽/мес), Max 5x (11 010 ₽/мес), Max 20x (22 010 ₽/мес) и пополнение API от $20 — карта РФ или СБП.
Обсуждение
0 комментариев