← Все новости
Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки

Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки

Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Для домена, где на другом конце человек в уязвимом состоянии, эта доступность оборачивается неочевидной инженерной проблемой. Модель, оптимизированная под «быть полезной и приятной», систематически соглашается с пользователем, уверенно выдумывает факты и способна не заметить кризис. Ниже разберём, почему так происходит на уровне механики, какие защитные контуры вокруг модели строят на рынке и почему один из них, перепроверка ответа отдельной ролью, обходится заметно дороже остальных. Читать далее