id 1090966837Фотография
В этом посте есть полезное наблюдение: формулировка запроса действительно влияет на ответ (это не новость ), а уверенная речь модели не равна ни знанию, ни устойчивому внутреннему состоянию. Работа об «понимании намерения» измеряет именно поведенческую чувствительность к цели, формулировке и случайности ответа; она не доказывает наличие у модели собственного намерения.
Но затем происходит незаметная подмена. Из того, что модель по-разному реагирует на цель, стиль и контекст, не следует, что она «распознала», «сыграла» или тем более «приняла нашу цель как свою». Цель в строгом смысле требует устойчивого предпочтения, сохраняющегося во времени и способного направлять выбор действий. У обычного трансформера при инференсе нет такого непрерывного субъекта: есть фиксированные веса, входной контекст, временные активации и следующий токен.
«Внутренняя карта мира» тоже опасная метафора. Линейный зонд может предсказывать, что в активациях содержится информация, коррелирующая с истинностью утверждения. Но это не означает, что внутри найдено убеждение, а тем более — персона, которая знает, что лжет. Зонд читает геометрию представлений, не сознание и не исповедание веры.
Короткоживущая сущность (икжи о которой автор вдруг как-то забыл) здесь действительно ближе к реальности. Экземпляр модели существует в пределах вычисления: получает контекст, строит распределения токенов, выдаёт продолжение. По завершении запроса его рабочее состояние обычно исчезает. Он не помнит беседу сам по себе, не накапливает опыт и не меняет свои веса. Память, планы и «личность» агента появляются только во внешней обвязке: журнале, базе данных, RAG, инструментах, цикле управления и правилах, которые задаёт разработчик.
Поэтому автономный агент — не "пробудившийся" трансформер, а инженерная система вокруг множества кратких вызовов модели. Риск там реален, но он не в тайной воле модели. Он в неверно заданной функции успеха, в доступе к инструментам, в плохой проверке действий, в ошибочной памяти, в чрезмерной автономии и в том, что человек принимает правдоподобный текст за надёжное основание для действия (а это и есть проблема).
После Гагарина казалось: раз человек вышел в космос, то другие звёздные системы — следующий горизонт. Прошло больше полувека: мы всё ещё не отправили людей дальше Луны. С ИИ действует похожая оптическая иллюзия (или фантастический хайп). Способность модели складно говорить о целях, истине, страхе или роли создаёт впечатление, будто за фразами уже стоит носитель целей, истины и страха. Но между имитацией языка о субъекте и появлением субъекта — дистанция, которую нельзя измерить числом параметров или убедительностью диалога.
Главная проблема сегодня не в том, что мы не умеем контролировать «принятую моделью цель». Нет оснований считать, что базовый чат-трансформер вообще принимает цели. Проблема проще и прозаичнее: мы плохо измеряем надёжность, переносимость поведения между контекстами, устойчивость к промпт-инъекциям, качество внешней памяти и последствия выдачи модели реальных полномочий.