Если под "это" имеется ввиду ситуация, когда контекст, гит и .md замусорило - то влетал, конечсно же. :)
Дальше вопрос "почему так происходит" и тут по моему опыту больше причин кроется в сценариях использования, инструкциях и обвязках, нежели в "особенностях ЛЛМ".
Но это мой субъективный опыт, подозреваю что ваш - другой.
Поэтому и спросил как вы это видите.
Не, это именно особенности LLM, а вот промпты, сценарий и харнес - это уже попытка как-то с этой особенностью поработать и снизить количество проблем.
А базовые проблемы там такие
- недетерминированность, то есть нет точного соответствия выходных токенов входным и даже токенизация пользовательских запросов неоднозначна
- "честный" расход ресурсов не позволит не то, что 256к контекста, а хорошо если 32к будет
- оптимизации на длинных контекстах могут неправильно сжимать информацию и терять нужное, добавлять лишнее
Просто на локальном инференсе и квантованных моделях все это критичнее
Про недетерминированность - это долгий холивар, я щас как раз пишу очередной длиннющий лонгрид на эту тему.
Но если коротко, то тут лично у меня два ключевых вопроса:
• насколько для конкретных задач действительно нужна строгая детерминированность.
• насколько, по сравнению с другими способами решения этой задачи, разброс результатов больше или меньше.
ну т.е. условно "а если эту же задачу будет решать человек, будет ли степень детерминированности выше по сравнению с ллм?"
Про "честный расход" я, честно говоря, не совсем понял, что имелось ввиду.
Про оптимизации, валидное/невалидное сжатие/сохранение/т.д и т.п. - в целом идея понятна.
Но это не особенность ЛЛМов как таковых.
Это особенность процесса передачи информации в принципе.
При коммуникации человек-человек происходит то же самое, когда мы записываем свои мысли, что б потом к ним вернуться - происходит то же самое.
детерминированность нужна, если
- вот этот кусок задачи надо воспроизвести больше 1 раза
- человек, который в здравом уме и твердой памяти смог решить задачу один раз и описал методологию, второй раз решит ее таким же образом, потому что люди ленивы, а вот LLM - неутомима и ее ограничивает только контекст и производительность
ок, про "честный" и "нечестный" расход ресурсов
1) честный - все состояния загружены в память железки, на которой LLM крутится и для поддержки 256к контекстного окна (что мало) надо дохрена памяти
2) нечестный - оптимизация, которая позволяет кэшировать и переиспользовать, mtp как механизм и прочее-прочее-прочее
про коммуникацию? ну я как медиатор скажу - если я такую коммуникацию вижу, то надо всех на медиацию гнать и там долго приводить к общему знаменателю, а иначе результата не будет
я еще до кучи скажу, что любая задача при ограниченном контекстном окне сначала проходит стадию анализа и декомпозиции, а потом делается теми мелкими кусочками, на которые ее получилось разобрать... это значит, что ценность детерминированности взлетает в небеса
Я встречаю проблему с детерминированностью когда задача хорошо решалась, всё шло как по маслу, но надо было прерваться. И вот я сохраняю контекст и результаты, с которых можно продолжить, например, через пару дней. Но получаю жесть. И даже если попытаться заново выстроить контекст, жесть не прекращается!
тут я отношусь философски весьма: я сам могу затупить и напороть косяков не хуже любой покалеченной агрессивным квантованием нейросети 😂
так что "люди так не косячат" - это некоторый идеал, а статистическая норма - "нейросети косячат как некоторый усредненный набор людей"
> детерминированность нужна, если
- вот этот кусок задачи надо воспроизвести больше 1 раза
Это не так.
Она нужна только тогда, когда вам нужно строго повторить выполнение "куска задачи" и получить строго такой же результат.
Но в огромном количестве практических задач не нужно строгое повторение процесса выполнения задачи, а результатов может быть огромное множество, но все эти будут абсолютно эквивалентны с точки зрения решения практической задачи.
> человек, который в здравом уме и твердой памяти смог решить задачу один раз и описал методологию, второй раз решит ее таким же образом
Это тоже, мягко говоря, не так.
По огромному количеству причин, от "описал не до конца" до "стало лень читать что там описано, поэтому делал по памяти".
Более того, люди в здравом уме и твердой памяти иногда делают ровно то же самое, что делают галлюцинирующие ЛЛМы - говорят "я сделал", когда нифига не делали.
Разница, разве что, в том что человеку потом можно по рукам надавать и отправить умирать с голоду без работы, а ЛЛМу не получится.
> ну я как медиатор скажу - если я такую коммуникацию вижу, то надо всех на медиацию гнать и там долго приводить к общему знаменателю
Я не хочу показаться грубым, но это самообман.
Нет ни одного способа коммуникации, который не приводил бы к потере информации.
Вообще ни одного. Потому что субъективность восприятия, потому что разное понимание формулировок, потом что не вся информация банально усваивается и ещё по куче причин.
Медиация здесь - такой же костыль, как всякие там харнессы, агенты и прочее в работе с ЛЛМ.
Она, безусловно, помогает в какой-то степени синхронизировать понимание тех или иных аспектов у участников, но никак не обеспечивает отсутствие потерь и искажения информации.
Более того, вы с таким же успехом можете взять N агентов с разными промптами и заставить их приходить к консенсусу по поводу полноты и корректности сжатого контекста относительно исходного - и суть будет ровно та же.
Нейроотличная лаборатория отдыха
Вчера собирала 4 встречу про кризисный план, с утра почувствовала, что начала заболевать и достала свой кризисный план на случай болезни и плохого самочувствия. Очень важно, когда мало сил и мозгов, иметь уже готовые правила, что надо делать. И не надо мучительно решать, тварь я дрожащая или могу взять больничный.
Мои достижения последнего года — такие правила не только для больничного, но и для когнитивной и социальной перегрузки.
Они очень полезны в моменте, но у меня прямо много сопротивления их делать. Кажется, что все же очевидно, а когда наступает пиздец на это все просто нет сил. Мы их обсуждали прямо на сессии с терапевткой, а я зову подступиться к этому вместе с группой.
Буду в следующие полтора месяца рассказывать про наш с Леной проект
Организационное:
✨5 недель, старт 24 октября
✨встречаемся по субботам, с 12:30 до 15:00 мск
✨стоимость — от 15 500 ₽
✨при оплате до 24 сентября — промоцена
✨есть социальные места и оплата частями
Полная программа и больше подробностей — на лендинге!
#Нейроотличная_лаборатория_отдыха
15 уроков за 15 лет
Летом исполнилось 15 лет, как я впервые начала официально работать как тестировщица. Тогда и еще годы после я видела, как люди приходили в тестирование, работали два-три года и шли куда-нибудь дальше. Да я и сама смотрела в сторону системного анализа, технической поддержки третьего уровня и скрам-мастерства.
Рада, что это меняется и сейчас все больше людей, которые остаются, развиваются и двигают вперед профессию.
1. Тестирование может быть очень разным
Что ждут от тестировщиков? Как тестировщики делают свою работу? Какие навыки для этого нужны? У двух разных тестировщиков может не быть почти ничего общего (даже название должности)
2. Критично важно понять, что ты хочешь сама делать
Если не заходит работа, то вполне возможно, что не заходит именно этот способ делать эту работу в этом контексте. Зная себя и свои особенности, больше шансов, найти что-то, что подходит именно тебе.
3. Недостатки в одном контексте, оборачиваются достоинствами в другом
Я люблю сложные и длинные задачи, где можно и нужно много думать, разбираться и исследовать. И я же совершенно неэффективна, где надо быстро делать много небольших задач, переключая контексты по 5 раз на день.
Я за то, что развивать сильные стороны, а не пытаться стать ежиком.
4. Штатные способы работать не работают
Практически у всех, другое дело, что кто-то меньше от этого страдает, кто-то больше. Чем лучше ты понимаешь, как устроена твоя голова и как тебе хорошо работать, не выгорая — тем больше возможностей в эту сторону хотя бы лежать.
Моя история была про то, как выживать, работая фултайм. Но это может быть и про «чуть больше сил остается на другую жизнь» и «получать чуть больше удовлетворения». Делала про это доклад на QA Sis Conf и веду целую исследовательскую лабу для нейроотличных людей.
5. Тестирование без автоматизации за 15 лет так и не умерло
Хотя я слышала это буквально со старта своей карьеры, что сейчас мы все быстро автоматизируем и заменим людей. Что раньше проверяли лю
Вспомнила, как обсуждали с терапевткой, что нет никакого объективного измерения для травмирующих событий. Нельзя снаружи оценить, что вот это травма, а это чушь собачья (хотя люди, конечно, постоянно пытаются).
Это глубоко внутренняя шутка, которая зависит от возможности человека с этим событием справиться и того, какие ресурсы и поддержка у него были.
И вот много размышляю про внутреннюю разницу между «пиздец, мы всем умрем» и «пиздец, конечно, но интересный челлендж». Что-то тоже внутри про количество ресурса и поддержки, чтобы справляться
#тлен_и_усталость
Это и не только про травмирующие события, а, например, про счастье или зависимость. И мы сами спустя время и оказавшись за пределами события уже не способны оценить его так же как в процессе