Внимание в LLM · часть 11

Память с поправкой

Компактная память умеет накапливать прошлое. Но мир меняется: Олег жил в Риге, а потом переехал в Прагу. Новая запись должна не лечь рядом со старой, а исправить её.

Сложить два факта — не значит обновить один

Простое линейное состояние прибавляет вклад каждого токена. Если один и тот же ключ получает новое значение, в памяти остаются оба. Следующий запрос читает их смесь: механизм помнит много, но не понимает, какая версия последняя.

Проследите повторную запись по тому же ключу. Перед выбором способа обновления решите, должно ли старое значение накопиться, ослабнуть или уступить место новому. Сравните три результата и назовите роль ошибки предсказания.

Один адрес, два значения

SUM
Способ обновления памяти
Новая связь добавлена, но старая не отменена: память возвращает смесь двух значений.
прежний фактОлег → Ригаисходная запись
новый фактОлег → Прагаобновление
где Олег?Рига + Прагадве версии спорят
Рига100%
Прага100%
Три способа обновить одну ячейку памятиНакопление добавляет новую запись к старой, затухание ослабляет прошлое, а дельта-правило корректирует ответ по текущей ошибке.

Сначала решить, сколько прошлого оставить

Gate (ворота памяти) задаёт коэффициент сохранения αt. Если он близок к единице, прошлое почти не меняется; если близок к нулю, память быстро освобождается для нового.

St=αtSt1+wt,0αt1

αt управляет забыванием, новая запись добавляет свежую информацию.

Записать не новое значение, а ошибку памяти

Delta rule сначала спрашивает состояние, что оно уже вернёт по ключу kt. Затем сравнивает прогноз v^t с новым значением vt и записывает только разницу. Если память уже права, поправка почти нулевая; если факт изменился, старая ассоциация отменяется.

Последовательность смысловых шагов
  1. Прочитатьv^t=St1kt
  2. Сравнитьet=vtv^t
  3. ИсправитьSt=St1+βtktet
Основа механизмаGated DeltaNetGate отвечает за быстрое стирание, delta rule — за точечное обновление; вместе они работают лучше каждого механизма по отдельности.

Быстрая память — не единственная память

Gated DeltaNet заметно усиливает linear attention, но фиксированное состояние всё равно сжимает прошлое. Современные LLM оставляют часть слоёв с полным attention: одни слои быстро несут контекст вперёд, другие могут точно вернуться к отдельной позиции.

Три слоя Gated DeltaNet чередуются с одним слоем полного attention
  1. Gated DeltaNetбыстрая память
  2. Gated DeltaNetбыстрая память
  3. Gated DeltaNetбыстрая память
  4. Полный attentionточное чтение
Популярная LLMQwen3-NextТри слоя Gated DeltaNet чередуются с одним слоем полного attention с gate — соотношение 3:1. Следующий шагKimi LinearKimi Delta Attention добавляет более точное управление gate и работает в гибриде с MLA.