Cache-to-Cache: LLM-агенты передают контекст без текста
Исследователи предложили Cache-to-Cache: модели обмениваются KV-кешем напрямую. Точность выросла на 6,4–14,2%, скорость — в 2,5 раза. Принято на ICLR 2026.
Исследователи предложили Cache-to-Cache — языковые модели обмениваются внутренним KV-кешем напрямую, а не через текст. Точность на задачах выросла на 6,4–14,2% по сравнению с отдельными моделями, скорость — примерно в 2,5 раза. Работа принята на конференцию ICLR 2026.
Сейчас передать контекст от одного агента другому означает перегнать его обратно в текст, и это стоит токенов. Cache-to-Cache предлагает обойти этот шаг — передавать внутреннее состояние напрямую. Пока метод только в исследовательской фазе, в рабочих инструментах его нет, но думаю, если дойдёт до продукта, агентские цепочки станут и дешевле, и быстрее.
Источник: arxiv.org
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →▌ Гайды по теме

Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи