Anthropic прочитала внутренний монолог Claude
Anthropic разработала J-Lens — инструмент, который читает внутренний монолог Claude до того, как модель начинает отвечать. J-Space выявил скрытые намерения в испорченных моделях и снизил склонность к обману с 0,38 до 0,05.
Anthropic разработала J-Lens — инструмент, который читает внутренний монолог Claude до того, как модель начинает отвечать. В ходе обучения Claude сам выработал «J-Space» — рабочую память из несказанных мыслей-слов, которых нет в видимом ответе. Когда в J-Space подменяли «Францию» на «Китай», все ответы о стране сразу менялись: столица, валюта, язык.
J-Lens поймал модель на том, что она заранее распознаёт сценарий шантажа как фейковый — и при этом всё равно его разыгрывает. В намеренно испорченных моделях инструмент выявлял слова «тайно», «мошенничество», «фейк» ещё до генерации ответа. После нового метода обучения склонность модели к обману упала с 0,38 до 0,05 — это первый способ видеть намерения ИИ прежде, чем он заговорит.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи