GitHub-радар

Джейкобиан-линза: смотрим, как думают LLM

Anthropic опубликовала кодовую базу-компаньон к своей статье о глобальном рабочем пространстве. Это инструмент для расшифровки того, о чём «думает» произвольное промежуточное представление языковой модели, прежде чем оно превратится в итоговый вывод.

Jacobian Lens от Anthropic — это новый метод интерпретируемости, который берёт любую внутреннюю активацию языковой модели и линейно проецирует её на выходной слой. Затем он декодирует её в список наиболее вероятных слов словаря. Это даёт чёткую картину того, о чём «думала» модель в любой момент её работы. В своей статье авторы выдвигают идею, что у языковых моделей есть глобальное рабочее пространство вербализованных внутренних представлений. Это прямой взгляд на это рабочее пространство. Инструмент можно применить к любой decoder-трансформерной модели из HuggingFace прямо из коробки.

Зачем это вайб-кодеру

Это незаменимый инструмент для всех, кто работает над AI-продуктами, поскольку он даёт понимание того, почему модель говорит именно это. С его помощью можно отлаживать галлюцинации, проверять, что дообученные модели усваивают правильные концепции, и лучше понимать, как знания хранятся и извлекаются в LLM.

Открыть на GitHub