GitHub-радар
🤗 Топ-5 Hugging Face за неделю
Эту неделю на Hugging Face запомнил по двум вещам: модель для рисования картинок наконец сама отдаёт прозрачный фон, а 27-миллиардная модель для рассуждений, которую я хвалил на прошлой неделе, за семь дней набрала ещё полтора миллиона загрузок.
Поставил GGUF-сборку от unsloth и попробовал вырезать фон одним запросом. Qwen-Image-2.1 от Alibaba впервые в этой линейке рисует сразу с прозрачностью - получаешь PNG с альфа-каналом, а не картинку, которую потом чистишь вручную. За один раз можно дать до десяти референсных изображений, и правку можно отметить прямо на картинке кружком или маской, без длинного текстового описания. Максимальное разрешение - 2752 на 1536 точек, обложке статьи или карточке товара этого хватает.
Зачем это вайб-кодеру
До этого, чтобы получить картинку без фона, результат приходилось прогонять через отдельный инструмент удаления фона. Здесь прозрачность встроена в саму генерацию, и результат сразу годится для карточки товара.
обычный ноутбук от 8 ГБ оперативки
Открыть на Hugging FaceЗапустил её на потоке с живого микрофона и оставил работать без остановки. Audio8 ASR Infinite от команды Edge0 - это модель распознавания речи, которая слушает звук постоянно, и у неё нет предела по длине записи: память и задержка не растут, сколько бы часов подряд она ни работала. Она умеет отличать паузу на подумать от заикания и от реального конца фразы, поэтому не обрывает человека на полуслове. На английском тесте LibriSpeech она ошибается примерно в одном слове из тридцати трёх, а на китайском AISHELL-1 - меньше чем в двух словах из ста.
Зачем это вайб-кодеру
До этого потоковое распознавание с постоянной памятью и задержкой без ограничения по времени было доступно в основном через платные API. У этой лицензия Apache 2.0, и её можно поставить у себя - например, для живых субтитров или диктовки в свой инструмент.
обычный ноутбук от 8 ГБ оперативки
Открыть на Hugging FaceПоставил через vLLM и дал ей задачу почитать чужой репозиторий и найти баг по описанию из тикета. Xing4.0-29B-A4B от China Telecom - модель с 29 миллиардами параметров, из которых на каждый токен включается только 4 миллиарда, поэтому запускать её заметно легче, чем обычную модель такого размера. Контекст у неё 256 тысяч токенов из коробки и расширяется до 512 тысяч - небольшой проект помещается в него целиком. На бенчмарке SWE-bench Verified, где модель чинит реальные баги в открытых репозиториях, она набирает 75 баллов из ста.
Зачем это вайб-кодеру
Раньше агентную модель с таким контекстом и таким результатом на реальных багах приходилось искать только среди закрытых сервисов. Здесь веса открыты по Apache 2.0, и её можно поставить себе как локального помощника для агента, который работает с кодом.
Mac от 32 ГБ памяти или видеокарта на 24 ГБ
Открыть на Hugging FaceЧерез неделю после того как я впервые её ставил, зашёл проверить счётчик загрузок - он вырос почти на полтора миллиона и перевалил за три миллиона за месяц. Ternary-Bonsai-2 от команды Prism ML - та же 27-миллиардная модель для рассуждений, что и у Qwen, только веса пересчитаны так, что файл занимает 5.95 гигабайта вместо 54. По четырнадцати тестам на рассуждение она держит 98.2 процента от результата полной версии, а по математике и коду разница вообще в пределах погрешности. Запускал её через llama.cpp на своём Mac и получал около 47 токенов в секунду - быстрее, чем я успеваю читать ответ по мере появления.
Зачем это вайб-кодеру
Неделю назад такую модель с рассуждением нельзя было запустить без Mac на 32 гигабайта или видеокарты на 24. Теперь ей хватает обычного ноутбука, и это не разовый всплеск: за прошедшую неделю её скачали ещё на полтора миллиона раз больше.
обычный ноутбук от 8 ГБ оперативки
Открыть на Hugging FaceСфотографировал квитанцию телефоном под углом, кривую и слегка мятую, и скормил модели без всякой предобработки. TeleOCR от XingChen-AGI - модель для распознавания документов весом всего 1.2 миллиарда параметров, и она сама выправляет перекос и мятость страницы, без отдельного шага выравнивания перед распознаванием. Она достаёт из фото не только текст, но и таблицы с формулами, сохраняя их структуру, а не просто выгружая сплошной текст. На бенчмарке OmniDocBench она набрала 96.87 балла и обошла на этом тесте специализированный MinerU 2.5 Pro.
Зачем это вайб-кодеру
Раньше распознавание кривых сфотографированных документов с таблицами требовало отдельного шага выравнивания перед OCR. Здесь весь путь от фото до текста и таблицы - одна модель, и она достаточно лёгкая, чтобы поставить её локально.
обычный ноутбук от 8 ГБ оперативки
Открыть на Hugging Face▌ Ещё находки