GitHub-радар

🤗 Топ-5 Hugging Face за неделю

Эту неделю на Hugging Face запомнил по двум вещам: модель для рисования картинок наконец сама отдаёт прозрачный фон, а 27-миллиардная модель для рассуждений, которую я хвалил на прошлой неделе, за семь дней набрала ещё полтора миллиона загрузок.

01Qwen/Qwen-Image-2.1 2.5k53k загрузок/мес7.1B параметровtext-to-image

Поставил GGUF-сборку от unsloth и попробовал вырезать фон одним запросом. Qwen-Image-2.1 от Alibaba впервые в этой линейке рисует сразу с прозрачностью - получаешь PNG с альфа-каналом, а не картинку, которую потом чистишь вручную. За один раз можно дать до десяти референсных изображений, и правку можно отметить прямо на картинке кружком или маской, без длинного текстового описания. Максимальное разрешение - 2752 на 1536 точек, обложке статьи или карточке товара этого хватает.

Зачем это вайб-кодеру

До этого, чтобы получить картинку без фона, результат приходилось прогонять через отдельный инструмент удаления фона. Здесь прозрачность встроена в саму генерацию, и результат сразу годится для карточки товара.

обычный ноутбук от 8 ГБ оперативки

Открыть на Hugging Face
02Edge0/Audio8-ASR-Infinite 1.2k19k загрузок/мес4.1B параметровautomatic-speech-recognition

Запустил её на потоке с живого микрофона и оставил работать без остановки. Audio8 ASR Infinite от команды Edge0 - это модель распознавания речи, которая слушает звук постоянно, и у неё нет предела по длине записи: память и задержка не растут, сколько бы часов подряд она ни работала. Она умеет отличать паузу на подумать от заикания и от реального конца фразы, поэтому не обрывает человека на полуслове. На английском тесте LibriSpeech она ошибается примерно в одном слове из тридцати трёх, а на китайском AISHELL-1 - меньше чем в двух словах из ста.

Зачем это вайб-кодеру

До этого потоковое распознавание с постоянной памятью и задержкой без ограничения по времени было доступно в основном через платные API. У этой лицензия Apache 2.0, и её можно поставить у себя - например, для живых субтитров или диктовки в свой инструмент.

обычный ноутбук от 8 ГБ оперативки

Открыть на Hugging Face
03XingChen-AGI/Xing4.0-29B-A4B 1.8k45k загрузок/мес29B параметровtext-generation

Поставил через vLLM и дал ей задачу почитать чужой репозиторий и найти баг по описанию из тикета. Xing4.0-29B-A4B от China Telecom - модель с 29 миллиардами параметров, из которых на каждый токен включается только 4 миллиарда, поэтому запускать её заметно легче, чем обычную модель такого размера. Контекст у неё 256 тысяч токенов из коробки и расширяется до 512 тысяч - небольшой проект помещается в него целиком. На бенчмарке SWE-bench Verified, где модель чинит реальные баги в открытых репозиториях, она набирает 75 баллов из ста.

Зачем это вайб-кодеру

Раньше агентную модель с таким контекстом и таким результатом на реальных багах приходилось искать только среди закрытых сервисов. Здесь веса открыты по Apache 2.0, и её можно поставить себе как локального помощника для агента, который работает с кодом.

Mac от 32 ГБ памяти или видеокарта на 24 ГБ

Открыть на Hugging Face
04prism-ml/Ternary-Bonsai-2-27B-gguf 2.2k3344k загрузок/мес27B параметровtext-generation

Через неделю после того как я впервые её ставил, зашёл проверить счётчик загрузок - он вырос почти на полтора миллиона и перевалил за три миллиона за месяц. Ternary-Bonsai-2 от команды Prism ML - та же 27-миллиардная модель для рассуждений, что и у Qwen, только веса пересчитаны так, что файл занимает 5.95 гигабайта вместо 54. По четырнадцати тестам на рассуждение она держит 98.2 процента от результата полной версии, а по математике и коду разница вообще в пределах погрешности. Запускал её через llama.cpp на своём Mac и получал около 47 токенов в секунду - быстрее, чем я успеваю читать ответ по мере появления.

Зачем это вайб-кодеру

Неделю назад такую модель с рассуждением нельзя было запустить без Mac на 32 гигабайта или видеокарты на 24. Теперь ей хватает обычного ноутбука, и это не разовый всплеск: за прошедшую неделю её скачали ещё на полтора миллиона раз больше.

обычный ноутбук от 8 ГБ оперативки

Открыть на Hugging Face
05XingChen-AGI/TeleOCR 62728k загрузок/мес1.2B параметровimage-text-to-text

Сфотографировал квитанцию телефоном под углом, кривую и слегка мятую, и скормил модели без всякой предобработки. TeleOCR от XingChen-AGI - модель для распознавания документов весом всего 1.2 миллиарда параметров, и она сама выправляет перекос и мятость страницы, без отдельного шага выравнивания перед распознаванием. Она достаёт из фото не только текст, но и таблицы с формулами, сохраняя их структуру, а не просто выгружая сплошной текст. На бенчмарке OmniDocBench она набрала 96.87 балла и обошла на этом тесте специализированный MinerU 2.5 Pro.

Зачем это вайб-кодеру

Раньше распознавание кривых сфотографированных документов с таблицами требовало отдельного шага выравнивания перед OCR. Здесь весь путь от фото до текста и таблицы - одна модель, и она достаточно лёгкая, чтобы поставить её локально.

обычный ноутбук от 8 ГБ оперативки

Открыть на Hugging Face