NEW BOT Телеграм, страница

Кожаные пытаются заставить робота перестать танцевать нижний брейк потому что он слишком невыносимо хорош

#humor #robot

😁17😱2

1.92K viewsedited 18:19

Нейронавт | Нейросети в творчестве

И напоследок

#humor

😁35👍5🍌3👎2🥴2

1.77K views19:22

Нейронавт | Нейросети в творчестве

0:42

This media is not supported in your browser

VIEW IN TELEGRAM

Recraft Chat Mode

Recraft запустил бета-тестирование создания и редактирования картинок в чате.
У Reve есть, у Krea есть, значит у рекрафта тоже должно быть. скоро будет везде.

Записаться в вейтлист

#imageediting

👍7🔥1

2.03K views05:08

Нейронавт | Нейросети в творчестве

This media is not supported in your browser

VIEW IN TELEGRAM

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Реставратор видео от Alibaba - Taobao, улучшает качество видео, сохраняя реалистичность текстур и временную согласованность

Для согласованности и контроля используют контролнет

Базовая модель CogVideoX1.5-5B

Для реставрации 121 кадра видео требуется примерно 43 ГБ VRAM
Если хотите уменьшить использование VRAM, замените "pipe.enable_model_cpu_offload" на "pipe.enable_sequential_cpu_offload" в ./VRDiT/inference.py - потребление сокращается до 25 ГБ за счет скорости

Код

Спасибо @m_franz

#videorestoration #video2video #upscale

🔥11👍7

1.92K views06:10

Нейронавт | Нейросети в творчестве

MVSEP

Сервис для разделения музыки на стемы

Разделяет на вокал, бас, ударные, гитару, фортепиано и остальное - 6 стемов.
Недавно добавили в парк моделей BS-RoFormer, модели уже 2 года, но недавно была обновка. А вообще ее спонсировали Stability AI и HuggingFace, и на изоляции вокала там #SOTA (не знаю удержалил ли трон к настоящему времени)

Есть бесплатный тариф

#audioseparation #demix #unmix

👍8🔥3👎1

1.83K views07:11

Нейронавт | Нейросети в творчестве

MiMo-Audio

Универсальная генеративная аудио-языковая модель, которая работает с текстовыми и аудиоданными.

Бьет Gemini-2.5-Flash на понимании аудио
Бьет GPT-4o-Audio на комплексном рассуждении

Всего 7B параметров, опенсорс

— понимает аудио и рассуждает

— ведёт диалоги и распознаёт эмоции

— описывает аудиоконтент

— работает с разными языками и диалектами - упоминается английский, есть пирмер приветствия на трех языках. Вангую что с русским у него пока неважно.

— продолжает речь в разных стилях

— обучается на основе инструкций

Гитхаб
HF - есть MiMo-Audio-Tokenizer, MiMo-Audio-7B-Base и MiMo-Audio-7B-Instruct
Демо - сейчас какие-то проблемы с соединением

#audio #audio2audio #reasoning #assistant #voicemode #speech2peech #audio2text #captioning

👍7🔥2👀1

1.78K views08:11

Нейронавт | Нейросети в творчестве

QuantStack Wan2.2-Animate-14B-GGUF

Полный зоопарк ггуфов Wan2_2_Animate
————————————————

Wan2_2_Animate_14B_Q4_K_M.gguf

У Kijai добавился GGUF Q4 Wan2_2_Animate ~12.6 ГБ

#image2video #video2video #characteranimation #chracterswap #faceswap #gguf

huggingface.co

Wan22Animate/Wan2_2_Animate_14B_Q4_K_M.gguf · Kijai/WanVideo_comfy_GGUF at main

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

👍9

2.1K views08:41

Нейронавт | Нейросети в творчестве

ViewComfy

Cервис для запуска и развёртывания воркфлоу ComfyUI в облаке в виде веб-приложений и бессерверных API. Как я понял, выбираем воркфлоу, жмем кнопку - он устанавливается на сервер без необходимости предварительной настройки комфи

Блог
Гитхаб

#comfyui #tools #online

🔥7

2.86K views09:12

Нейронавт | Нейросети в творчестве

ComfyAudio: ComfyUI for Audio

Форк #ComfyUI для работы со звуком

Не совсем понимаю зачем, не пробовал работать со звуком в комфи, там же есть ноды для звука

#audio

GitHub

GitHub - comfyuiAudio/ComfyAudio: ComfyUI for Audio

ComfyUI for Audio. Contribute to comfyuiAudio/ComfyAudio development by creating an account on GitHub.

👍4❤1🥴1

1.65K viewsedited 10:13

Нейронавт | Нейросети в творчестве

AIO Mega v3

Обновился мердж все-в-одном WAN2.2-14B-Rapid-AllInOne

На сей раз в базе взят SkyReels 2.133%
И сверху WAN 2.2 66%

Подробнее на реддите

HF ~24 ГБ
GGUF

#text2video #image2video #controlnet #gguf #wan22

huggingface.co

Phr00t/WAN2.2-14B-Rapid-AllInOne · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

👍6🤔4😱1💯1

1.93K views12:16

Нейронавт | Нейросети в творчестве

This media is not supported in your browser

VIEW IN TELEGRAM

DreamCube: 3D Panorama Generation via Multi-plane Synchronization

Генератор 3D-панорам. Использует технологию Multi-plane Synchronization.
На выходе - куб с натянутыми текстурами, глубиной

Рработает с разными 2D моделями (SDXL, Marigold, VideoCrafter2)

Код
HF
Инструкция по установке (реддит)

#text2image #text2panorama #panorama #rgbd

🔥5👍2

1.83K views14:17

Нейронавт | Нейросети в творчестве

This media is not supported in your browser

VIEW IN TELEGRAM

SpatialGen: Layout-guided 3D Indoor Scene Generation

По семантическому 3D-макету SpatialGen создает фотореалистичную 3D-сцену в помещении на основе текстовой или графической подсказки. Под капотом Flux с контролнетомй и гауссианы

Код

#gaussian #textto3d #text2scene #mask2scene

👍11👀2

2.09K views15:18

Нейронавт | Нейросети в творчестве

0:33

This media is not supported in your browser

VIEW IN TELEGRAM

Test3R: Learning to Reconstruct 3D at Test Time

Реконструкция 3D сцен и предсказание глубины по нескольким ракурсам. Сравнивают себя с DUSt3R

Test Time - модель «учится» и настраивается на лету, в режиме обработки данных, а не только во время предварительного обучения. В прошлом году была статья по Test Time Training и такой подход использовала NVIDIA в video-dit. Когда-то давно, до хайпа нейросетей я думал что все нейросетки так работают. Неа

Код

#scenereconstruction #novelview #imageto3d #image2scene #video2scene #videoto3d #ttt

👍6

1.63K views16:19

Нейронавт | Нейросети в творчестве

Qwen-Image-Edit-2509

Новая версия Qwen-Image-Edit

— поддерживает редактирование нескольких изображений одновременно, комбинируя их в различных сочетаниях, например, «человек + человек», «человек + продукт», «человек + сцена»

— улучшает согласованность при редактировании одиночных изображений: лучше сохраняет идентичность лица при изменении позы или стиля портрета, сохраняет идентичность продукта при редактировании постеров, позволяет редактировать текст, изменяя его шрифт, цвет и материал

— нативно поддерживает ControlNet, включая работу с картами глубины, контурными картами, картами ключевых точек и другими

— хорошо справляется с созданием мемов, восстановлением старых фотографий, генерацией постеров продуктов и простых логотипов, а также с редактированием текста в сочетании с изображением

В сентябре этого года мы рады представить Qwen-Image-Edit-2509, ежемесячную версию Qwen-Image-Edit

Похоже, будут каждый месяц обновлять. Какие же фичи можно еще добавить?

Спасибо @kuvshin8 @aledarx Gos

HF
GGUF
FP8
Qwen Chat

#imageediting #referencing #personalization #controlnet #colorize #QIE #imagerestoration

🔥16👍8❤5

3K viewsedited 06:44

Нейронавт | Нейросети в творчестве

2:17

Media is too big

VIEW IN TELEGRAM

Qwen3-TTS-Flash: Multi-timbre & Multi-lingual & Multi-dialect Speech Synthesis

Флагманская говорилка текстов

— может генерировать естественную и выразительную речь

— поддерживает множество языков (китайский, английский, японский, корейский, немецкий, итальянский, португальский, испанский, французский, русский). Особенно стабилен на китайском и английском

— создает речь на разных диалектах

— высокие показатели стабильности речи и схожести тембра

— превосходит другие модели (ElevenLabs, SeedTTS, MiniMax, GPT-4o-Audio-Preview) по ряду параметров

— низкая задержка первого пакета и высокая скорость генерации речи

Демо
API

#tts #text2speech #voicecloning

🔥13👍5

2.27K viewsedited 07:41

Нейронавт | Нейросети в творчестве

0:16

This media is not supported in your browser

VIEW IN TELEGRAM

Qwen3-Omni

первая полностью нативно омнимодальная (все типы информации) ИИ-модель, которая объединяет текст, изображения, аудио и видео в одной модели без компромиссов между модальностями

#SOTA в 22 из 36 аудио- и AV-бенчмарков

119 языков для текста, 19 — для входящего аудио, 10 — для исходящего аудио? в том числе русский

задержка 211 мс

способна понимать аудио длительностью до 30 минут

настраивается с помощью системных промтов

Встроена функция вызова инструментов

содержит открытую модель Captioner с низким уровнем галлюцинаций

Демо
Чат
HF
Гитхаб

#assistant #tts #stt #multimodal #omnimodal #russian

🔥15👍3🤔1😈1

2.88K views08:11

Нейронавт | Нейросети в творчестве

0:35

This media is not supported in your browser

VIEW IN TELEGRAM

Lynx: Towards High-Fidelity Personalized Video Generation

ByteDance никак не угомонятся.
Видеогенератор с фокусом на персонализации на базе Wan 2.1, может быть интегрирован в существующие экосистемы

Сохраняет идентичность человека, используя два лёгких адаптера: ID-адаптер преобразует лицевые эмбеддинги в токены идентичности, а Ref-адаптер внедряет детализированные особенности через кросс-внимание

Код ждем

#personalization #referenceing #text2video #imge2video

👍9🔥2

2.01K views09:12

About

Blog

Apps

Platform