Нейронавт | Нейросети в творчестве – Telegram
Нейронавт | Нейросети в творчестве
10.6K subscribers
4.43K photos
3.7K videos
41 files
4.74K links
Канал про нейросети в компьютерной графике, в кино и вообще

В папках не участвую

для связи @Neuronauticus

Заявка на регистрацию в РКН № 6309426111
Download Telegram
VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning

Голосовая модель с клонированием голоса на основе MiniCPM-4

— создаёт выразительную речь, подстраивая стиль под содержание

— клонирует голос по короткому аудио, передавая тембр, акцент и эмоции

— синтезирует речь в реальном времени на обычном GPU

— работа с монолингвальным и кросс-лингвальным клонированием голоса: модель способна работать с различными языками и диалектами

— учитывает эмоции и условия записи голоса

— генерирует речь в разных стилях (рассказ, новость, реклама)

— распознаёт математические символы в китайском

— контролирует фонемы

⚡️поддерживает китайский и английский языки. Но русский смог с горем пополам. Английский гораздо лучше. Выходит, может чтото на языках которым не обучался ‼️

Код
HF
Демо1
Демо2

#tts #text2speech #realtime #voicecloning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10😁31👎1
VibeVoice-finetuning

Неофициальный способ файнтюна топовой говорилки VibeVoice
В процессе разработки

Для 1.5B LoRa рекомендовано минимум 16gb VRAM
Для 7B LoRa - минимум 48gb VRAM

#podcast #voicecloning #tts #text2speech #text2podcast #finetuning #lora
👍5
marble

Генератор миров по картинке и по тексту от worldlabs.ai
По тексту - сначала генерит картинку

Работает на гауссианах. По сути это генератор 3D сцен на гауссианах под соусом навигабельных миров.
Есть две модели: Marble 01-mini и Marble 01-Plus. Вторая качественнее, медленнее и впятеро дороже по кредитам. Но все генерации сейчас бесплатные

Работает в том числе и на VR гарниртурах

Можно экспортировать сцену в файл.

Говорят что доступ через вейтлист но я свободно зашел и нагенерил немножко, см второе видео

Попробовать

#image2world #image2scene #gaussian #world
👍12👎31
Higgsfield Soul бесплатно с лимитами

Впервые за долгое время Хиггс не обманывает, а действительно дает что-то бесплатно

Генератором фотографий Soul можно пользоваться бесплатно, дают 30 кредитов в день на это дело
Но только по входной картинке или тексту. Бесплатно создать персонажа не дадут.

Генерим здесь

#personalization #referencing #photoreal
👍52😁1
LanPaint + Qwen-Image-Edit / Wan 2.2 T2I

В думающий инпейнтер картинок LanPaint добавили поддержку Wan 2.2 T2I и QIE

Несколько часов назад навалили новых workfow в репозиторий

Я сравнил на одном примере голый QIE / QIE с инпентинг лорой / LanPaint QIE

LanPaint безумно долгий на стандартных 5 шагах — 15 минут без ускоряющей лоры 512х512 на 4060Ti
С восьмишаговой лорой - 12 минут

За это время он делает несколько попыток и что-то там оценивает и переделывает. В комфи можно наблюдать его версии на иконке в очереди инференса - они обновляются на каждом шаге.

Но вот по качеству инпейнтинга он явно выигрывает у остальных вариантов.
Это только на одном примере, кто знает, может на других примерах будет иначе

Старый воркфлоу LanPaint QI у меня работает лучше чем новый LanPaint QIE

#inpainting #qwenimage #wan22 #workflow #comparison #shootout
👍7🤔4🔥1🍾1
This media is not supported in your browser
VIEW IN TELEGRAM
Убегая от вооруженного базукой робота, лучи поноса направляйте по адресу китайских студентов из Чунциня

#robot
😁12😐8🍾51👍1
Tongyi DeepResearch

Первый полностью открытый веб-агент, который демонстрирует результаты, сопоставимые с DeepResearch от OpenAI. Модель от Alibaba способна решать сложные задачи, связанные с поиском информации и рассуждениями

Работает в двух режимах: Native ReAct Mode для стандартного рассуждения и Heavy Mode для сложных многоэтапных исследовательских задач

Умеет решать комплексные задачи, например, планировать путешествия с учётом специфических требований или проводить юридические исследования, анализируя судебную практику и законы.

Гитхаб
HF

#deepresearch #agent #assistant
👍8🔥1
Postshot v1

Вышел из беты инструмент полного цикла для работы с полями света (нерфы, гауссианы)

Бета лицензия превратится в бесплатный тариф 26 сентября. На бесплатном тарифе рендер с вотермаком, входные изображения ограничены 8 бит.

На двух платных тарифах предлагают экспорт в .PLY, поддержку исходников 4K и HDR (16bit or 32bit) и прочие плюшки.

Так что бежим пользоваться всеми плюшками бесплатно - осталась неделя.

#gui #tools #gaussian #nerf #windows #desktop
👍42😭1