👍11🤔1
nunchaku-qwen-image-edit-2509
Поддержка нового #QIE в nunchaku
Поддержка LoRA / FP16, а так же WAN2.2 - ждем
HF
воркфлоу (ComfyUI ≥ 0.3.60)
Спасибо @MaxKhtv
#optimization #imageediting #workflow
Поддержка нового #QIE в nunchaku
Поддержка LoRA / FP16, а так же WAN2.2 - ждем
HF
воркфлоу (ComfyUI ≥ 0.3.60)
Спасибо @MaxKhtv
#optimization #imageediting #workflow
👍12🔥3❤2
Media is too big
VIEW IN TELEGRAM
Qwen3-VL: Sharper Vision, Deeper Thought, Broader Action
Визуально-языковая модель, которая не просто «видит» изображения и видео, но и понимает мир, интерпретирует события и способна действовать.
Есть две версии: Instruct и Thinking. Instruct лучше Gemini 2.5 Pro в работе с визуальными задачами, а Thinking отлично справляется с мультимодальным рассуждением.
Возможности:
- управляет интерфейсами на ПК и телефонах
- превращает скриншоты в код (HTML/CSS/JS)
- интерпретирует пространственные отношения, планирует движения и подходит для применения в робототехнике и автономных системах
- определяет объекты в сложных сценах и поддерживает предсказание 3D-границ
- узнаёт знаменитостей, еду, растения, животных, бренды автомобилей и аниме-персонажей
- анализирует несколько изображений, сравнивает их и поддерживает контекст в многоходовых диалогах
- описывает видео кадр за кадром и отвечает на вопросы о содержании
- распознает текст на 32 языках, даже если он размыт или наклонён
- показывает отличные результаты в STEM и математике
Код
Демо
HF
Чат
API
#VLM #OCR #assistant #reasoning #video2text #image2text #chat
Визуально-языковая модель, которая не просто «видит» изображения и видео, но и понимает мир, интерпретирует события и способна действовать.
Есть две версии: Instruct и Thinking. Instruct лучше Gemini 2.5 Pro в работе с визуальными задачами, а Thinking отлично справляется с мультимодальным рассуждением.
Возможности:
- управляет интерфейсами на ПК и телефонах
- превращает скриншоты в код (HTML/CSS/JS)
- интерпретирует пространственные отношения, планирует движения и подходит для применения в робототехнике и автономных системах
- определяет объекты в сложных сценах и поддерживает предсказание 3D-границ
- узнаёт знаменитостей, еду, растения, животных, бренды автомобилей и аниме-персонажей
- анализирует несколько изображений, сравнивает их и поддерживает контекст в многоходовых диалогах
- описывает видео кадр за кадром и отвечает на вопросы о содержании
- распознает текст на 32 языках, даже если он размыт или наклонён
- показывает отличные результаты в STEM и математике
Код
Демо
HF
Чат
API
#VLM #OCR #assistant #reasoning #video2text #image2text #chat
🔥5
А также Qwen3-Max и Qwen3-Coder
Qwen3-Max — крупнейшая модель от Qwen:
— решает задачи программирования (69,6 баллов на SWE-Bench Verified);
— работает с агентами (74,8 балла на Tau2-Bench);
— достигает 100% на тестах AIME 25 и HMMT.
Qwen3-Coder обновили. Добавили мультимодальность + прокачали. На SWE-Bench теперь почти 70% —примерно уровень Opus 4 и GPT-5
Обе можно попробовать в чате
#reasoning #assistant #coding
Qwen3-Max — крупнейшая модель от Qwen:
— решает задачи программирования (69,6 баллов на SWE-Bench Verified);
— работает с агентами (74,8 балла на Tau2-Bench);
— достигает 100% на тестах AIME 25 и HMMT.
Qwen3-Coder обновили. Добавили мультимодальность + прокачали. На SWE-Bench теперь почти 70% —примерно уровень Opus 4 и GPT-5
Обе можно попробовать в чате
#reasoning #assistant #coding
❤4🤔1
Wan 2.5-Preview
Мульитмодальный, сочетает в себе не только генерацию, но и понимание видео
генерирует синхронизированный аудио-видео контент
1080p, 10 секунд
Умеет создавать и редактировать изображения и видео, упомянут диалоговый режим - привет банан, реве и компания.
Попробовать на офсайте
PS прощай опенсорс???
#text2video #image2video #text2image #imageediting #text2speech
Мульитмодальный, сочетает в себе не только генерацию, но и понимание видео
генерирует синхронизированный аудио-видео контент
1080p, 10 секунд
Умеет создавать и редактировать изображения и видео, упомянут диалоговый режим - привет банан, реве и компания.
Попробовать на офсайте
PS прощай опенсорс???
#text2video #image2video #text2image #imageediting #text2speech
🔥12🤔3❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Rodin Gen-2
Rodin разродился Gen-2
- качество сетки улучшено вчетверо
- рекурсивная генерация частей
- запекание тяжелых мешей в лоуполи с нормалями
- HD текстуры (Бета)
Ну и никуда не делись PBR, 3D контролнеты, T/A позы
#3d #imageyo3d #textto3d #3dediting
Rodin разродился Gen-2
- качество сетки улучшено вчетверо
- рекурсивная генерация частей
- запекание тяжелых мешей в лоуполи с нормалями
- HD текстуры (Бета)
Ну и никуда не делись PBR, 3D контролнеты, T/A позы
#3d #imageyo3d #textto3d #3dediting
❤3👍2😁1
Media is too big
VIEW IN TELEGRAM
VideoFrom3D: 3D Scene Video Generation via Complementary Image and Video Diffusion Models
Создает видео 3D сцен по грубой геометрии, траектории камеры и референсной картинке. Этакий ИИ-рендер 3D.
Под капотом зафантюненный CogVideoX и для начального кадра Flux ControlNet и еще набор каких-то методов.
Код
#3d2video #rendering
Создает видео 3D сцен по грубой геометрии, траектории камеры и референсной картинке. Этакий ИИ-рендер 3D.
Под капотом зафантюненный CogVideoX и для начального кадра Flux ControlNet и еще набор каких-то методов.
Код
#3d2video #rendering
🤷♂3👍3🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
А вот и официальный метод файнтюна говорилки VibeVoice
При файнтюне на один голос можно отключить возможность клонирования голоса, тогда результаты для этого голоса будут лучше. Но клонирование уже не будет работать на инференсе
#podcast #voicecloning #tts #text2speech #text2podcast #finetuning #lora
При файнтюне на один голос можно отключить возможность клонирования голоса, тогда результаты для этого голоса будут лучше. Но клонирование уже не будет работать на инференсе
#podcast #voicecloning #tts #text2speech #text2podcast #finetuning #lora
❤5
WAN2.2 Animate & Qwen-Image-Edit 2509 Native Support in ComfyUI
Поддержка последних новинок.
Wan 2.5 поддерживается по API
Всякие воркфлоу по ссылке в заголовке
#workflow #referencing #imageediting #image2video
Поддержка последних новинок.
Wan 2.5 поддерживается по API
Всякие воркфлоу по ссылке в заголовке
#workflow #referencing #imageediting #image2video
🔥8
Moving by Looking: Towards Vision-Driven Avatar Motion Generation (CLOPS)
Позволяет аватару двигаться в 3D сцене, ориентируясь на визуальные наблюдения от первого лица.
Система создаёт цикл визуального восприятия и человекоподобного движения.
Вероятно, применимо в играх и роботах
Код ждем
#animation #humananimation
Позволяет аватару двигаться в 3D сцене, ориентируясь на визуальные наблюдения от первого лица.
Система создаёт цикл визуального восприятия и человекоподобного движения.
Вероятно, применимо в играх и роботах
Код ждем
#animation #humananimation
👍7
Чекните Hunyuan 3D Studio если вписывались в вейтлист
Мне выдали доступ, может и вам тоже
https://3d.hunyuan.tencent.com/studio/creation/prop/concept
#3d #3dediting #texture #pbr #uvmpping #characteranimation #animation
Мне выдали доступ, может и вам тоже
https://3d.hunyuan.tencent.com/studio/creation/prop/concept
#3d #3dediting #texture #pbr #uvmpping #characteranimation #animation
👍4