NEW BOT Телеграм, страница

Machinelearning

📓Free book: "Build an LLM from Scratch"

Один из лучших способов разобраться в LLM - это написать ее с нуля!

Сегодня вышла новая глава книги - "Chapter 5: Pretraining on Unlabeled Data".

Автор книги - Себастьян Рашка, известный Исследователь, популяризатор машинного обучения и автор книг по Deep Learning.

В этой главе рассматриваются:
- Оценка качества текста, сгенерированного LLM во время обучения
- Реализация функции обучения и настройка LLM
- Сохранение и загрузка весов для обучения LLM
- Загрузка предварительно подготовленных весов из OpenAI

▪ Github

@ai_machinelearning_big_data

👍34🔥15❤6

12.6K views16:03

Machinelearning

✨ HairFastGAN: Realistic and Robust Hair Transfer with a Fast Encoder-Based Approach

Новая модель для переноса прически с эталонного изображения на исходную фотографию для виртуальной примерочной.

▪ Paper: https://arxiv.org/abs/2404.01094
▪Code: https://github.com/AIRI-Institute/HairFastGAN
▪Colab: https://colab.research.google.com/#fileId=https%3A//huggingface.co/AIRI-Institute/HairFastGAN/blob/main/notebooks/HairFast_inference.ipynb

@ai_machinelearning_big_data

👍30🔥7❤2🤷‍♀1

9.12K views10:02

Machinelearning

🖥

GitHub Copilot в CLI теперь общедоступен (вышел из беты)

Относительно недавно GitHub Copilot объявил об общедоступности своего расширения интерфейса командной строки (CLI). Это обновление расширяет функциональность Copilot на терминал, позволяя пользователям получать выгоду от его функций непосредственно в рабочем процессе.

Новые функции Copilot CLI:
⏩Теперь Copilot может предлагать команды на основе пользовательского ввода, а также выполнять эти команды

⏩Помимо предложений на основе пользовательского ввода, Copilot будет предоставлять пояснения к существующим командам

⏩Новые вспомогательные псевдонимы доступны для оболочек Bash, PowerShell и Zsh. Эти псевдонимы, созданные командой gh copilot alias, предоставляют сокращения для часто используемых функций Copilot:
• ghcs – выполняет предложенные команды
• ghce — объясняет существующие команды

📎

Подробнее

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

❤19👍13🔥9😨1

8.36K views12:04

Machinelearning

⚡️

GitHub — mshumer/gpt-llm-trainer

• Цель gpt-llm-trainer — упростить процесс обучения модели.

• Система сгенерирует набор данных с нуля и настроит модель LLaMA 2 или GPT-3.5 для пользователя. Генерация набора данных осуществляется с использованием Claude 3 или GPT-4.

• После генерации набора данных система автоматически разделит его на обучающий и проверочный наборы и настроит модель.

• Для использования системы необходимо написать промпт и задать температуру и количество примеров для генерации.

• Обученная модель может быть протестирована с использованием ячеек логического вывода или сохранена на Google Диск.

🖥

GitHub 3.8k⭐️

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

Please open Telegram to view this post

VIEW IN TELEGRAM

👍28🔥9❤4

9.06K views14:04

Machinelearning

⚡️

Stability AI расширила доступ к тестированию Stable Diffusion третьего поколения

⏩Следующее поколение генерирующей изображения по текстовой подсказке ИИ-модели Stable Diffusion пока не запущено публично, но уже доступно некоторым разработчикам через API и новую платформу для создания контента, а также платформу для разработчиков. Для организации доступа к ИИ по API Stability AI объединила усилия с API-платформой Fireworks AI.

⏩По словам разработчиков, новое поколение Stable Diffusion «не уступает, либо превосходит» другие подобные модели, вроде DALL-E 3 от OpenAI и Midjourney «в понимании и соблюдении запросов». Stable Diffusion 3 использует архитектуру Multimodal Diffusion Transformer, которая должна улучшить понимание текста и орфографии.

⏩Новая платформа для создания контента Stable Assistant Beta — это «дружелюбный чат-бот», позволяющий платным подписчикам работать с передовыми ИИ-моделями Stability AI, генерировать изображения и писать тексты. Пока платформа находится в стадии закрытого тестирования ограниченной группой пользователей и недоступна для широкой публики. В очередной раз расширив доступность своих продуктов, компания подчеркнула, что «принимает разумные меры для предотвращения неправомерного использования Stable Diffusion 3 злоумышленниками».

📎

Подробнее

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

👍20❤6🔥6🌭1

8.47K views09:01

Machinelearning

🌟

Не разрешают использовать ChatGPT — разворачивам LLM локально

Бывают ситуации, когда жизненные обстоятельства не позволяют использовать ChatGPT и приходится разворачивать LLM локально.
Что в этом случае можно использовать?

1. Проприетарные модели:

🟡

Anthropic – в настоящее время сравним или превосходит по качеству ChatGPT 4.0 на некоторых задачах и обладает большим контекстным окном, давая возможность решать многие задачи, не прибегая к RAG и другим гибридным методам

🟡

Yandex GPT – хорошо функционирует на русском языке, поэтому если ваша бабушка еще и майор – она точно оценит этот вариант

🟡

GigaChat – модель от Сбера, так же хорошо работает на русском и смотри пункт выше

2. Открытые модели:

🟡

LLama 2 – оригинальная открытая модель от известной террористической организации, на базе которой уже нагородили over 100500 разных моделей, за что этой организации большое спасибо (до сих пор никто не понимает, что подвигло Марка на данное решение). По качеству не дотягивает до ChatGPT 4.

🟡

ruGPT – претрейн от GigaChat под лицензией MIT, Сбер приложил руку и тут, спасибо им. Можно использовать

🟡

Mistral – модель, разработанная выходцами из Гугла во Франции. Качество не дотягивает до ChatGPT 4, но в среднем лучше, чем Llama 2.

🟡

Falcon – модель разработана на арабские деньги европейцами. В целом, послабее Llama 2, и смысл ее использования от меня ускользает.

🟡

Grok от X – предположительно "based" модель от самого Илона. Работает пока так себе, плюс-минус на уровне ChatGPT 3.5, но Илон обещает порвать всех на тряпки и есть причины ему верить.

Оценки моделей на текущий момент выглядят примерно так (на изображении)

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

❤25👍22😁6🥱3❤‍🔥2🔥1🥰1🤷1

9.44K views13:22

Machinelearning

⚡️ 💻 AutoCodeRover: Autonomous Program Improvement

AutoCodeRover - это полностью автоматизированный инструмент для исправления ошибок на GitHub (исправление ошибок в разделе issues и генерации новых функций в проект).

AutoCodeRover работает в два этапа:

🔎 Поиск контекста: LLM анализирует код для собирает контекст.
💊 Генерация исправлений: LLM переписывает код на основе полученного контекста.

AutoCodeRover уже решает ~16% ошибок на датасете SWE-bench и ~22% ошибок SWE-bench lite и продолжает совершенствоваться.

▪Github
▪Paper

@ai_machinelearning_big_data

👍18🔥4❤2😎1

9.78K views14:07

Machinelearning

0:56

This media is not supported in your browser

VIEW IN TELEGRAM

👑Llama 3 is here, with a brand new tokenizer! 🦙

Вышла Llama 3

Сегодня вышла новая SOTA Llama 3 в двух версиях на 8B и 70B параметров.

Длина контекста 8К, поддержка 30 языков.

•HF: https://huggingface.co/spaces/ysharma/Chat_with_Meta_llama3_8b
•Blog: https://ai.meta.com/blog/meta-llama-3/

Вы можете потестить 🦙 MetaLlama 3 70B и 🦙 Meta Llama 3 8B с помощью 🔥 бесплатного интерфейса: https://llama3.replicate.dev/

P.S. В процессе обучения находится модель на 400В+ параметров.

@ai_machinelearning_big_data

👍26🔥12❤5🥱1

40.9K viewsedited 17:44

Machinelearning

🔥

Нейросети без цензуры: какие LLM ответят на любые вопросы

🟡

FuseChat-7B-VaRM. Хороший вариант для общения, без цензуры и ограничений. По сути, это три чат-бота, объединенных в один, каждый со своими особенностями. Это значит, что пользователь получает интересные беседы независимо от того, о чем хочет поговорить.

🟡

Chimera-Apex-7B. Создана для обычных разговоров и генерации не совсем обычных идей. Хороший приятель для мозгового штурма, который не боится быть немного диким. Все еще находится в стадии разработки, так что еще можно ждать сюрпризов.

🟡

Dolphin-2.8-experiment26-7b. Это тонкая настройка экспериментальной модели, которая зарекомендовала себя как лучшая с 7 млрд параметров. Это как усовершенствованная версия модели, в которой устранены все недостатки и оптимизирована производительность.

🟡

Nous-Hermes-2-Mistral-7B-DPO. Эта модель представляет собой значительное улучшение: она демонстрирует повышенную производительность в различных бенчмарках по сравнению со своими предшественниками. Особого внимания заслуживает ее применение в средах без цензуры. Сфокусирована на предоставлении качественных ответов, основанных на данных, что делает ее отличным кандидатом для тех, кто ищет продвинутые, неограниченные возможности LLM.

🟡

UNA-TheBeagle-7b-v1. Обучена на наборе данных The Bagel с использованием прямой оптимизации предпочтений (DPO) и UNA. Модель основана на нейро-чате Intel.

🟡

Nous Hermes 2 — SOLAR 10.7B. Новая модель от Nous Research, основанная на SOLAR 10.7B. Обучена на большом датасете, который состоит в основном из данных, сгенерированных GPT-4, и дополнительных ресурсов. По бенчмаркам почти достигла уровня производительности модели Yi-34B. Работает с системными промтами, что дает возможность пользователям определять правила, роли.

🟡

Dolphin 2.6 Mistral 7b — DPO Laser. Это языковая модель без цензуры, основанная на работе LASER. Благодаря более широкому контекстному окну в 16 тыс. токенов и таким передовым методам, как SVD и RMT, эта модель без цензуры выдает более надежные результаты, чем ее предшественники. Она идеальна для ролевых сценариев благодаря широкому диапазону ответов.

🟡

Dolphin-2.2.1-mistral-7b. Разработана Эриком Хартфордом и спонсируется a16z. Работает под лицензией Apache-2.0 и представляет собой универсальный инструмент как для коммерческих, так и для некоммерческих приложений. Одной из особенностей Dolphin-2.2.1-mistral-7b считается ее стремление к развитию содержательного общения. Набор данных был тщательно отфильтрован, чтобы устранить любую предвзятость, благодаря чему модель стала более послушной и может обеспечить нейтральный и открытый подход к генерации текста.

🟡

Zephyr 7B Alpha. Начальная итерация в серии больших языковых моделей Zephyr, известной своей емкостью в 7 млрд параметров. Эта версия mistralai/Mistral-7B-v0.1, усовершенствованной в процессе тонкой настройки с использованием комбинации общедоступных и синтетических наборов данных по методологии, известной как прямая оптимизация предпочтений (DPO).

🟡

Emerhyst-20B. Эта языковая модель без цензуры объединяет в себе сильные стороны двух популярных моделей, Amethyst 13B и Emerald 13B. Такой подход позволяет основной модели унаследовать лучшие черты от своих «родителей», создавая универсальный и эффективный генератор текстов. Для дальнейшего расширения возможностей Emerhyst-20B создатели использовали LimaRP v3, передовой инструмент для обучения больших языковых моделей.

Enjoy)

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

👍25🔥9❤4🥱1

10.4K viewsedited 07:00

Machinelearning

👍29🔥7❤3

13.6K views09:07

Machinelearning

🦙 Файнтюниг Llama 3 с помощью ORPO.

Краткое руководство о том, как настроить новую модель Llama 3 8B с ORPO.

Надеюсь, вам понравится!

🤗 Модель: https://huggingface.co/mlabonne/OrpoLlama-3-8B
💻 Colab: https://colab.research.google.com/drive/1eHNWg9gnaXErdAa8_mcvjMupbSS6rDvi?usp=sharing
📝 Статья: https://huggingface.co/blog/mlabonne/orpo-llama-3

@ai_machinelearning_big_data

👍16🔥10❤3

10.1K viewsedited 13:10

Machinelearning

Студенты факультета компьютерных наук ВШЭ, основанного совместно с Яндексом, выиграли чемпионат мира по программированию ICPC.
Соревнования проходили в Египте, причем как для 2022, так и для 2023 года. Российские студенты заняли призовые места сразу в двух соревнованиях.
За 2023 год абсолютными чемпионами стала команда FFTilted (к слову, ребята с программы Прикладной математики и информатики, которую основал на факультете Яндекс). Ее участники — Фёдор Ромашов, Александр Бабин и Кирилл Кудряшов. За 2022 год команда Undertrained+Overpressured заняла третье место в абсолютном зачете. Ее представляли Максим Гороховский, Иван Сафонов и Тимофей Федосеев.
Команды показали лучший результат среди всех российских вузов. Всего в соревнованиях приняли участие команды из 170 университетов и 50 стран мира.

❤65🔥24👍19🥱6🤬5🤣2❤‍🔥1🗿1

9.66K views16:50

Machinelearning

🦾 🦏 Power of matplotlib

Вот такую красоту можно сделать с помощью matplotlib. Это визуализация гравюры немецкого художника Альбрехта Дюрера, изображающая индийского носорога, каким его представлял художник по доступным ему описаниям и рисункам в 1515.

Хотите научиться та к же: вот крутая бесплатная книга: "Научная визуализация: Python + Matplotlib"

Исходники книги c примерами кода лежат здесь.

▪Постер
▪Книга
▪Код из книги

@ai_machinelearning_big_data

❤39👍16🔥10🥰4

12.6K viewsedited 20:03

Machinelearning

⚡️

Стартап Reka показал новую мультимодальную LLM Reka Core

🟡Стартап Reka, основанный бывшими разработчиками DeepMind, представил свою последнюю разработку в области искусственного интеллекта — мультимодальную языковую модель (LLM) под названием Reka Core. Эта передовая нейросеть способна обрабатывать текст, изображения, аудио и видео, чем выделяется среди других технологий в своем классе.

🟡Reka Core обладает впечатляющим контекстным окном на 128 000 токенов и поддерживает обработку данных на 32 языках, что делает её одной из самых мощных и универсальных систем на рынке. Эта функциональность открывает новые возможности для разработчиков и исследователей в области ИИ, позволяя модели эффективно справляться с задачами обработки больших объемов разнообразных данных.

🟡В ряде мультимодальных оценок Reka Core продемонстрировала результаты, превосходящие показатели таких известных моделей, как Claude 3 Opus и Gemini Ultra. Особенно заметно это стало в области обработки видеоконтента, где Reka Core вышла на первое место, превзойдя Gemini Ultra. Кроме того, модель показала конкурентоспособные результаты с GPT-4 в задачах по пониманию изображений, что свидетельствует о высоком качестве и универсальности разработки.

🟡Компания Reka активно сотрудничает с такими гигантами, как Oracle и Snowflake, что позволяет ей расширять свои возможности и укреплять позиции на рынке.

▶️

Сайт Reka.ai (можно сразу открыть чат)

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

👍30🔥12❤8

10.3K views08:02

Machinelearning

📌

Intel представила нейроморфный компьютер Hala Point — «искусственный мозг» с 1,15 млрд нейронов

🟡Компания Intel создала самый большой в мире нейроморфный компьютер под названием Hala Point. Это революционное устройство, предназначенное для имитации деятельности человеческого мозга. Производитель утверждает, что новинка в 50 раз превосходит любые аналогичные вычислительные системы, но при этом потребляет в 100 раз меньше энергии.

🟡Устройство построено на базе 1152 чипов Loihi 2 с 140 544 вычислительными ядрами и содержит в себе 1,15 млрд «искусственных нейронов», способных выполнять до 380 трлн синаптических операций в секунду. Еще в состав Hala Point включены 2300 упрощенных x86-процессоров, предназначенных для выполнения вспомогательных операций.

🟡При этом общая пропускная способность памяти устройства достигает значения в 16 ПБ/с. Все это помещено в довольно компактный корпус, напоминающий по размерам микроволновую печь. Потребление устройства составляет 2600 Вт. По словам разработчиков, их система является кремниевым аналогом мозга совы.

🟡Hala Point способна достигать впечатляющей вычислительной эффективности, превышающей 20 квадриллионов 8-битных операций в секунду при развертывании глубоких нейросетей. Стоит отметить, что данная система существует в виде прототипа, а Intel пока не планирует отправлять ее в массовое производство. Единственный экземпляр Hala Point находится в Сандийских национальных лабораториях в США. Местные ученые будут использовать его для исследований в области нейронных сетей.

📎

Подробнее

@ai_machinelearning_big_data

Please open Telegram to view this post

VIEW IN TELEGRAM

Please open Telegram to view this post

VIEW IN TELEGRAM

👍34🔥15❤6⚡1😁1🗿1

9.02K views09:03

About

Blog

Apps

Platform