NEW BOT Телеграм, страница

Love. Death. Transformers.

Ссылка на очередную поучительно забавную историю про то как сео слегка поимел сотрудников(нет)

Где то в Лондоне в это время:

👍11🤡2❤1🤮1

4.29K views06:39

Love. Death. Transformers.

#промо
Академия Data Science от Тинькофф!

Учитесь у лучших экспертов Тинькофф и других ИТ-компаний в современном кампусе в центре Москвы. Подойдет студентам технических вузов, начинающим ИТ-специалистам и всем, кто мечтает о карьере в Data Science.
Подробнее здесь: https://l.tinkoff.ru/master.ds.2023

💩34❤3👍3👌2

4.35K viewsedited 07:23

Love. Death. Transformers.

Иронично как сильно порнушные LORA адаптеры продвинули генерацию изображений, у людей была ПИЗДАТАЯ мотивация, оцените пальцы, а это ведь sd1.5 обычная.
~~Вообще удивительно как сильно порнушные text модели отстают от t2i, сразу чувствуется мотивации не хватает~~
С каждым днем все сильнее верю в то что модель которая побьет gpt4 будет страшным мержем LORA моделей с classifier free guidence

😁60❤‍🔥7🤣6🍾3

4.97K views15:24

Love. Death. Transformers.

Чат, расскажите какими text2image API (обратите внимание API) вы пользуетесь, чего не хватает, для чего пользуетесь

4.35K views17:07

Love. Death. Transformers.

🤔24😁5✍1

4.42K views19:08

Love. Death. Transformers.

#чтивонаночь

Казалось бы, может ли без тюна, простым алгоритмом генерации с LLama7b побить PALM 540B на бенче LAMBAD где топят жирные модели?
Может если применить методы из диффузий, подробнее в сегодняшнем посте

читать сюда
arxiv

Teletype

Stay on topic with Classifier-Free Guidance

Все SD фаны ща такие CFG(classfier free guidence) БЛЯТЬ ЭТО МОЕ АААААА, и будут правы, это подход благодаря которому diffusion работает...

🔥24⚡4🥱2💊2

4.98K viewsedited 19:57

Love. Death. Transformers.

😁78⚡9❤5👍3😢3🥴3🔥1🍌1

5.61K views16:38

Love. Death. Transformers.

Forwarded from Сиолошная

Новость одной строкой: ходят слухи, что META готовит релиз LLAMA-2, причём, с коммерческой лицензией на использование. И модель, конечно, будет умнее, дополнительно натренирована на коде (и как будто даже изображениях!).

Ждём всем опенсурс-сообществом!

(сори, вышло больше одной строки)

Источник

🔥48👍4❤2

4.06K views20:54

Love. Death. Transformers.

Программисты идут работать в банки

❤76😁16👎1

5.47K views17:28

Love. Death. Transformers.

Forwarded from Нейропекарня

🍓44🤡8🔥4🍌3☃1👎1🌭1

4.48K views19:53

Love. Death. Transformers.

#чтивонаночь по быстрому
RLTF: Reinforcement Learning from Unit Test Feedback
Ну короче, yet another RL paper, толльок тут используются Unit test signal, те код комплиться, выполняется, на выходе три вида ответа: Error, F ailure или Pass, решаем или нет и кормим фидбек + ревард дискретный и бьет модель по бошке за любые ошибки что позволяет не скатываться в низкий ревард ловушку.

ну и бонусом это все выдает SOTA на MBPP(ну типа prompt - code - unit test)

paper
код

❤19❤‍🔥6👍4🤮1

7.07K views16:44

Love. Death. Transformers.

Forwarded from AbstractDL

🔥FlashAttention-2: опять в два раза быстрее

Вот это подарок! Авторы FlashAttention смогли его оптимизировать ещё сильнее, приближая скорость внимания к теоретическому пределу — ускорение как на инференсе, так и на обучении в 5 раз по сравнению с обычным торчём!

Статья, GitHub

🔥60⚡6✍4❤2🤩2❤‍🔥1👍1

3.81K views06:30

Love. Death. Transformers.

AbstractDL

🔥FlashAttention-2: опять в два раза быстрее Вот это подарок! Авторы FlashAttention смогли его оптимизировать ещё сильнее, приближая скорость внимания к теоретическому пределу — ускорение как на инференсе, так и на обучении в 5 раз по сравнению с обычным торчём!…

~~Максимальное сжатие по вайсману?~~
Если кто то не знал, то gpu используются при обучении в лучшем случае на 50% от теоретического максимума, для того чтобы стать ближе к нему любят всякие страшные хаки - tensor/pipeline paralel, flash attention и прочие: а чо то у меня не работает.

Оригинальный флеш получал основное ускорение за счет простой идеи: мы используем поблочное умножение для Q,V + хранили экспоненты для вычисленных значений, что позволяло экономить на IO.
При этом еще вычисляют все слои внутри одного cuda kernel что экономит на IO + используют быстрый L2 L3 cache.

Второй flash attention ~~это почти алгоритм из центра наружу~~, авторы выкинули экспоненты и высчитаывают градиенты на слой по диагональным статистикам + только в конце каждой итерации умножения они скейлят градиенты(из block matmul)
+ вместо хранения сум экспонент они хранят только logsumexp;

красивое....

⚡36❤10👍2👨‍💻2🔥1

4.43K views09:43

Love. Death. Transformers.

Forwarded from что-то на DL-ском

история о том, как чуваки, применив наработки deepmind в сфере transfer learning, обучили CodeBert взяв за основу RoBERTa используя только адаптеры

Описанное выше на самом деле находится в этой статье, где авторы делятся опытом transfer learning с помощью адаптеров для создания мультимодальной модели (язык - код). А подводка следующая☕️:

Все наверняка уже слышали по 10050 раз, особенно в последнее время о том, что такое адаптер (2019). Но если вспомнить базовый механизм за счет которого все работает, то можно описать следующим образом: берем доп слой, вставляем где-то между слоями исходной модели, и обучаем, замораживая исходные веса. Это позволяет моделе узнавать новые задачи, при этом тратя меньше ресурсов при обучении.

В какой-то момент, изначально в CV, поняли. что можно обучить много адаптеров (каждый на определенную задачу), а потом использовать знания от всех и решать тем самым мульти-таск. Это конечно очень крутая идея, но имеет недостаток в виде забывчивости из-за разного веса каждого адаптера. Тогда приходят люди из deepmind и говорят о том, что вот есть некий подход AdapterFusion (2021), который направлен на то, чтобы решить эту проблему следующим образом в 2 стадии: сначала помимо параметров, обучаеммых в каждом из адаптеров, обучается и еще отдельный параметр, который учится запоминать, что за адаптер мы используем в данный момент, а на втором шаге мы учим с помощью неожиданно, но факт механизма внимания, комбинировать вместе все адаптеры. Собственно вся эта конструкция располагается между двумя residual connection

Итак, к чему мы вообще заговорили про комбинирование многих адаптеров вместе. Через некоторое непродолжительное время Deepmind пошли дальше и придумали подход MAD-X, способный за счет адаптеров не только реализовать cross-task модели, но и cross-lingual. Так как обычный pipeline тренировки (когда мы обучаем на новом языке модель с MLM, чтобы выучить язык) ведет опять же к забывчивости модели, ребята откапытвают свой подход FusionAdapter и модифицируют его еще и на обучаемость новым языкам. Теперь подход состоит уже из 3 частей. Adapter-L (адаптер языковой), который по расположению берет свою идею из предыдущей стать и располагает также после residual connection; Adapter-T, который идейно похож на Adapter-L, но располагается после нескольких языковых адаптеров и Invertible Adapters, который направлен на захват преобразований, специфичных для языка на уровне токенов. Идея такая: все эти адаптеры обучаются совместо, естл адаптер языка нового и языка, который уже был в модели, это касается и инфертированного адаптера. При инференсе мы можем отключать один из языков и подавать output от него в адаптер задач. Тем самым модель будет способна решать задачи на разных языках

Возвращаясь к тренировки СodeBert с помощью MAD-X. Они обучили Adapter-L на каждый из языков программирования, представленных в модели CodeBert и 2 задачи, используемые в модели на pretrain (Masked Language Modeling (MLM) – идея из оригинальной статьи BERT и Replaced Token Detection (RTD) – идея из оригинальной статьи ELECTRA). В итоге они получили весьма сравнительные результаты используя лишь адаптеры

🖥

Репозиторий с библиотекой адаптеров

🖥

Код экперементов чуваков

Please open Telegram to view this post

VIEW IN TELEGRAM

🆒17👍6🔥4⚡2❤2

3.81K views15:17

Love. Death. Transformers.

Forwarded from Мишин Лернинг

🦙 Llama 2 — Meta обучили и опенсорснули новую LLM Llama 2 (и внимание!) для коммерческого использования

Обучили 2 группы моделей: Llama 2 и Llama 2-Chat:
— Llama 2 обучена на открытых данных (размер корпуса увеличилина 40% в сравнение с Llama 1), удвоили контекст, используя adopted grouped-query attention (Ainslie et al., 2023).
— Llama 2-Chat это зафайтюненная с помощью RLHF (Reinforcement learning from human feedback) версия Llama 2, оптимизированная для диалогов (как Chat-GPT или GPT-4)

Опенсорснули Llama 2 с параметрами:
— Llama2-7B
— Llama2-13B
— Llama2-70B
Обидно то, что еще обучали Llama2-34B модель, но не зарелилзили. Именно там самый высокий TruthfulQA = 67.20, против 64.14 у Llama2-70B

Лицензия позволяет юзать Llama-2 не только для ресерча, но и для коммерческих целей!

По метрикам это лучшая опенсорс LLM-ка, а по качеству Llama2-Chat-70B, местами, сопоставимая с Chat-GTP 3.5

📄 Paper
📇 Blog
💻 Download Llama2

🔥26👍2

3.53K views17:26

Love. Death. Transformers.

Мишин Лернинг

🦙 Llama 2 — Meta обучили и опенсорснули новую LLM Llama 2 (и внимание!) для коммерческого использования Обучили 2 группы моделей: Llama 2 и Llama 2-Chat: — Llama 2 обучена на открытых данных (размер корпуса увеличилина 40% в сравнение с Llama 1), удвоили…

how opensource feels in middle 2023:

я не выложил две модели с llama1 они уже устарели...

💯39❤4👾4

4.18K viewsedited 17:36

Love. Death. Transformers.

Ура, пиратские версии llama на Hf, забираем и го учить новое!

7B
13B

🔥44🌚3😐2❤1👍1🤡1🥴1

4.43K views08:24

Love. Death. Transformers.

I believe in Kandinskiy supremacy

🔥48🤡19👍3🤮2

4.37K views09:18

Love. Death. Transformers.

Будущее игр.

Уже сейчас музыка подстраивается под вас, тикток-инст-ютуб подкидывает супер релевантный контент, но этого кажется не достаточно.
Будущее развлечений - генеративные игры где все от текстур до механик, сценария, геймплея - сгенерированно, миры меняются на основе того что вы пишете и все это работает на банальном openai api + другие генераторы!

game

🔥20👎2🤯2🥱2👍1🌚1

4.61K views12:47

About

Blog

Apps

Platform