Data Start Conference / Программа / Онлайн трансляция / 20 октября 2020

Конференция
Программа

ФРАКТАЛЬНОСТЬ ФУНКЦИИ ПОТЕРЬ, ЭФФЕКТ ДВОЙНОГО СПУСКА И СТЕПЕННЫЕ ЗАКОНЫ В ГЛУБИННОМ ОБУЧЕНИИ - ФРАГМЕНТЫ ОДНОЙ МОЗАИКИ.

ДМИТРИЙ ВЕТРОВ

Профессор-исследователь НИУ ВШЭ (Факультет компьютерных наук), глава Лаборатории машинного обучения, SAIC MOSCOW.

За последние годы в глубинных нейронных сетях был обнаружен ряд необычных эффектов (двойной спуск, связность мод, "минные поля" в рельефе функции потерь, и др.), показавших, что сообщество плохо понимает, что происходит в процессе обучения нейронных сетей. В ходе доклада мы попробуем увязать ряд эффектов в единую гипотезу и обсудим результаты экспериментов, которые косвенно ее подтверждают

ИНФРАСТРУКТУРА ИЗВЛЕЧЕНИЯ ФАКТОРОВ В ПРОДЕ

МИХАИЛ ТРОФИМОВ

ML Engineer в Praxis Pioneering

Часто при разработке продукта возникает несколько команд, реализующих ML в проде. У каждой стоит задача подсчета факторов, сбора сэмплов, обучения моделей, выкатка моделей в прод, доставка факторов в прод, синхронизация оффлайна и онлайна. Зачастую, каждая команда решает эти задачи независимо, что приводит в конечном итоге к замедлению разработки. В своем докладе я расскажу, как общая инфрастуктура факторов може ускорить разработку, зачем это вообще надо и какие проблемы возникают при ее построении

«ПИТОНИСЬ НА ОТЛИЧНЕНЬКО»

МИХАИЛ СВЕШНИКОВ

ML Architect в Zyfra

Питон известен своим низким порогом входа и на нем действительно очень просто писать код. Однако это не значит, что на нем просто писать ХОРОШИЙ код. Я расскажу, что же это за зверь такой – хороший код на питоне, а так же покажу полезные приемы, которые помогут вам проще и быстрее писать на питоне и вообще поднимут ваше питон кунг-фу на новый уровень. Доклад будет интересен и тем, кто только собирается учить питон, и тем кто уже в познании питона настолько преисполнился, будто бы уже 100 триллионов миллиардов лет пишет код на триллионах и триллионах таких же языков

НОВИНКИ CATBOOST: ПОДДЕРЖКА ЭМБЕДДИНГОВ, ОБУЧЕНИЕ НА SPARK И ЭТО ЕЩЕ НЕ ВСЁ!

СТАНИСЛАВ КИРИЛЛОВ

Руководитель группы ML систем Яндекса

Как многим известно, градиентный бустинг на решающих деревьях остается SoTA на задачах, представимых в виде таблиц с признаками разной природы. До недавних пор CatBoost поддерживал 3 типа значений в колонках таких таблиц - вещественные признаки, категориальные и тексты.
Сегодня мы хотим презентовать возможность обучения на эмбеддингах объектов - вещественных векторах, показывающих положение объекта в каком-то семантическом пространстве.
Например, классическими примером эмбеддингов для текстов является word2vec, более новым - эмбеддинги трансформеров (BERT, GPT, etc). Мы расскажем о том, как именно CatBoost работает с такими векторами и как их использование может повысить качество ваших моделей.
Вторая важная новость, о которой мы расскажем - поддержка обучения на SPARK кластерах. Мы покажем, как реализована поддержка SPARK и как ей воспользоваться.
Ну и, конечно, это еще не все классные новости - еще мы расскажем о новых ускорениях и улучшениях, которые произошли с CatBoost за последние полгода

ИНСТРУМЕНТЫ ВИЗУАЛЗИАЦИИ В NLP: ОТ ГРАФОВ ЗНАНИЙ ДО BERT

ВАЛЕНТИН МАЛЫХ

Senior Research Scientist в Noah’s Ark Lab

Кажется, что нет более далекой области от визуализации, чем обработка текстов. Но на самом деле визуализации и тут могут во многом помочь. Я расскажу про работу с графами знаний, а также про то, какие можно получить знания изучая паттерны внимания модели BER

“КЛАССИЧЕСКОЕ” МАШИННОЕ ОБУЧЕНИЕ НА ТАБЛИЧНЫХ ДАННЫХ

АЛЕКСАНДР ФОНАРЕВ

Основатель компании Rubbles, data scientist, Ph.D. в области data science, лектор

В последние годы прикладное машинное обучение всё больше разделяется на два основных блока. Первый и наиболее хайповый — deep learning для обработки изображений, текста, звука и т. п. Второй, более старый, но не менее важный для бизнеса — “классический” ml для задач со табличными (структурированными) данными, использующийся для предсказания временных рядов, построения рекомендательных систем, предсказания поломок оборудования и многих других задач. В докладе мы погрузимся во второй блок: обсудим алгоритмы работы со структурированными данным, типизацию задач в этой области, практические кейсы, особенности индустрии сегодня и её развитие завтра.

КАК УСТРОЕН УМНЫЙ РОБОТ, УЛУЧШАЮЩИЙ КОЛЛ-ЦЕНТРЫ ЯНДЕКС

ТАТЬЯНА САВЕЛЬЕВА

Head of unstructured data analysis в Yandex.Taxi

В своем докладе расскажу про наш продукт для автоматизации и улучшения коллцентров. Как автоматизировать 80% первой линии поддержки так, чтобы робот был неотличим от человека, как понять какой текст лучше присылать пользователю, как раздавать промокодыс большей пользой для клиента и многое другое.

ПОЧЕМУ БИЗНЕС НЕ ХОЧЕТ ВНЕДРЯТЬ СОВРЕМЕННЫЕ ТЕХНОЛОГИИ?

ЕВГЕНИЙ ЛИМАРЕНКО

CIO группа компаний Gulliver&Co

Знакомая ситуация: приходишь в компанию или к коллегам в Коммерческий департамент, рассказываешь о крутом решении которую с парнями придумал и даже собрал MVP, а они смотрят, киваю головой и отказываются? Я расскажу вам, почему так происходит, как мыслят сотрудники бизнес подразделений и что нужно сделать, а что делать не надо, чтобы они хотели с вами работать

OPEN SOURCE IN THE WILD

МАКСИМ КОЧУРОВ

Инженер-исследователь в NTechLab

Все из нас (ну точно многие) пользуются библиотеками Numpy, Pandas, sklearn и так далее. Мир опен сорса очень огромен, там просиходят большие (и неочень) события, свои местечковые конференции, принимаются решения, которые влияют на нашу разработку.
Однако знакомы с этой "кухней" далеко не все. Стандарты разработки многих продуктов обычно высоки. Кажется, что попасть в опен сорс сложно или почти невозможно. Не понятно с чего начать. Куда писать? Куда коммитить и как это делать? А вообще, зачем оно вообще нужно, вливаться в этот опен сорс, это же работа за бесплатно?
Другие проблемы, которые уже несколько уровнем выше, возникают и куда более серьезны для развития проекта. Как взаимодействовать с пользователями? Как развивать комьюнити? Как добиваться узнаваемости и расширять пользовательскую базу?

Проблемы взаимодействия с другими проектами тоже не остаются в стороне. Это бывают отношения пользователь-проект или проект-проект. В каждом из случаев есть нюансы. Как повлиять на развитие проекта? Как добавить недостающую фичу? Как поправить багу в любимой библиотеке? И самое главное, почему все так долго, и можно ли побыстрее?
В опен сорс я попал со студенческой скамьи на наивном энтузиазме, но это продолжает переворачивать жизнь по сей день. Я постараюсь ответить на перечисленные вопросы опираясь на свой опыт, ретроспективные выводы спустя несколько лет участия в нескольких крупных проектах.

СКОЛЬКО СТОИТ НЕЭФФЕКТИВНЫЙ DATA SCIENCE ИЛИ ЧЕМУ УЧИТЬ КОМАНДУ DS?

МИХАИЛ РОЖКОВ

Creator Machine Learning REPA

Применение Data Science (DS) в бизнесе обычно связывают с тем value, которое смогут принести модели после их внедрение в процесс или продукт. При этом часто упускают из виду, что работа DS команды это сложный процесс, который требует значительных ресурсов и компетенций команды. В докладе обсудим, как можно оценить эффект от внедрения инструментов автоматизации и инженерных практик в Data Science. Доклад поможет компаниям найти точки роста DS команд и приоритезировать программы обучения и развития

Программа пополняется...

Событие в социальных сетях

Официальный сайт события

https://datastart.ru/online-autumn-2020

Data Start Conference