7 марта 2018 · Комментарий

Без заголовка

Data Engineer - это более узко. Они, мне кажется, больше про то как data pipelines построить. Все эти Spark, Kafka и прочее чтобы эффективно гонять данные из одного места в другое, преобразовывать и чистить по дороге, правильно хранить (HDFS, S3, RDBMS, NoSQL, etc). ПРи этом они могут мало соображать в machine learning. Появляется новая специализация - machine learning engineer. Они не так хороши как Machine Learning Researchers в разработке новых ML алгоритмов, но они знают про то как взять код рисёрчера, сделать его reliable, добавить логгинг, мониторинг, подумать про performance и scalability (плюч еще массу разных штук специфичных для ML систем, типа контроля за изменением распределения входных данных, постоянным тестированием метрик ML модели на продакшн данных, периодической перетренировкой моделей и т.п.) Data Scientist же на практике (как я вижу это понятие пользуют при найме людей в silicon valley) - это просто немного продвинутый Data Analyst. Они умеют считать, что-то понимают в теории вероятности, пользуют SQL, Excel и подобное, могут дизайнить A/B тесты, делать более сложную аналитику.

К записи · К обсуждению