Показаны сообщения с ярлыком Big Data. Показать все сообщения
Показаны сообщения с ярлыком Big Data. Показать все сообщения

Syncfusion Succintly Series e-books – learn all of the latest technologies with our library of free e-books

Список книг взят отсюда.

Код для генерации списка:

// Осортировать по дате публикации от ранних к поздним.
(function () {
 var result = '', start = 0, cnt, used = 0;
 $('.list-details').each(function (index) {
   if (index >= start) {
    cnt = index;
    var link = 'https://www.syncfusion.com'
     + $(this).find('.withoutpad a').attr('href');
    var img = 'https:'
     + $(this).find('.withoutpad a img').attr('src');
    var title = $.trim($(this).find('.withoutleftpad h4 a').text());
    var author = $.trim($(this).find('.withoutleftpad div').text());
    var item = '<a href="' + link + '"><b>' 
     + title + '</b> ' + author + '</a><br/>\n';
    result += item;
    used += 1;
   }
 });
 console.log('Всего книг: ', cnt + 1);
 console.log('В результат попало книг: ', used);
 console.log('Результат:\n' + result);
}());

Последняя взятая книга:
Gradle Succinctly by José Roberto Olivas Mendoza

ДНК хранит данные более эффективно, чем любой созданный человеком носитель

В одной удивительной статье, опубликованной на сайте ExtremeTech.com под названием «Гарвард взломал хранилище ДНК, разместив в ней 700 терабайт данных в одном грамме», сообщается, что ученые из Гарварда побили рекорд плотности хранения данных в ДНК - они с успехом «поместили 5,5 петабит (около 700 терабайт) данных в один грамм ДНК, побив предыдущий рекорд плотности хранения данных в тысячу раз». Чтобы дать читателю представление о том, сколько это информации, сайт Wikipedia сообщает, что портал Google ежедневно обрабатывает около 25 петабит информации. А значит, с помощью этого метода можно было бы записать всю информацию, обработанную порталом Google за день, в пяти граммах ДНК. В статье на ExtremeTech.com об этом сказано следующим образом:
«Задумайтесь на минуточку: в одном грамме ДНК может храниться 700 терабайт данных. Это количество информации, которое могло бы занять 14 тысяч Blu-ray-дисков объемом памяти по 50 гигабайт, вмещается на крохотной частице ДНК, которая поместилась бы на кончик вашего мизинца. Для того чтобы сохранить такое количество информации на жестких дисках, которые являются самыми лучшими средствами для хранения информации на сегодняшний день, вам понадобилось бы 233 жестких диска объемом по 3 терабайта, а их общий вес составил бы 151 кг. Ученым Черчу и Косури удалось записать 700 килобайт данных в ДНК (это была самая последняя книга, автором которой был сам Черч), а затем удалось воссоздать 70 миллиардов копий этой информации, что, как они в шутку утверждают, сделало эту книгу бестселлером всех времен. В целом им удалось сохранить 44 петабайт информации».

Новая технология позволит сохранить всю информацию человечества в одной комнате при помощи ДНК

В новом исследовании описана новая методика кодирования для хранения данных в ДНК.
Фото New York Genome Center.

Проблема хранения больших объёмов данных всё больше усугубляется. Только за последние два года было создано столько информации, сколько не было произведено человечеством за все предыдущие века. Согласно статистике, люди сегодня создают два с половиной экзабайта данных ежедневно – это 2500 миллиардов гигабайтов. Так что в скором времени поток информации может просто "задушить" все возможности хранения жёстких дисков. Так, в науке немало проблем такого рода порождает быстроразвивающаяся отрасль генетики.

Образовательная программа по работе с Big Data

Яндекс
Сбербанк-Технологии (Сбертех)
Openstat
операторы «большой тройки»
компании из ритейл-сегмента
e-commerce
Spotify
МТС
IBM
Cloudera

создание распределённой инфраструктуры на основе Hadoop
технологии обработки данных
применение подходящих алгоритмов машинного обучения
проекты на реальных массивах информации

Программирование Java/С++/Python или аналоги
SQL и базы данных
Теория вероятности и статистика

Развёртывание распределённой инфраструктуры на Hadoop
Предварительная обработка исходных данных
Создание модели предсказания на основе машинного обучения
Применение различных алгоритмов машинного обучения
Проверка и калибровка модели

сбор, доставка, хранение и обработка массивов данных в банках, аналитических сервисах, телекоммуникационных и IT компаниях

Хранение и обработка данных (HADOOP/HDFS, Cassandra, ElasticSearch)
Нереляционная распределенная БД (HBASE, Hive, IMPALA, BigSQL, HAWQ)
Инструменты машинного обучения для Java (MAHOUT)
Инструменты машинного обучения для Python (SCIKIT-LEARN / PANDAS)

организация потоков данных (RabbitMQ, Apache Kafka) и обработка «на лету» (Riak, Aerospike, GEM)

разработка рекомендательных систем (компания-кинопрокатчик Netflix создала передовую рекомендательную систему, которая стала залогом процветания бизнеса)

Анализ социальных графов
Создание мультиклассных классификаторов на основе анализа веб-логов

задачи из Kaggle
алгоритмы показа рекламы

основы теории вероятностей и математической статистики
основы теории машинного обучения

--

Использование Apache Mahout для кластеризации данных на Hadoop платформе

Как мы все знаем у организации Apache очень много проектов. Apache Foundation - это настоящий инкубатор IT проектов. Все знают Apache прежде всего по их веб-серверу. Однако кроме веб-сервера Apache продвигает много других очень полезных проектов. Один из таких перспективных проектов это Apache Hadoop. Apache Hadoop позволяет делать распределенные вычисления. Зачем это нужно? В первую очередь для обработки больших объемов данных. Сейчас есть такой современный тренд - Big Data - это большие данные. Но насколько большие? На этот вопрос все отвечают по разному. Для одной организации петабайт может являться в принципе нормальным объемом данных, а для другой это уже проблема больших данных. Если копнуть глубже то тут возникает целый ряд проблем: хранение, поиск, аналитика, и визуализация. Проблема хранения решается в принципе просто посредством какой-нибудь распределенной СУБД. Более сложно дело обстоит с поиском нужной информации, аналитикой и визуализацией. Вот как раз таки Apache Mahout и поможет нам программировать аналитику. Итак что мы имеем для решения проблемы больших данных:
  • хранение - распределенная СУБД
  • процессинг (обработка данных) - Apache Hadoop (установка)
  • аналитика - Apache Mahout