Les scientifiques, les développeurs et de nombreux autres professionnels des technologies de différents secteurs d'activité tirent parti d'Amazon Web Services pour effectuer des analyses Big Data et relever les défis liés à l'augmentation du volume, de la diversité et de la vitesse des informations numériques. Amazon Web Services fournit un portefeuille complet de services de cloud computing, destiné à vous aider à gérer les Big Data en réduisant les coûts, en réalisant des dimensionnements qui répondent à la demande et en augmentant le rythme de vos innovations.
Découvrez les solutions AWS Big Data proposées pour chaque étape du cycle de vie des données Big Data :
Collecter > Diffuser > Stocker > SGBDR | Entrepôt de données | NoSQL > Analyses > Archiver
Vous familiariser avec Big Data dans le cloud n'a jamais été aussi simple. Consultez la section Mise en route, qui contient des didacticiels et des ressources pour vous aider à créer votre premier projet.
Cette courte vidéo vous explique comment Amazon Web Services peut être utilisé pour mieux analyser l'activité de votre entreprise à l'aide de la technologie Big Data. Vous découvrirez les différentes façons d'utiliser les technologies Big Data qui vous sont les plus familières, telles que Pig, Hive, Spark, Hadoop et bien d'autres encore, afin que vous puissiez terminer votre projet de Big Data plus rapidement.
Ce nouveau livre blanc présente les différentes options Big Data disponibles dans le cloud AWS pour les architectes, experts en science des données et développeurs. Pour chaque option d'analytique Big Data, ce livre blanc détaille les éléments suivants : schémas d'utilisation préconisés, performances, durabilité et disponibilité, modèle de coût, évolutivité, élasticité, interfaces et anti-patterns. Ce livre blanc décrit deux scénarios montrant les options d'analytique utilisées et fournit des ressources supplémentaires pour commencer à utiliser l'analytique Big Data sur AWS.
Le blog AWS consacré à Big Data s'adresse aux architectes de solutions, aux experts en science des données et aux développeurs et leur permet d'apprendre les bonnes pratiques concernant Big Data, de découvrir quels services de Big Data gérés d'AWS sont les plus adaptés à leur situation, mais aussi d'apprendre à utiliser et à approfondir leurs connaissances des services de Big Data d'AWS. L'objectif est que ce blog devienne un lieu qui rassemble toutes les personnes désireuses de découvrir de nouvelles méthodes pour rassembler, stocker, traiter, analyser et visualiser des données à n'importe quelle échelle. Les lecteurs y trouveront des didacticiels courts qui intègrent des exemples de code, des études de cas qui montrent les avantages uniques liés à Big Data sur AWS, des annonces relatives aux nouvelles fonctionnalités, des démonstrations et didacticiels réalisés par nos partenaires et clients, accompagnés de conseils et de bonnes pratiques pour l'utilisation des services de Big Data d'AWS.
De nos jours, il semble que des données soient générées de toute part, depuis vos clients sur les réseaux sociaux jusqu'aux instances s'exécutant sur vos applications Web. AWS facilite le dimensionnement des services de stockage, de calcul et de base de données dont vous avez besoin pour transformer ces données en informations pertinentes pour votre activité. AWS fournit des services de transfert de données capables de déplacer rapidement du Big Data vers ou à partir du cloud, comme AWS Direct Connect et notre service Import/Export. En outre, l'ensemble du trafic de données entrantes est gratuit dans AWS.
Découvrez comment transférer le contenu de disques durs vers le cloud avec AWS Import/Export »
Découvrez comment obtenir votre connexion privée au cloud en fibre optique avec AWS Direct Connect »
RDS est disponible pour MySQL, PostgreSQL, Oracle et SQL Server.
Amazon Kinesis est un service géré pour le traitement en temps réel de la diffusion en continu de Big Data. Amazon Kinesis prend en charge des débits de données allant de quelques mégaoctets à plusieurs gigaoctets de données par seconde et peut être dimensionnée sans heurts pour gérer des flux provenant de centaines de milliers de sources différentes. Conçue pour offrir de manière rentable un niveau élevé de disponibilité et durabilité, cette solution vous permet désormais de mieux tirer parti de vos données, ce qui vous permettra de prendre de meilleures décisions plus rapidement et à moindre coût.
Que vous stockiez des données pharmaceutiques en vue de réaliser des analyses, des données financières à des fins de calcul et de tarification, ou des fichiers multimédias tels que des photos et des vidéos, Amazon Simple Storage Service (S3) est la solution de stockage Big Data dans le cloud idéale pour stocker durablement vos contenus originaux. Conçu pour une durabilité à 99,999999999 %, sans point de défaillance unique, Amazon S3 est le service de stockage essentiel pour vos objets Big Data.
En savoir plus sur Amazon S3 »
Amazon Elastic Block Store (EBS) fournit des disques durs pour un stockage permanent de ces machines virtuelles. Les volumes Amazon EBS offrent les performances constantes et à faible latence dont vous avez besoin pour exécuter des charges de travail Big Data telles que vos bases de données relationnelles ou NoSQL, des applications d'entreprise et des systèmes de fichiers en réseau distribués à performances élevées.
Les magasins de données NoSQL exploitent largement la vitesse des disques SSD (Solid State Drives). Amazon DynamoDB les utilise par défaut, mais si vous faites appel à des solutions alternatives provenant d'AWS Marketplace, telles que Cassandra ou MongoDB, vous pouvez accélérer votre accès avec l'utilisation à la demande de téraoctets de stockage SSD, grâce à la classe d'instances à E/S élevées.
En savoir plus sur les options disponibles pour chaque type d'instance EC2 »
Si vous avez besoin d'une base de données NoSQL et que vous ne voulez pas vous soucier des nombreuses tâches opérationnelles nécessaires pour l'exécuter, Amazon DynamoDB est la solution idéale. Il s'agit d'un service de base de données NoSQL rapide et entièrement géré, qui simplifie et rentabilise le stockage et l'extraction de n'importe quel volume de données, tout en vous permettant de répondre aux requêtes, quel que soit le trafic.
Amazon DynamoDB fournit un débit garanti et une latence de quelques millisecondes seulement, et convient donc parfaitement aux applications telles que les jeux, les technologies publicitaires, les applications mobiles et de nombreuses autres applications de Big Data.
L'innovation que représente le Big Data va au-delà de NoSQL. Il s'agit surtout d'appliquer la technologie appropriée à vos données, en fonction de vos besoins. Les bases de données relationnelles fournissent des performances rapides, prévisibles et constantes. Elles sont optimisées pour les charges de travail transactionnelles telles que les points de vente ou les historiques financiers. Dans bon nombre d'architectures Big Data complètes, les bases de données relationnelles jouent un rôle complémentaire par rapport aux bases de données NoSQL.
Amazon RDS facilite l'installation, l'exploitation et le dimensionnement d'une base de données relationnelle dans le cloud. Ce service fournit une capacité économique et redimensionnable tout en gérant les tâches fastidieuses d'administration des bases de données, vous permettant ainsi de vous consacrer à vos applications et à votre activité.
Amazon Redshift offre un service rapide et entièrement géré d'entrepôt de données de l'ordre du pétaoctet, pour un coût inférieur à 1 000 USD par téraoctet et par an. Amazon Redshift fournit des performances d'E/S et d'interrogation élevées pour pratiquement toutes les tailles d'ensembles de données, en faisant appel à la méthode de stockage en colonnes et en exécutant les interrogations en parallèle, puis en les répartissant sur plusieurs nœuds. En seulement quelques minutes, vous pouvez mettre en place facilement un entrepôt de données entièrement géré doté de sauvegardes automatisées et d'un cryptage intégré. S'intègre facilement à vos outils d'informatique décisionnelle existants.
Amazon Elastic MapReduce (EMR) fournit le puissant framework Apache Hadoop sur Amazon EC2, en tant que service géré simple d'utilisation. Avec Amazon EMR, vous pouvez vous concentrer sur vos requêtes Map/Reduce et exploiter le large éventail d'outils Hadoop, tout en déployant une plate-forme d'infrastructure sécurisée à grande échelle. Exécutez facilement les tâches d'analyse de données dans le cloud en laissant Amazon EMR s'occuper de la gestion de vos clusters Hadoop.
A quelle vitesse pourriez-vous réaliser votre projet si vous aviez 1 000 machines virtuelles supplémentaires ? Et avec 10 000 ? La place de marché Amazon pour les instances ponctuelles, intégrée à Amazon Elastic MapReduce, vous permet de fixer votre propre prix pour les ressources informatiques dont vous avez besoin pour effectuer les analyses avec le cloud computing. Ainsi, vous pouvez déterminer votre propre équilibre coûts/performances, en optant pour un surcadençage des vos analyses quand vous en avez besoin ou, au contraire, en choisissant de réduire considérablement vos coûts.
Amazon Glacier vous permet de vous décharger sur AWS des tâches administratives liées au fonctionnement et au dimensionnement du stockage des archives. Il simplifie tout particulièrement la rétention des données sur de longues périodes, qu'il soit question de plusieurs années ou de plusieurs décennies. Amazon Glacier est un service de stockage d'archive à très faible coût, dont le prix de départ est de 0,01 USD/Go par mois. Il n'y a aucun engagement de capital initial et toutes les dépenses opérationnelles continues sont comprises dans le prix.

