Compartir

Ingeniería de datos. Diseño, implementación y optimización de flujos de datos en Python

Sinopsis del producto

Este libro es una guía esencial para quienes desean dominar los conceptos y técnicas de ingeniería de datos. A través de un enfoque teórico-práctico, se exploran los métodos para la ingesta, almacenamiento y procesamiento eficiente de datos, con énfasis en el uso de Python y otras tecnologías clave. n nLos lectores aprenderán sobre la importancia de los datos en las organizaciones, comprendiendo las funciones y responsabilidades de la ingeniería de datos. Además, se profundiza en las tecnologías y herramientas disponibles para extraer datos de diferentes sistemas y aplicaciones. El libro guía a los usuarios en la implementación de modelos de almacenamiento que faciliten el análisis eficiente y en la programación de scripts para el procesamiento de datos en tiempo real. A lo largo del libro, se desarrollan ejemplos prácticos para afianzar los conocimientos, permitiendo a los lectores crear y ejecutar scripts en Python desde la consola. Se incluye un repositorio con todos los ejemplos analizados, para que los lectores puedan realizar pruebas y asimilar los contenidos teóricos de manera efectiva. n nEsta obra es ideal para quienes buscan una comprensión profunda y práctica de la ingeniería de datos, sus tecnologías y aplicaciones en el procesamiento de grandes volúmenes de información. n nCONTENIDO n nINTRODUCCIÓN nOBJETIVOS nCAPÍTULO 1. INGENIERÍA DE DATOS n1.1 INTRODUCCIÓN n1.2 IMPORTANCIA DE LOS DATOS EN LAS nORGANIZACIONES n1.3 CICLO DE VIDA DE LOS DATOS n1.3.1 Ingesta y almacenamiento n1.3.2 Procesamiento y preparación n1.3.3 Exploración n1.3.4 Experimentación y predicción n1.4 ROL DE INGENIERO/A DE DATOS n1.5 INGESTA DE DATOS n1.5.1 Batch vs streaming n1.5.2 Arquitectura de la capa de ingesta n1.5.3 Herramientas de ingesta de datos n1.5.4 AWS Glue n1.6 PROCESAMIENTO Y PREPARACIÓN n1.6.1 Tipos de procesamiento de datos. n1.6.2 Procesamiento batch n1.6.3 Procesamiento streaming n1.7 ALMACENAMIENTO n1.7.1 Big Data n1.7.2 Almacenamiento distribuido n1.7.3 Elegir una herramienta ETL para trabajar en Big nData n1.8 PROCESOS ETL (EXTRACT, TRANSFORM, LOAD) n1.8.1 Extracción n1.8.2 Transformación n1.8.3 Carga n1.8.4 Herramientas ETL n1.8.5 Herramientas de orquestación de flujos de datos n1.9 TÉCNICAS DE EXTRACCIÓN DE DATOS n1.9.1 Ingesta batch n1.9.2 Ingesta en tiempo real n1.9.3 Change Data Capture n1.10 PIPELINES DE DATOS n1.10.1 Definición de pipeline n1.10.2 Fases de un pipeline de datos n1.10.3 Pipeline iterativo n1.11 FUENTES DE DATOS n1.11.1 Bases de datos n1.11.2 APIs n1.12 FORMATOS ANALÍTICOS n1.12.1 Apache Avro n1.12.2 Fastavro n1.12.3 Comprimiendo los datos n1.12.4 Parquet n1.12.5 Interactuando con Parquet mediante Pyarrow n1.12.6 Apache ORC n1.12.7 Comparando formatos nCAPÍTULO 2. DATA LAKE Y DATA WAREHOUSE n2.1 INTRODUCCIÓN n2.2 DEFINICIÓN DE DATA LAKE n2.3 CARACTERÍSTICAS DE UN DATA LAKE n2.4 TIPOS DE DATA LAKES n2.5 ARQUITECTURA DE UN DATA LAKE n2.5.1 Beneficios de una arquitectura de Data Lake n2.6 PROCESO DE CREACIÓN DE UN DATA LAKE n n2.7 DEFINICIÓN DE DATA WAREHOUSE n2.7.1 Modelado bidimensional n2.7.2 Data Warehouse en la nube n2.8 DATA LAKES VS DATA WAREHOUSE n2.8.1 Conversión de los datos n2.8.2 Soporte de los tipos de datos n2.8.3 Adaptación a los cambios n2.9 CAPAS DE UN DATA LAKE n2.10 SOLUCIONES DE DATA LAKE EN LA NUBE n2.10.1 Azure Databricks n2.10.2 Ingeniería de datos en Microsoft Azure n2.10.3 Azure Synapse Analytics n2.10.4 Azure Data Lake n2.10.5 Azure Data Lake Storage Gen2 n2.10.6 Azure Data Lake Analytics n2.10.7 Aws Data Lake n2.10.8 Snowflake n2.11 DATA LAKEHOUSE n2.11.1 Ventajas de un Data Lakehouse n2.11.2 Capas de un Data Lakehouse n2.11.3 Arquitectura de un Data Lakehouse n2.11.4 Herramientas para implementar un Data nLakehouse n2.12 PARADIGMA ACTUAL nCAPÍTULO 3. APACHE NIFI n3.1 INTRODUCCIÓN n3.2 COMPONENTES DE APACHE NIFI n3.2.1 Tipos de procesadores n3.2.2 Conectores en Apache NiFi n3.3 ARQUITECTURA DE APACHE NIFI n3.4 INSTALACIÓN DE APACHE NIFI. n3.5 APACHE NIFI REGISTRY n3.6 PROCESADORES EN APACHE NIFI n3.7 APACHE NIFI RECORD PROCESSING n3.8 APACHE NIFI SCHEMAS & SCHEMA REGISTRIES n3.9 APACHE NIFI SCHEDULING n3.10 APACHE NIFI FLOW MONITORING n3.11 EJEMPLO DE FLUJO EN APACHE NIFI n3.11.1 Desarrollar un flujo para mover datos n3.11.2 Gestión de errores en el flujo n3.12 CASOS DE USO CON APACHE NIFI nCAPÍTULO 4. PROCESAMIENTO EN STREAMING n4.1 INTRODUCCIÓN n4.2 INTRODUCCIÓN A APACHE FLINK n4.3 CARACTERÍSTICAS A APACHE FLINK n4.4 CONTROL DE EVENTOS EN APACHE FLINK n4.4.1 Tipos de ventanas de procesamiento n4.5 COMPONENTES DE APACHE FLINK n4.6 DESPLIEGUE DE APACHE FLINK n4.7 IMPLEMENTANDO FLINK EN PYTHON nCAPÍTULO 5. PROCESAMIENTO EN TIEMPO REAL n5.1 INTRODUCCIÓN n5.2 APACHE KAFKA n5.2.1 Back Pressure en Apache Kafka n5.2.2 Patrón productor/consumidor n5.2.3 Tópicos y particiones n5.2.4 Brokers n5.2.5 Factor de replicación n n5.2.6 Réplica líder n5.2.7 Productores n5.2.8 Consumidores n5.3 USO DE KAFKA DESDE PYTHON n5.3.1 Desplegar un servidor de Kafka n5.4 COMPLEMENTOS DE APACHE KAFKA n5.4.1 Kafka Streams n5.4.2 Zookeeper en Apache Kafka n5.4.3 Apache Kafka como base de datos n5.5 ALTERNATIVAS DE APACHE KAFKA n5.5.1 Apache Kafka vs Red Panda n5.6 APACHE SPARK STREAMING n5.6.1 Introducción n5.6.2 Modelos de procesamiento n5.6.3 Operaciones en Spark Streaming n5.6.4 Instalación y configuración de Apache Spark n5.6.5 Procesamiento de datos en Streaming con nPython n5.6.6 Fuentes de datos en Spark Streaming n5.6.7 Trabajando con ventanas temporales en Spark nStreaming n5.6.8 Tipos de operaciones de ventana en Spark nStreaming n5.6.9 Casos de uso de Apache Spark Streaming n5.6.10 Apache Kafka Streams vs Apache Spark nStreaming nCAPÍTULO 6. PIPELINES DE DATOS n6.1 INTRODUCCIÓN A LOS PIPELINES DE DATOS n6.2 SEGURIDAD EN PIPELINES DE DATOS n6.3 CREAR UNA PIPELINE DATOS EN LA NUBE n6.4 PIPELINES DE DATOS EN PYTHON n6.4.1 Prefect n6.4.2 Airbyte como herramienta de gestión de flujos nde datos n6.5 PIPELINES DE DATOS CON APRENDIZAJE nAUTOMÁTICO n6.5.1 Mflow como plataforma de gestión de modelos nde aprendizaje automático n6.5.2 Instalación y ejecución de MLflow n6.6 CREACIÓN DE PIPELINES CON APACHE BEAM n6.6.1 Introducción a Apache Beam n6.6.2 Creación de Pipelines con Python n6.6.3 Transformación de datos en Apache Beam n6.6.4 Contar palabras de un fichero de texto n6.6.5 Casos de uso de Apache Beam n6.6.6 Recursos para aprender Apache Beam n6.7 KEDRO COMO FRAMEWORK PARA CREAR nPIPELINES n6.7.1 Desacoplamiento de la configuración n6.7.2 Modularización n6.7.3 Desacoplamiento de los datos n6.7.4 Testing n6.7.5 Creación de Nodos y Pipelines n6.8 GESTIÓN DE PIPELINES CON DBT (DATA BUILD nTOOL) n6.8.1 Instalación y configuración de DBT n6.8.2 Ejecución de los modelos n6.9 GESTIÓN DE PIPELINES CON KUBEFLOW n6.9.1 Despliegue de Kubeflow Pipelines n6.9.2 Creación de componentes y Pipelines n n6.9.3 Repositorio de artefactos nCAPÍTULO 7. APACHE AIRFLOW n7.1 INTRODUCCIÓN n7.2 INSTALACIÓN DE APACHE AIRFLOW n7.3 FUNCIONAMIENTO DE APACHE AIRFLOW n7.3.1 DAG (Grafo acíclico dirigido) n7.3.2 Operadores n7.3.3 Argumentos por defecto en el DAG n7.3.4 Definir dependencias en el DAG n7.3.5 Pasando datos entre tareas en el DAG n7.4 TAREAS Y OPERADORES EN APACHE AIRFLOW n7.4.1 Extendiendo la funcionalidad del operador de nPython n7.5 ARQUITECTURA DE AIRFLOW n7.6 EJECUTANDO BASH OPERATOR EN AIRFLOW n7.7 CASO PRÁCTICO: DE CSV A JSON n7.8 ALMACENANDO LAS VENTAS EN CSV n7.9 PLANIFICACIÓN DE TAREAS n7.10 ALMACENANDO EN BASE DE DATOS SQLITE n7.11 COMANDOS ÚTILES DE AIRFLOW n7.12 ASTRONOMER nCAPÍTULO 8. PROGRAMACIÓN CON FLUJOS DE DATOS n(DATA FLOW) n8.1 INTRODUCCIÓN n8.2 GOOGLE DATAFLOW n8.2.1 Componentes de Google Dataflow n8.2.2 Ventajas de Google Dataflow n8.2.3 Procesamiento Batch y Streaming en Google nDataflow n8.2.4 Pipelines en Google Dataflow n8.3 GOOGLE DATAPROC n8.3.1 Ventajas de Google Dataproc n8.3.2 Creación de un Clúster en Google Dataproc n8.3.3 Componentes de Google Dataproc n8.3.4 Google Dataproc Autoscaling n8.3.5 Google Dataproc vs Dataflow nGLOSARIO DE TÉRMINOS

9786075763842

Sinopsis del producto

Este libro es una guía esencial para quienes desean dominar los conceptos y técnicas de ingeniería de datos. A través de un enfoque teórico-práctico, se exploran los métodos para la ingesta, almacenamiento y procesamiento eficiente de datos, con énfasis en el uso de Python y otras tecnologías clave. n nLos lectores aprenderán sobre la importancia de los datos en las organizaciones, comprendiendo las funciones y responsabilidades de la ingeniería de datos. Además, se profundiza en las tecnologías y herramientas disponibles para extraer datos de diferentes sistemas y aplicaciones. El libro guía a los usuarios en la implementación de modelos de almacenamiento que faciliten el análisis eficiente y en la programación de scripts para el procesamiento de datos en tiempo real. A lo largo del libro, se desarrollan ejemplos prácticos para afianzar los conocimientos, permitiendo a los lectores crear y ejecutar scripts en Python desde la consola. Se incluye un repositorio con todos los ejemplos analizados, para que los lectores puedan realizar pruebas y asimilar los contenidos teóricos de manera efectiva. n nEsta obra es ideal para quienes buscan una comprensión profunda y práctica de la ingeniería de datos, sus tecnologías y aplicaciones en el procesamiento de grandes volúmenes de información. n nCONTENIDO n nINTRODUCCIÓN nOBJETIVOS nCAPÍTULO 1. INGENIERÍA DE DATOS n1.1 INTRODUCCIÓN n1.2 IMPORTANCIA DE LOS DATOS EN LAS nORGANIZACIONES n1.3 CICLO DE VIDA DE LOS DATOS n1.3.1 Ingesta y almacenamiento n1.3.2 Procesamiento y preparación n1.3.3 Exploración n1.3.4 Experimentación y predicción n1.4 ROL DE INGENIERO/A DE DATOS n1.5 INGESTA DE DATOS n1.5.1 Batch vs streaming n1.5.2 Arquitectura de la capa de ingesta n1.5.3 Herramientas de ingesta de datos n1.5.4 AWS Glue n1.6 PROCESAMIENTO Y PREPARACIÓN n1.6.1 Tipos de procesamiento de datos. n1.6.2 Procesamiento batch n1.6.3 Procesamiento streaming n1.7 ALMACENAMIENTO n1.7.1 Big Data n1.7.2 Almacenamiento distribuido n1.7.3 Elegir una herramienta ETL para trabajar en Big nData n1.8 PROCESOS ETL (EXTRACT, TRANSFORM, LOAD) n1.8.1 Extracción n1.8.2 Transformación n1.8.3 Carga n1.8.4 Herramientas ETL n1.8.5 Herramientas de orquestación de flujos de datos n1.9 TÉCNICAS DE EXTRACCIÓN DE DATOS n1.9.1 Ingesta batch n1.9.2 Ingesta en tiempo real n1.9.3 Change Data Capture n1.10 PIPELINES DE DATOS n1.10.1 Definición de pipeline n1.10.2 Fases de un pipeline de datos n1.10.3 Pipeline iterativo n1.11 FUENTES DE DATOS n1.11.1 Bases de datos n1.11.2 APIs n1.12 FORMATOS ANALÍTICOS n1.12.1 Apache Avro n1.12.2 Fastavro n1.12.3 Comprimiendo los datos n1.12.4 Parquet n1.12.5 Interactuando con Parquet mediante Pyarrow n1.12.6 Apache ORC n1.12.7 Comparando formatos nCAPÍTULO 2. DATA LAKE Y DATA WAREHOUSE n2.1 INTRODUCCIÓN n2.2 DEFINICIÓN DE DATA LAKE n2.3 CARACTERÍSTICAS DE UN DATA LAKE n2.4 TIPOS DE DATA LAKES n2.5 ARQUITECTURA DE UN DATA LAKE n2.5.1 Beneficios de una arquitectura de Data Lake n2.6 PROCESO DE CREACIÓN DE UN DATA LAKE n n2.7 DEFINICIÓN DE DATA WAREHOUSE n2.7.1 Modelado bidimensional n2.7.2 Data Warehouse en la nube n2.8 DATA LAKES VS DATA WAREHOUSE n2.8.1 Conversión de los datos n2.8.2 Soporte de los tipos de datos n2.8.3 Adaptación a los cambios n2.9 CAPAS DE UN DATA LAKE n2.10 SOLUCIONES DE DATA LAKE EN LA NUBE n2.10.1 Azure Databricks n2.10.2 Ingeniería de datos en Microsoft Azure n2.10.3 Azure Synapse Analytics n2.10.4 Azure Data Lake n2.10.5 Azure Data Lake Storage Gen2 n2.10.6 Azure Data Lake Analytics n2.10.7 Aws Data Lake n2.10.8 Snowflake n2.11 DATA LAKEHOUSE n2.11.1 Ventajas de un Data Lakehouse n2.11.2 Capas de un Data Lakehouse n2.11.3 Arquitectura de un Data Lakehouse n2.11.4 Herramientas para implementar un Data nLakehouse n2.12 PARADIGMA ACTUAL nCAPÍTULO 3. APACHE NIFI n3.1 INTRODUCCIÓN n3.2 COMPONENTES DE APACHE NIFI n3.2.1 Tipos de procesadores n3.2.2 Conectores en Apache NiFi n3.3 ARQUITECTURA DE APACHE NIFI n3.4 INSTALACIÓN DE APACHE NIFI. n3.5 APACHE NIFI REGISTRY n3.6 PROCESADORES EN APACHE NIFI n3.7 APACHE NIFI RECORD PROCESSING n3.8 APACHE NIFI SCHEMAS & SCHEMA REGISTRIES n3.9 APACHE NIFI SCHEDULING n3.10 APACHE NIFI FLOW MONITORING n3.11 EJEMPLO DE FLUJO EN APACHE NIFI n3.11.1 Desarrollar un flujo para mover datos n3.11.2 Gestión de errores en el flujo n3.12 CASOS DE USO CON APACHE NIFI nCAPÍTULO 4. PROCESAMIENTO EN STREAMING n4.1 INTRODUCCIÓN n4.2 INTRODUCCIÓN A APACHE FLINK n4.3 CARACTERÍSTICAS A APACHE FLINK n4.4 CONTROL DE EVENTOS EN APACHE FLINK n4.4.1 Tipos de ventanas de procesamiento n4.5 COMPONENTES DE APACHE FLINK n4.6 DESPLIEGUE DE APACHE FLINK n4.7 IMPLEMENTANDO FLINK EN PYTHON nCAPÍTULO 5. PROCESAMIENTO EN TIEMPO REAL n5.1 INTRODUCCIÓN n5.2 APACHE KAFKA n5.2.1 Back Pressure en Apache Kafka n5.2.2 Patrón productor/consumidor n5.2.3 Tópicos y particiones n5.2.4 Brokers n5.2.5 Factor de replicación n n5.2.6 Réplica líder n5.2.7 Productores n5.2.8 Consumidores n5.3 USO DE KAFKA DESDE PYTHON n5.3.1 Desplegar un servidor de Kafka n5.4 COMPLEMENTOS DE APACHE KAFKA n5.4.1 Kafka Streams n5.4.2 Zookeeper en Apache Kafka n5.4.3 Apache Kafka como base de datos n5.5 ALTERNATIVAS DE APACHE KAFKA n5.5.1 Apache Kafka vs Red Panda n5.6 APACHE SPARK STREAMING n5.6.1 Introducción n5.6.2 Modelos de procesamiento n5.6.3 Operaciones en Spark Streaming n5.6.4 Instalación y configuración de Apache Spark n5.6.5 Procesamiento de datos en Streaming con nPython n5.6.6 Fuentes de datos en Spark Streaming n5.6.7 Trabajando con ventanas temporales en Spark nStreaming n5.6.8 Tipos de operaciones de ventana en Spark nStreaming n5.6.9 Casos de uso de Apache Spark Streaming n5.6.10 Apache Kafka Streams vs Apache Spark nStreaming nCAPÍTULO 6. PIPELINES DE DATOS n6.1 INTRODUCCIÓN A LOS PIPELINES DE DATOS n6.2 SEGURIDAD EN PIPELINES DE DATOS n6.3 CREAR UNA PIPELINE DATOS EN LA NUBE n6.4 PIPELINES DE DATOS EN PYTHON n6.4.1 Prefect n6.4.2 Airbyte como herramienta de gestión de flujos nde datos n6.5 PIPELINES DE DATOS CON APRENDIZAJE nAUTOMÁTICO n6.5.1 Mflow como plataforma de gestión de modelos nde aprendizaje automático n6.5.2 Instalación y ejecución de MLflow n6.6 CREACIÓN DE PIPELINES CON APACHE BEAM n6.6.1 Introducción a Apache Beam n6.6.2 Creación de Pipelines con Python n6.6.3 Transformación de datos en Apache Beam n6.6.4 Contar palabras de un fichero de texto n6.6.5 Casos de uso de Apache Beam n6.6.6 Recursos para aprender Apache Beam n6.7 KEDRO COMO FRAMEWORK PARA CREAR nPIPELINES n6.7.1 Desacoplamiento de la configuración n6.7.2 Modularización n6.7.3 Desacoplamiento de los datos n6.7.4 Testing n6.7.5 Creación de Nodos y Pipelines n6.8 GESTIÓN DE PIPELINES CON DBT (DATA BUILD nTOOL) n6.8.1 Instalación y configuración de DBT n6.8.2 Ejecución de los modelos n6.9 GESTIÓN DE PIPELINES CON KUBEFLOW n6.9.1 Despliegue de Kubeflow Pipelines n6.9.2 Creación de componentes y Pipelines n n6.9.3 Repositorio de artefactos nCAPÍTULO 7. APACHE AIRFLOW n7.1 INTRODUCCIÓN n7.2 INSTALACIÓN DE APACHE AIRFLOW n7.3 FUNCIONAMIENTO DE APACHE AIRFLOW n7.3.1 DAG (Grafo acíclico dirigido) n7.3.2 Operadores n7.3.3 Argumentos por defecto en el DAG n7.3.4 Definir dependencias en el DAG n7.3.5 Pasando datos entre tareas en el DAG n7.4 TAREAS Y OPERADORES EN APACHE AIRFLOW n7.4.1 Extendiendo la funcionalidad del operador de nPython n7.5 ARQUITECTURA DE AIRFLOW n7.6 EJECUTANDO BASH OPERATOR EN AIRFLOW n7.7 CASO PRÁCTICO: DE CSV A JSON n7.8 ALMACENANDO LAS VENTAS EN CSV n7.9 PLANIFICACIÓN DE TAREAS n7.10 ALMACENANDO EN BASE DE DATOS SQLITE n7.11 COMANDOS ÚTILES DE AIRFLOW n7.12 ASTRONOMER nCAPÍTULO 8. PROGRAMACIÓN CON FLUJOS DE DATOS n(DATA FLOW) n8.1 INTRODUCCIÓN n8.2 GOOGLE DATAFLOW n8.2.1 Componentes de Google Dataflow n8.2.2 Ventajas de Google Dataflow n8.2.3 Procesamiento Batch y Streaming en Google nDataflow n8.2.4 Pipelines en Google Dataflow n8.3 GOOGLE DATAPROC n8.3.1 Ventajas de Google Dataproc n8.3.2 Creación de un Clúster en Google Dataproc n8.3.3 Componentes de Google Dataproc n8.3.4 Google Dataproc Autoscaling n8.3.5 Google Dataproc vs Dataflow nGLOSARIO DE TÉRMINOS

9786075763842

Ver más
Ver menos

$59.900,00

99999 disponibles

*Precios válidos solo para compras online.
Costo de envío      Medios de pago
mp-logo-hand-shake
Hasta 12 pagos sin tarjeta con Mercado Pago. Saber más
Compra con Mercado Pago sin tarjeta y paga mes a mes
1
Agrega tu producto al carrito y al momento de pagar, elige “Cuotas sin Tarjeta” o “Meses sin Tarjeta”.
2
Inicia sesión en Mercado Pago.
3
Elige la cantidad de pagos que se adapten mejor a ti ¡y listo!

Crédito sujeto a aprobación.

¿Tienes dudas? Consulta nuestra Ayuda.

Con esta compra sumás 59900 puntos
Comprar ahora

Especificaciones

Tapa blanda o Bolsillo
Argentina
Español / Castellano
Producto a la venta formado por un único componente
Ra-Ma
20/02/2020
324
ISBN 9786075763842

Quizás te interese

Valoraciones

No hay valoraciones aún.

¿Ya lo leíste? Valorá “Ingeniería de datos. Diseño, implementación y optimización de flujos de datos en Python”

Creado por Livriz