IA/ML y análisis de datos

1. Introducción #

La inteligencia artificial, el machine learning y el análisis de datos permiten a las empresas obtener valor a partir de sus datos.

Una empresa puede usar estos datos para:

  • Detectar patrones.
  • Predecir comportamientos.
  • Recomendar productos.
  • Automatizar tareas.
  • Analizar tendencias.
  • Mejorar decisiones de negocio.
  • Crear nuevos productos o servicios.

Ejemplo:

Una cafetería podría analizar pedidos anteriores para recomendar productos, prever demanda de café o decidir dónde abrir una nueva tienda.


2. Inteligencia artificial, machine learning y deep learning #

2.1 Inteligencia Artificial #

La Inteligencia Artificial (IA) es un campo amplio que busca crear sistemas capaces de realizar tareas que normalmente requieren inteligencia humana.

Ejemplos:

  • Entender lenguaje natural.
  • Reconocer imágenes.
  • Conversar con usuarios.
  • Traducir textos.
  • Generar contenido.
  • Tomar decisiones basadas en datos.

2.2 Machine Learning #

El Machine Learning (ML) es una rama de la IA.

Consiste en entrenar modelos con datos para que aprendan patrones y puedan hacer predicciones o tomar decisiones sin programar reglas explícitas.

Ejemplo clásico #

Sin ML:

1Si el cliente compra café latte → recomendar pan de queso

Con ML:

1El modelo analiza compras históricas y recomienda productos personalizados.

2.3 Entrenamiento e inferencia #

Entrenamiento #

Proceso en el que un modelo aprende patrones a partir de datos históricos.

Inferencia #

Uso del modelo ya entrenado para hacer predicciones sobre datos nuevos.

Ejemplo:

  • Entrenamiento: analizar miles de pedidos anteriores.
  • Inferencia: recomendar un producto a un nuevo cliente.

2.4 Deep Learning #

El Deep Learning es un subconjunto del machine learning.

Utiliza redes neuronales artificiales con varias capas para resolver problemas complejos.

Es especialmente útil en:

  • Visión artificial.
  • Procesamiento de lenguaje natural.
  • Reconocimiento de voz.
  • IA generativa.

3. IA generativa #

¿Qué es la IA generativa? #

La IA generativa es un tipo de deep learning capaz de crear contenido nuevo.

Puede generar:

  • Texto.
  • Imágenes.
  • Música.
  • Vídeos.
  • Conversaciones.
  • Código.
  • Ideas.

Modelos fundacionales #

Los modelos fundacionales (FM) son modelos de IA muy grandes, preentrenados con enormes cantidades de datos.

Pueden adaptarse a múltiples tareas.


LLM #

Un LLM, o Large Language Model, es un tipo de modelo fundacional entrenado principalmente con texto.

Se utiliza para:

  • Responder preguntas.
  • Resumir documentos.
  • Generar texto.
  • Traducir.
  • Crear asistentes conversacionales.
  • Ayudar a programar.

4. Pila de IA y Machine Learning en AWS #

AWS organiza sus soluciones de IA/ML en tres niveles.


Nivel 1: Servicios de IA de AWS #

Son servicios administrados que ya incluyen modelos preentrenados.

El usuario no necesita entrenar el modelo desde cero.

Son ideales para tareas comunes como:

  • Traducir.
  • Transcribir voz.
  • Analizar texto.
  • Reconocer imágenes.
  • Crear chatbots.
  • Generar recomendaciones.

Nivel 2: Servicios de Machine Learning #

Ofrecen más control y personalización.

El servicio principal es:

  • Amazon SageMaker AI.

Permite crear, entrenar y desplegar modelos propios sin gestionar toda la infraestructura.


Nivel 3: Marcos e infraestructura de ML #

Nivel más avanzado y personalizable.

Permite usar:

  • Amazon EC2 optimizado para ML.
  • Amazon ECS.
  • Amazon EMR.
  • Frameworks como TensorFlow, PyTorch y Apache MXNet.

Es adecuado cuando una empresa necesita control total sobre el entrenamiento y la infraestructura.


5. Servicios lingüísticos de IA #

5.1 Amazon Comprehend #

Amazon Comprehend usa procesamiento de lenguaje natural para analizar texto.

Permite detectar:

  • Idioma.
  • Sentimiento.
  • Frases clave.
  • Entidades.
  • Temas.

Casos de uso #

  • Análisis de opiniones de clientes.
  • Clasificación de contenido.
  • Supervisión de cumplimiento.
  • Análisis de encuestas.

5.2 Amazon Polly #

Amazon Polly convierte texto en voz realista.

Casos de uso #

  • Asistentes virtuales.
  • Lectura automática de textos.
  • Accesibilidad.
  • Aplicaciones educativas.

5.3 Amazon Transcribe #

Amazon Transcribe convierte voz en texto.

Casos de uso #

  • Transcripción de llamadas.
  • Subtítulos automáticos.
  • Análisis de reuniones.
  • Generación de metadatos multimedia.

5.4 Amazon Translate #

Amazon Translate traduce texto entre idiomas.

Casos de uso #

  • Traducción de documentos.
  • Aplicaciones multilingües.
  • Comunicación global.
  • Traducción en tiempo real o por lotes.

6. Servicios de visión, búsqueda y extracción #

6.1 Amazon Rekognition #

Amazon Rekognition analiza imágenes y vídeos.

Puede identificar:

  • Objetos.
  • Personas.
  • Texto.
  • Escenas.
  • Actividades.
  • Contenido inapropiado.

Casos de uso #

  • Moderación de contenido.
  • Verificación de identidad.
  • Análisis multimedia.
  • Automatización con cámaras.

6.2 Amazon Textract #

Amazon Textract extrae texto de documentos, formularios y tablas.

Puede reconocer texto impreso y manuscrito.

Casos de uso #

  • Procesamiento de facturas.
  • Formularios sanitarios.
  • Documentos financieros.
  • Documentos administrativos.

6.3 Amazon Kendra #

Amazon Kendra es un servicio de búsqueda inteligente empresarial.

Usa lenguaje natural para encontrar respuestas dentro de documentos y contenido corporativo.

Casos de uso #

  • Buscadores internos.
  • Chatbots empresariales.
  • Preguntas frecuentes.
  • Búsqueda documental avanzada.

7. Servicios de personalización e IA conversacional #

7.1 Amazon Lex #

Amazon Lex permite crear interfaces conversacionales de voz y texto.

Usa:

  • Reconocimiento automático de voz.
  • Comprensión del lenguaje natural.

Casos de uso #

  • Chatbots.
  • Asistentes virtuales.
  • Atención al cliente.
  • Automatización de preguntas frecuentes.

7.2 Amazon Personalize #

Amazon Personalize permite crear recomendaciones personalizadas usando datos históricos.

Casos de uso #

  • Recomendación de productos.
  • Recomendación de películas o música.
  • Personalización de contenido.
  • Recomendación de tendencias.

8. Amazon SageMaker AI #

¿Qué es? #

Amazon SageMaker AI es un servicio completamente administrado para crear, entrenar y desplegar modelos de machine learning.

Permite trabajar con modelos propios sin tener que administrar toda la infraestructura.


Funciones principales #

SageMaker AI permite:

  • Preparar datos.
  • Entrenar modelos.
  • Desplegar modelos.
  • Supervisar modelos.
  • Depurar modelos.
  • Visualizar experimentos.
  • Gestionar flujos de trabajo de ML.
  • Usar modelos preentrenados.

Casos de uso #

  • Predicción de demanda.
  • Detección de fraude.
  • Clasificación de imágenes.
  • Modelos personalizados.
  • Análisis predictivo.
  • Sistemas de recomendación.

9. IA generativa en AWS #

AWS ofrece varios servicios para construir soluciones de IA generativa.


9.1 Amazon SageMaker JumpStart #

SageMaker JumpStart es un centro dentro de SageMaker AI con modelos fundacionales y soluciones prediseñadas.

Permite desplegar modelos preentrenados rápidamente.

Casos de uso #

  • Prototipos rápidos.
  • Ajuste de modelos.
  • Experimentación con IA.
  • Soluciones de ML prediseñadas.

9.2 Amazon Bedrock #

Amazon Bedrock es un servicio completamente administrado para crear aplicaciones de IA generativa usando modelos fundacionales.

Permite acceder a modelos de Amazon y de otros proveedores mediante una API común.

Características #

  • No requiere administrar infraestructura.
  • Permite usar varios modelos fundacionales.
  • Permite adaptar modelos con datos propios.
  • Se integra con aplicaciones de AWS.
  • Está pensado para IA generativa empresarial.

Casos de uso #

  • Chatbots avanzados.
  • Generación de texto.
  • Generación de imágenes.
  • Resumen de documentos.
  • Asistentes empresariales.
  • Aplicaciones multimodales.

9.3 Amazon Q #

Amazon Q es un asistente de IA generativa de AWS.

Puede ayudar a obtener información, responder preguntas y automatizar tareas.


Amazon Q Business #

Orientado a usuarios de negocio.

Se integra con repositorios de información de la empresa.

Casos de uso #

  • Responder preguntas internas.
  • Buscar información corporativa.
  • Automatizar flujos de trabajo.
  • Extraer conocimiento de documentos.

Amazon Q Developer #

Orientado a desarrolladores.

Ayuda a escribir, revisar y mejorar código.

Casos de uso #

  • Generar código.
  • Explicar código.
  • Revisar seguridad.
  • Mejorar productividad del desarrollo.

10. Introducción al análisis de datos #

El análisis de datos consiste en transformar datos históricos sin procesar para descubrir información útil.

Sirve para:

  • Encontrar tendencias.
  • Explicar decisiones.
  • Generar informes.
  • Mejorar procesos.
  • Tomar decisiones basadas en datos.

Ejemplos #

  • Una entidad financiera analiza riesgos de préstamo.
  • Un hospital analiza datos de ensayos clínicos.
  • Una aseguradora revisa modelos de riesgo.
  • Una tienda analiza ventas por temporada.

11. Data Lake y Data Warehouse #

11.1 Data Lake #

Un lago de datos almacena grandes cantidades de datos en bruto.

Puede contener datos:

  • Estructurados.
  • Semiestructurados.
  • No estructurados.

Servicio habitual #

  • Amazon S3.

Ideal para #

  • IA/ML.
  • Big data.
  • Datos sin procesar.
  • Grandes volúmenes de información.

11.2 Data Warehouse #

Un almacén de datos almacena datos más estructurados y optimizados para análisis.

Servicio habitual #

  • Amazon Redshift.

Ideal para #

  • Business Intelligence.
  • Informes.
  • Consultas analíticas.
  • Datos organizados y preparados.

12. ETL, ELT y cero ETL #

12.1 ETL #

ETL significa:

  • Extract.
  • Transform.
  • Load.

En español:

  • Extraer.
  • Transformar.
  • Cargar.

Proceso:

  1. Extraer datos de varios orígenes.
  2. Transformarlos a un formato común.
  3. Cargarlos en un destino.

12.2 ELT #

ELT significa:

  • Extract.
  • Load.
  • Transform.

Primero se cargan los datos y luego se transforman.

Es habitual cuando se usan lagos de datos.


12.3 Cero ETL #

El enfoque cero ETL se usa cuando los datos ya están disponibles en una forma útil para el sistema destino.

Reduce la necesidad de mover y transformar datos manualmente.


13. Canalizaciones de datos #

Una canalización de datos automatiza el movimiento y transformación de datos.

Puede incluir:

  1. Ingesta.
  2. Almacenamiento.
  3. Catalogación.
  4. Procesamiento.
  5. Consulta.
  6. Visualización.

14. Servicios de ingesta de datos #

14.1 Amazon Kinesis Data Streams #

Amazon Kinesis Data Streams permite ingerir datos en tiempo real.

Casos de uso #

  • Datos de sensores.
  • Datos bursátiles.
  • Clics de usuarios.
  • Logs en tiempo real.
  • Eventos de aplicaciones.

Es adecuado cuando se necesita baja latencia.


14.2 Amazon Data Firehose #

Amazon Data Firehose permite entregar datos casi en tiempo real a destinos de almacenamiento y análisis.

Puede entregar datos a:

  • Amazon S3.
  • Amazon Redshift.
  • Servicios de análisis.

Casos de uso #

  • Datos de dispositivos IoT.
  • Logs de aplicaciones.
  • Métricas.
  • Ingesta continua hacia un data lake.

15. Servicios de almacenamiento de datos #

15.1 Amazon S3 #

Amazon S3 es muy usado como base de un lago de datos.

Permite almacenar grandes cantidades de datos de forma escalable y segura.

Ideal para #

  • Datos brutos.
  • Datos estructurados.
  • Datos no estructurados.
  • Datos para ML.
  • Data lakes.

15.2 Amazon Redshift #

Amazon Redshift es un almacén de datos completamente administrado.

Está diseñado para analizar grandes volúmenes de datos.

Características #

  • Consultas SQL complejas.
  • Arquitectura de procesamiento masivamente paralelo.
  • Almacenamiento en columnas.
  • Escala a petabytes.
  • Pago por uso.

Ideal para #

  • Business Intelligence.
  • Informes frecuentes.
  • Análisis de grandes conjuntos de datos.
  • Consultas de alto rendimiento.

16. Catalogación de datos #

AWS Glue Data Catalog #

El Catálogo de datos de AWS Glue es un repositorio centralizado de metadatos.

Ayuda a saber:

  • Qué datos existen.
  • Dónde están.
  • Qué formato tienen.
  • Cómo deben interpretarse.

Beneficios #

  • Mejora la detección de datos.
  • Facilita ETL.
  • Centraliza metadatos.
  • Se integra con otros servicios de análisis.

17. Procesamiento de datos #

17.1 AWS Glue #

AWS Glue es un servicio administrado de ETL.

Permite preparar datos para análisis.

Funciones #

  • Crear trabajos ETL.
  • Transformar datos.
  • Limpiar datos.
  • Programar procesos.
  • Usar scripts.
  • Usar herramientas visuales o sin código.

Ideal para #

  • Preparación de datos.
  • Automatización ETL.
  • Transformaciones simples o medias.
  • Integración con S3 y Redshift.

17.2 Amazon EMR #

Amazon EMR permite procesar grandes volúmenes de datos usando frameworks de big data.

Admite:

  • Apache Spark.
  • Apache Hadoop.
  • Apache Hive.

Ideal para #

  • Big data.
  • Procesamiento distribuido.
  • Análisis a gran escala.
  • Equipos con experiencia en Spark o Hadoop.
  • Configuraciones avanzadas.

18. Consulta y análisis de datos #

18.1 Amazon Athena #

Amazon Athena permite consultar datos usando SQL sin administrar servidores.

Puede consultar datos en:

  • Amazon S3.
  • Fuentes relacionales.
  • Fuentes no relacionales.
  • Entornos híbridos.
  • Entornos multinube.

Características #

  • Serverless.
  • Pago por consulta.
  • Usa SQL.
  • Ideal para análisis ad hoc.

18.2 Amazon Redshift #

Además de almacenar datos, Redshift también permite analizarlos.

Es mejor para consultas complejas, frecuentes y de alto rendimiento sobre grandes conjuntos de datos.


19. Visualización de datos #

19.1 Amazon QuickSight #

Amazon QuickSight es un servicio de Business Intelligence.

Permite crear:

  • Paneles.
  • Informes.
  • Gráficos.
  • Visualizaciones interactivas.

Características #

  • Administrado.
  • Escalable.
  • Para usuarios técnicos y no técnicos.
  • Integración con Amazon Q.
  • Permite preguntas en lenguaje natural.

19.2 Amazon OpenSearch Service #

Amazon OpenSearch Service permite buscar, analizar y visualizar datos en tiempo real.

Casos de uso #

  • Análisis de logs.
  • Observabilidad.
  • Monitorización de aplicaciones.
  • Búsqueda en sitios web.
  • Análisis operativo.
  • Métricas y trazas.

20. Ejemplo de canalización de datos en AWS #

Una empresa quiere analizar el comportamiento de clientes en su aplicación.

Flujo posible #

1Aplicación web
23Amazon Kinesis Data Streams
45Amazon S3
67AWS Glue Data Catalog
89AWS Glue / Amazon EMR
1011Amazon Athena / Amazon Redshift
1213Amazon QuickSight

Resultado #

La empresa puede crear informes, detectar patrones y alimentar modelos de machine learning.


21. Comparación rápida de servicios de análisis #

ServicioFunción principal
Kinesis Data StreamsIngesta en tiempo real
Data FirehoseEntrega casi en tiempo real
S3Lago de datos
RedshiftAlmacén de datos
Glue Data CatalogCatálogo de metadatos
AWS GlueETL administrado
EMRBig data con Spark/Hadoop
AthenaConsultas SQL serverless
QuickSightBI y dashboards
OpenSearchBúsqueda y análisis en tiempo real

22. Casos prácticos #

Caso 1: Recomendaciones personalizadas #

Una cafetería quiere recomendar productos a sus clientes.

Servicio recomendado #

Amazon Personalize.


Caso 2: Chatbot para atención al cliente #

Una empresa quiere que los usuarios hablen con un asistente virtual.

Servicio recomendado #

Amazon Lex.


Caso 3: Traducir una aplicación #

Una empresa quiere traducir contenido automáticamente a varios idiomas.

Servicio recomendado #

Amazon Translate.


Caso 4: Analizar opiniones de clientes #

Una empresa quiere saber si los comentarios son positivos o negativos.

Servicio recomendado #

Amazon Comprehend.


Caso 5: Extraer datos de facturas #

Una empresa quiere automatizar lectura de documentos.

Servicio recomendado #

Amazon Textract.


Caso 6: Crear una aplicación de IA generativa #

Una empresa quiere usar modelos fundacionales sin administrar infraestructura.

Servicio recomendado #

Amazon Bedrock.


Caso 7: Consultar datos en S3 con SQL #

Una empresa tiene datos en S3 y quiere analizarlos sin crear servidores.

Servicio recomendado #

Amazon Athena.


Caso 8: Crear dashboards empresariales #

Una empresa quiere informes visuales e interactivos.

Servicio recomendado #

Amazon QuickSight.


23. Ideas clave para el examen AWS Cloud Practitioner #

  • IA es el campo amplio de sistemas inteligentes.
  • Machine Learning es un subconjunto de IA.
  • Deep Learning es un subconjunto de ML.
  • IA generativa crea contenido nuevo.
  • Los modelos fundacionales son modelos grandes preentrenados.
  • Los LLM son modelos fundacionales entrenados con texto.
  • Amazon Comprehend analiza texto y sentimiento.
  • Amazon Polly convierte texto en voz.
  • Amazon Transcribe convierte voz en texto.
  • Amazon Translate traduce texto.
  • Amazon Rekognition analiza imágenes y vídeos.
  • Amazon Textract extrae texto de documentos.
  • Amazon Kendra es búsqueda inteligente empresarial.
  • Amazon Lex crea chatbots de voz y texto.
  • Amazon Personalize crea recomendaciones personalizadas.
  • SageMaker AI sirve para crear, entrenar y desplegar modelos ML.
  • SageMaker JumpStart ofrece modelos y soluciones prediseñadas.
  • Amazon Bedrock permite usar modelos fundacionales mediante un servicio administrado.
  • Amazon Q es un asistente de IA generativa.
  • S3 se usa frecuentemente como lago de datos.
  • Redshift es un almacén de datos.
  • Glue sirve para ETL y catálogo de datos.
  • Kinesis Data Streams sirve para ingesta en tiempo real.
  • Data Firehose entrega datos casi en tiempo real.
  • EMR procesa big data con Spark, Hadoop y Hive.
  • Athena consulta datos con SQL sin servidores.
  • QuickSight crea dashboards e informes.
  • OpenSearch sirve para búsqueda, logs, observabilidad y análisis en tiempo real.

IA/ML y análisis de datos

Loading...