IA/ML y análisis de datos
1. Introducción #
La inteligencia artificial, el machine learning y el análisis de datos permiten a las empresas obtener valor a partir de sus datos.
Una empresa puede usar estos datos para:
- Detectar patrones.
- Predecir comportamientos.
- Recomendar productos.
- Automatizar tareas.
- Analizar tendencias.
- Mejorar decisiones de negocio.
- Crear nuevos productos o servicios.
Ejemplo:
Una cafetería podría analizar pedidos anteriores para recomendar productos, prever demanda de café o decidir dónde abrir una nueva tienda.
2. Inteligencia artificial, machine learning y deep learning #
2.1 Inteligencia Artificial #
La Inteligencia Artificial (IA) es un campo amplio que busca crear sistemas capaces de realizar tareas que normalmente requieren inteligencia humana.
Ejemplos:
- Entender lenguaje natural.
- Reconocer imágenes.
- Conversar con usuarios.
- Traducir textos.
- Generar contenido.
- Tomar decisiones basadas en datos.
2.2 Machine Learning #
El Machine Learning (ML) es una rama de la IA.
Consiste en entrenar modelos con datos para que aprendan patrones y puedan hacer predicciones o tomar decisiones sin programar reglas explícitas.
Ejemplo clásico #
Sin ML:
1Si el cliente compra café latte → recomendar pan de queso
Con ML:
1El modelo analiza compras históricas y recomienda productos personalizados.
2.3 Entrenamiento e inferencia #
Entrenamiento #
Proceso en el que un modelo aprende patrones a partir de datos históricos.
Inferencia #
Uso del modelo ya entrenado para hacer predicciones sobre datos nuevos.
Ejemplo:
- Entrenamiento: analizar miles de pedidos anteriores.
- Inferencia: recomendar un producto a un nuevo cliente.
2.4 Deep Learning #
El Deep Learning es un subconjunto del machine learning.
Utiliza redes neuronales artificiales con varias capas para resolver problemas complejos.
Es especialmente útil en:
- Visión artificial.
- Procesamiento de lenguaje natural.
- Reconocimiento de voz.
- IA generativa.
3. IA generativa #
¿Qué es la IA generativa? #
La IA generativa es un tipo de deep learning capaz de crear contenido nuevo.
Puede generar:
- Texto.
- Imágenes.
- Música.
- Vídeos.
- Conversaciones.
- Código.
- Ideas.
Modelos fundacionales #
Los modelos fundacionales (FM) son modelos de IA muy grandes, preentrenados con enormes cantidades de datos.
Pueden adaptarse a múltiples tareas.
LLM #
Un LLM, o Large Language Model, es un tipo de modelo fundacional entrenado principalmente con texto.
Se utiliza para:
- Responder preguntas.
- Resumir documentos.
- Generar texto.
- Traducir.
- Crear asistentes conversacionales.
- Ayudar a programar.
4. Pila de IA y Machine Learning en AWS #
AWS organiza sus soluciones de IA/ML en tres niveles.
Nivel 1: Servicios de IA de AWS #
Son servicios administrados que ya incluyen modelos preentrenados.
El usuario no necesita entrenar el modelo desde cero.
Son ideales para tareas comunes como:
- Traducir.
- Transcribir voz.
- Analizar texto.
- Reconocer imágenes.
- Crear chatbots.
- Generar recomendaciones.
Nivel 2: Servicios de Machine Learning #
Ofrecen más control y personalización.
El servicio principal es:
- Amazon SageMaker AI.
Permite crear, entrenar y desplegar modelos propios sin gestionar toda la infraestructura.
Nivel 3: Marcos e infraestructura de ML #
Nivel más avanzado y personalizable.
Permite usar:
- Amazon EC2 optimizado para ML.
- Amazon ECS.
- Amazon EMR.
- Frameworks como TensorFlow, PyTorch y Apache MXNet.
Es adecuado cuando una empresa necesita control total sobre el entrenamiento y la infraestructura.
5. Servicios lingüísticos de IA #
5.1 Amazon Comprehend #
Amazon Comprehend usa procesamiento de lenguaje natural para analizar texto.
Permite detectar:
- Idioma.
- Sentimiento.
- Frases clave.
- Entidades.
- Temas.
Casos de uso #
- Análisis de opiniones de clientes.
- Clasificación de contenido.
- Supervisión de cumplimiento.
- Análisis de encuestas.
5.2 Amazon Polly #
Amazon Polly convierte texto en voz realista.
Casos de uso #
- Asistentes virtuales.
- Lectura automática de textos.
- Accesibilidad.
- Aplicaciones educativas.
5.3 Amazon Transcribe #
Amazon Transcribe convierte voz en texto.
Casos de uso #
- Transcripción de llamadas.
- Subtítulos automáticos.
- Análisis de reuniones.
- Generación de metadatos multimedia.
5.4 Amazon Translate #
Amazon Translate traduce texto entre idiomas.
Casos de uso #
- Traducción de documentos.
- Aplicaciones multilingües.
- Comunicación global.
- Traducción en tiempo real o por lotes.
6. Servicios de visión, búsqueda y extracción #
6.1 Amazon Rekognition #
Amazon Rekognition analiza imágenes y vídeos.
Puede identificar:
- Objetos.
- Personas.
- Texto.
- Escenas.
- Actividades.
- Contenido inapropiado.
Casos de uso #
- Moderación de contenido.
- Verificación de identidad.
- Análisis multimedia.
- Automatización con cámaras.
6.2 Amazon Textract #
Amazon Textract extrae texto de documentos, formularios y tablas.
Puede reconocer texto impreso y manuscrito.
Casos de uso #
- Procesamiento de facturas.
- Formularios sanitarios.
- Documentos financieros.
- Documentos administrativos.
6.3 Amazon Kendra #
Amazon Kendra es un servicio de búsqueda inteligente empresarial.
Usa lenguaje natural para encontrar respuestas dentro de documentos y contenido corporativo.
Casos de uso #
- Buscadores internos.
- Chatbots empresariales.
- Preguntas frecuentes.
- Búsqueda documental avanzada.
7. Servicios de personalización e IA conversacional #
7.1 Amazon Lex #
Amazon Lex permite crear interfaces conversacionales de voz y texto.
Usa:
- Reconocimiento automático de voz.
- Comprensión del lenguaje natural.
Casos de uso #
- Chatbots.
- Asistentes virtuales.
- Atención al cliente.
- Automatización de preguntas frecuentes.
7.2 Amazon Personalize #
Amazon Personalize permite crear recomendaciones personalizadas usando datos históricos.
Casos de uso #
- Recomendación de productos.
- Recomendación de películas o música.
- Personalización de contenido.
- Recomendación de tendencias.
8. Amazon SageMaker AI #
¿Qué es? #
Amazon SageMaker AI es un servicio completamente administrado para crear, entrenar y desplegar modelos de machine learning.
Permite trabajar con modelos propios sin tener que administrar toda la infraestructura.
Funciones principales #
SageMaker AI permite:
- Preparar datos.
- Entrenar modelos.
- Desplegar modelos.
- Supervisar modelos.
- Depurar modelos.
- Visualizar experimentos.
- Gestionar flujos de trabajo de ML.
- Usar modelos preentrenados.
Casos de uso #
- Predicción de demanda.
- Detección de fraude.
- Clasificación de imágenes.
- Modelos personalizados.
- Análisis predictivo.
- Sistemas de recomendación.
9. IA generativa en AWS #
AWS ofrece varios servicios para construir soluciones de IA generativa.
9.1 Amazon SageMaker JumpStart #
SageMaker JumpStart es un centro dentro de SageMaker AI con modelos fundacionales y soluciones prediseñadas.
Permite desplegar modelos preentrenados rápidamente.
Casos de uso #
- Prototipos rápidos.
- Ajuste de modelos.
- Experimentación con IA.
- Soluciones de ML prediseñadas.
9.2 Amazon Bedrock #
Amazon Bedrock es un servicio completamente administrado para crear aplicaciones de IA generativa usando modelos fundacionales.
Permite acceder a modelos de Amazon y de otros proveedores mediante una API común.
Características #
- No requiere administrar infraestructura.
- Permite usar varios modelos fundacionales.
- Permite adaptar modelos con datos propios.
- Se integra con aplicaciones de AWS.
- Está pensado para IA generativa empresarial.
Casos de uso #
- Chatbots avanzados.
- Generación de texto.
- Generación de imágenes.
- Resumen de documentos.
- Asistentes empresariales.
- Aplicaciones multimodales.
9.3 Amazon Q #
Amazon Q es un asistente de IA generativa de AWS.
Puede ayudar a obtener información, responder preguntas y automatizar tareas.
Amazon Q Business #
Orientado a usuarios de negocio.
Se integra con repositorios de información de la empresa.
Casos de uso #
- Responder preguntas internas.
- Buscar información corporativa.
- Automatizar flujos de trabajo.
- Extraer conocimiento de documentos.
Amazon Q Developer #
Orientado a desarrolladores.
Ayuda a escribir, revisar y mejorar código.
Casos de uso #
- Generar código.
- Explicar código.
- Revisar seguridad.
- Mejorar productividad del desarrollo.
10. Introducción al análisis de datos #
El análisis de datos consiste en transformar datos históricos sin procesar para descubrir información útil.
Sirve para:
- Encontrar tendencias.
- Explicar decisiones.
- Generar informes.
- Mejorar procesos.
- Tomar decisiones basadas en datos.
Ejemplos #
- Una entidad financiera analiza riesgos de préstamo.
- Un hospital analiza datos de ensayos clínicos.
- Una aseguradora revisa modelos de riesgo.
- Una tienda analiza ventas por temporada.
11. Data Lake y Data Warehouse #
11.1 Data Lake #
Un lago de datos almacena grandes cantidades de datos en bruto.
Puede contener datos:
- Estructurados.
- Semiestructurados.
- No estructurados.
Servicio habitual #
- Amazon S3.
Ideal para #
- IA/ML.
- Big data.
- Datos sin procesar.
- Grandes volúmenes de información.
11.2 Data Warehouse #
Un almacén de datos almacena datos más estructurados y optimizados para análisis.
Servicio habitual #
- Amazon Redshift.
Ideal para #
- Business Intelligence.
- Informes.
- Consultas analíticas.
- Datos organizados y preparados.
12. ETL, ELT y cero ETL #
12.1 ETL #
ETL significa:
- Extract.
- Transform.
- Load.
En español:
- Extraer.
- Transformar.
- Cargar.
Proceso:
- Extraer datos de varios orígenes.
- Transformarlos a un formato común.
- Cargarlos en un destino.
12.2 ELT #
ELT significa:
- Extract.
- Load.
- Transform.
Primero se cargan los datos y luego se transforman.
Es habitual cuando se usan lagos de datos.
12.3 Cero ETL #
El enfoque cero ETL se usa cuando los datos ya están disponibles en una forma útil para el sistema destino.
Reduce la necesidad de mover y transformar datos manualmente.
13. Canalizaciones de datos #
Una canalización de datos automatiza el movimiento y transformación de datos.
Puede incluir:
- Ingesta.
- Almacenamiento.
- Catalogación.
- Procesamiento.
- Consulta.
- Visualización.
14. Servicios de ingesta de datos #
14.1 Amazon Kinesis Data Streams #
Amazon Kinesis Data Streams permite ingerir datos en tiempo real.
Casos de uso #
- Datos de sensores.
- Datos bursátiles.
- Clics de usuarios.
- Logs en tiempo real.
- Eventos de aplicaciones.
Es adecuado cuando se necesita baja latencia.
14.2 Amazon Data Firehose #
Amazon Data Firehose permite entregar datos casi en tiempo real a destinos de almacenamiento y análisis.
Puede entregar datos a:
- Amazon S3.
- Amazon Redshift.
- Servicios de análisis.
Casos de uso #
- Datos de dispositivos IoT.
- Logs de aplicaciones.
- Métricas.
- Ingesta continua hacia un data lake.
15. Servicios de almacenamiento de datos #
15.1 Amazon S3 #
Amazon S3 es muy usado como base de un lago de datos.
Permite almacenar grandes cantidades de datos de forma escalable y segura.
Ideal para #
- Datos brutos.
- Datos estructurados.
- Datos no estructurados.
- Datos para ML.
- Data lakes.
15.2 Amazon Redshift #
Amazon Redshift es un almacén de datos completamente administrado.
Está diseñado para analizar grandes volúmenes de datos.
Características #
- Consultas SQL complejas.
- Arquitectura de procesamiento masivamente paralelo.
- Almacenamiento en columnas.
- Escala a petabytes.
- Pago por uso.
Ideal para #
- Business Intelligence.
- Informes frecuentes.
- Análisis de grandes conjuntos de datos.
- Consultas de alto rendimiento.
16. Catalogación de datos #
AWS Glue Data Catalog #
El Catálogo de datos de AWS Glue es un repositorio centralizado de metadatos.
Ayuda a saber:
- Qué datos existen.
- Dónde están.
- Qué formato tienen.
- Cómo deben interpretarse.
Beneficios #
- Mejora la detección de datos.
- Facilita ETL.
- Centraliza metadatos.
- Se integra con otros servicios de análisis.
17. Procesamiento de datos #
17.1 AWS Glue #
AWS Glue es un servicio administrado de ETL.
Permite preparar datos para análisis.
Funciones #
- Crear trabajos ETL.
- Transformar datos.
- Limpiar datos.
- Programar procesos.
- Usar scripts.
- Usar herramientas visuales o sin código.
Ideal para #
- Preparación de datos.
- Automatización ETL.
- Transformaciones simples o medias.
- Integración con S3 y Redshift.
17.2 Amazon EMR #
Amazon EMR permite procesar grandes volúmenes de datos usando frameworks de big data.
Admite:
- Apache Spark.
- Apache Hadoop.
- Apache Hive.
Ideal para #
- Big data.
- Procesamiento distribuido.
- Análisis a gran escala.
- Equipos con experiencia en Spark o Hadoop.
- Configuraciones avanzadas.
18. Consulta y análisis de datos #
18.1 Amazon Athena #
Amazon Athena permite consultar datos usando SQL sin administrar servidores.
Puede consultar datos en:
- Amazon S3.
- Fuentes relacionales.
- Fuentes no relacionales.
- Entornos híbridos.
- Entornos multinube.
Características #
- Serverless.
- Pago por consulta.
- Usa SQL.
- Ideal para análisis ad hoc.
18.2 Amazon Redshift #
Además de almacenar datos, Redshift también permite analizarlos.
Es mejor para consultas complejas, frecuentes y de alto rendimiento sobre grandes conjuntos de datos.
19. Visualización de datos #
19.1 Amazon QuickSight #
Amazon QuickSight es un servicio de Business Intelligence.
Permite crear:
- Paneles.
- Informes.
- Gráficos.
- Visualizaciones interactivas.
Características #
- Administrado.
- Escalable.
- Para usuarios técnicos y no técnicos.
- Integración con Amazon Q.
- Permite preguntas en lenguaje natural.
19.2 Amazon OpenSearch Service #
Amazon OpenSearch Service permite buscar, analizar y visualizar datos en tiempo real.
Casos de uso #
- Análisis de logs.
- Observabilidad.
- Monitorización de aplicaciones.
- Búsqueda en sitios web.
- Análisis operativo.
- Métricas y trazas.
20. Ejemplo de canalización de datos en AWS #
Una empresa quiere analizar el comportamiento de clientes en su aplicación.
Flujo posible #
1Aplicación web 2 ↓ 3Amazon Kinesis Data Streams 4 ↓ 5Amazon S3 6 ↓ 7AWS Glue Data Catalog 8 ↓ 9AWS Glue / Amazon EMR 10 ↓ 11Amazon Athena / Amazon Redshift 12 ↓ 13Amazon QuickSight
Resultado #
La empresa puede crear informes, detectar patrones y alimentar modelos de machine learning.
21. Comparación rápida de servicios de análisis #
| Servicio | Función principal |
|---|---|
| Kinesis Data Streams | Ingesta en tiempo real |
| Data Firehose | Entrega casi en tiempo real |
| S3 | Lago de datos |
| Redshift | Almacén de datos |
| Glue Data Catalog | Catálogo de metadatos |
| AWS Glue | ETL administrado |
| EMR | Big data con Spark/Hadoop |
| Athena | Consultas SQL serverless |
| QuickSight | BI y dashboards |
| OpenSearch | Búsqueda y análisis en tiempo real |
22. Casos prácticos #
Caso 1: Recomendaciones personalizadas #
Una cafetería quiere recomendar productos a sus clientes.
Servicio recomendado #
Amazon Personalize.
Caso 2: Chatbot para atención al cliente #
Una empresa quiere que los usuarios hablen con un asistente virtual.
Servicio recomendado #
Amazon Lex.
Caso 3: Traducir una aplicación #
Una empresa quiere traducir contenido automáticamente a varios idiomas.
Servicio recomendado #
Amazon Translate.
Caso 4: Analizar opiniones de clientes #
Una empresa quiere saber si los comentarios son positivos o negativos.
Servicio recomendado #
Amazon Comprehend.
Caso 5: Extraer datos de facturas #
Una empresa quiere automatizar lectura de documentos.
Servicio recomendado #
Amazon Textract.
Caso 6: Crear una aplicación de IA generativa #
Una empresa quiere usar modelos fundacionales sin administrar infraestructura.
Servicio recomendado #
Amazon Bedrock.
Caso 7: Consultar datos en S3 con SQL #
Una empresa tiene datos en S3 y quiere analizarlos sin crear servidores.
Servicio recomendado #
Amazon Athena.
Caso 8: Crear dashboards empresariales #
Una empresa quiere informes visuales e interactivos.
Servicio recomendado #
Amazon QuickSight.
23. Ideas clave para el examen AWS Cloud Practitioner #
- IA es el campo amplio de sistemas inteligentes.
- Machine Learning es un subconjunto de IA.
- Deep Learning es un subconjunto de ML.
- IA generativa crea contenido nuevo.
- Los modelos fundacionales son modelos grandes preentrenados.
- Los LLM son modelos fundacionales entrenados con texto.
- Amazon Comprehend analiza texto y sentimiento.
- Amazon Polly convierte texto en voz.
- Amazon Transcribe convierte voz en texto.
- Amazon Translate traduce texto.
- Amazon Rekognition analiza imágenes y vídeos.
- Amazon Textract extrae texto de documentos.
- Amazon Kendra es búsqueda inteligente empresarial.
- Amazon Lex crea chatbots de voz y texto.
- Amazon Personalize crea recomendaciones personalizadas.
- SageMaker AI sirve para crear, entrenar y desplegar modelos ML.
- SageMaker JumpStart ofrece modelos y soluciones prediseñadas.
- Amazon Bedrock permite usar modelos fundacionales mediante un servicio administrado.
- Amazon Q es un asistente de IA generativa.
- S3 se usa frecuentemente como lago de datos.
- Redshift es un almacén de datos.
- Glue sirve para ETL y catálogo de datos.
- Kinesis Data Streams sirve para ingesta en tiempo real.
- Data Firehose entrega datos casi en tiempo real.
- EMR procesa big data con Spark, Hadoop y Hive.
- Athena consulta datos con SQL sin servidores.
- QuickSight crea dashboards e informes.
- OpenSearch sirve para búsqueda, logs, observabilidad y análisis en tiempo real.