Resumen: IA/ML y análisis de datos
Inteligencia Artificial (IA) #
Qué es: Campo de la informática que desarrolla sistemas capaces de realizar tareas que normalmente requieren inteligencia humana, como comprender lenguaje, reconocer imágenes o tomar decisiones.
Cómo recordarlo: IA = un cerebro artificial.
Machine Learning (ML) #
Qué es: Rama de la IA que permite a los modelos aprender patrones a partir de datos sin programar reglas explícitas.
Cómo recordarlo: ML = aprender por experiencia.
No confundir con: IA, que es un concepto más amplio.
Deep Learning (DL) #
Qué es: Subcampo del Machine Learning que utiliza redes neuronales profundas para resolver problemas complejos.
Cómo recordarlo: Deep Learning = un cerebro con muchas capas.
No confundir con: Machine Learning tradicional.
Entrenamiento (Training) #
Qué es: Proceso mediante el cual un modelo aprende utilizando datos históricos.
Cómo recordarlo: Entrenar = estudiar antes del examen.
Inferencia (Inference) #
Qué es: Uso de un modelo ya entrenado para realizar predicciones o responder preguntas.
Cómo recordarlo: Inferencia = hacer el examen utilizando lo aprendido.
IA Generativa (Generative AI) #
Qué es: Tipo de IA capaz de crear contenido nuevo, como texto, imágenes, código, música o vídeos.
Cómo recordarlo: IA Generativa = un creador de contenido.
Modelo Fundacional (Foundation Model - FM) #
Qué es: Modelo de IA muy grande, entrenado con enormes cantidades de datos y reutilizable para muchas tareas diferentes.
Cómo recordarlo: FM = un cerebro ya entrenado.
LLM (Large Language Model) #
Qué es: Modelo fundacional especializado en comprender y generar texto.
Cómo recordarlo: LLM = un experto en lenguaje.
No confundir con: Un modelo de visión artificial.
Amazon Comprehend #
Qué es: Servicio de IA que analiza texto utilizando procesamiento de lenguaje natural (NLP), detectando idioma, sentimiento, entidades y temas.
Cómo recordarlo: Comprehend = comprender un texto.
Procesamiento de Lenguaje Natural (NLP) #
Qué es: Tecnología que permite a las máquinas comprender y analizar lenguaje humano.
Cómo recordarlo: NLP = enseñar a un ordenador a leer.
Amazon Polly #
Qué es: Servicio que convierte texto en voz natural.
Cómo recordarlo: Polly = el lector de textos.
Amazon Transcribe #
Qué es: Servicio que convierte voz en texto automáticamente.
Cómo recordarlo: Transcribe = escribir lo que escucha.
Amazon Translate #
Qué es: Servicio que traduce texto automáticamente entre distintos idiomas.
Cómo recordarlo: Translate = el traductor automático.
Amazon Rekognition #
Qué es: Servicio que analiza imágenes y vídeos para detectar personas, objetos, texto o actividades.
Cómo recordarlo: Rekognition = los ojos de AWS.
Amazon Textract #
Qué es: Servicio que extrae texto, tablas y formularios de documentos escaneados o imágenes.
Cómo recordarlo: Textract = sacar el texto de un documento.
Amazon Kendra #
Qué es: Motor de búsqueda inteligente para encontrar información dentro de documentos empresariales usando lenguaje natural.
Cómo recordarlo: Kendra = el Google de tu empresa.
Amazon Lex #
Qué es: Servicio para crear chatbots y asistentes virtuales mediante voz o texto.
Cómo recordarlo: Lex = el chatbot de AWS.
No confundir con: Amazon Polly o Transcribe; Lex mantiene una conversación.
Amazon Personalize #
Qué es: Servicio que genera recomendaciones personalizadas utilizando Machine Learning.
Cómo recordarlo: Personalize = el recomendador de Netflix o Amazon.
Amazon SageMaker AI #
Qué es: Servicio administrado para crear, entrenar, desplegar y supervisar modelos de Machine Learning propios.
Cómo recordarlo: SageMaker = el taller donde construyes modelos de IA.
No confundir con: Bedrock, que utiliza modelos ya creados.
Amazon SageMaker JumpStart #
Qué es: Catálogo de modelos fundacionales y soluciones prediseñadas dentro de SageMaker.
Cómo recordarlo: JumpStart = empezar con ventaja.
Amazon Bedrock #
Qué es: Servicio administrado que permite utilizar modelos fundacionales de Amazon y otros proveedores mediante una API común, sin gestionar infraestructura.
Cómo recordarlo: Bedrock = ChatGPT como servicio de AWS.
No confundir con: SageMaker, donde puedes entrenar modelos propios.
Amazon Q #
Qué es: Asistente de IA generativa de AWS para responder preguntas y automatizar tareas.
Cómo recordarlo: Amazon Q = el ChatGPT de AWS.
Amazon Q Business #
Qué es: Versión de Amazon Q orientada a usuarios de negocio para consultar documentación empresarial.
Cómo recordarlo: Q Business = el asistente de la empresa.
Amazon Q Developer #
Qué es: Versión de Amazon Q diseñada para ayudar a los desarrolladores a escribir, explicar y mejorar código.
Cómo recordarlo: Q Developer = el compañero programador.
Análisis de datos #
Data Lake #
Qué es: Repositorio donde se almacenan grandes cantidades de datos en bruto (estructurados y no estructurados). Normalmente utiliza Amazon S3.
Cómo recordarlo: Data Lake = un lago donde se vierte toda el agua (datos).
No confundir con: Data Warehouse.
Data Warehouse #
Qué es: Almacén de datos organizados y preparados para realizar consultas analíticas y generar informes. Habitualmente utiliza Amazon Redshift.
Cómo recordarlo: Data Warehouse = un almacén perfectamente ordenado.
ETL (Extract, Transform, Load) #
Qué es: Proceso de extraer datos, transformarlos y cargarlos en un sistema de destino.
Cómo recordarlo: ETL = recoger → limpiar → guardar.
ELT (Extract, Load, Transform) #
Qué es: Variante donde primero se cargan los datos y después se transforman.
Cómo recordarlo: ELT = guardar primero, ordenar después.
Cero ETL (Zero ETL) #
Qué es: Enfoque que minimiza o elimina las transformaciones manuales entre sistemas.
Cómo recordarlo: Cero ETL = conectar directamente los datos.
Canalización de datos (Data Pipeline) #
Qué es: Flujo automatizado que mueve, transforma y analiza datos.
Cómo recordarlo: Una cadena de montaje para datos.
Amazon Kinesis Data Streams #
Qué es: Servicio para capturar e ingerir datos en tiempo real.
Cómo recordarlo: Kinesis = una cinta transportadora de datos en tiempo real.
Amazon Data Firehose #
Qué es: Servicio que entrega automáticamente datos casi en tiempo real a destinos como Amazon S3 o Amazon Redshift.
Cómo recordarlo: Firehose = una manguera que envía datos automáticamente.
No confundir con: Kinesis Data Streams; Firehose entrega los datos directamente.
Amazon Redshift #
Qué es: Almacén de datos (Data Warehouse) administrado para consultas analíticas de grandes volúmenes de información.
Cómo recordarlo: Redshift = el almacén para hacer informes.
No confundir con: Amazon RDS, que está orientado a aplicaciones transaccionales.
Procesamiento Masivamente Paralelo (MPP) #
Qué es: Arquitectura utilizada por Redshift que distribuye las consultas entre múltiples nodos para acelerar el análisis.
Cómo recordarlo: Muchos trabajadores haciendo el mismo trabajo a la vez.
AWS Glue Data Catalog #
Qué es: Catálogo centralizado de metadatos que describe qué datos existen, dónde están y cómo deben interpretarse.
Cómo recordarlo: El índice de una biblioteca.
AWS Glue #
Qué es: Servicio administrado para realizar procesos ETL y preparar datos para su análisis.
Cómo recordarlo: Glue = el pegamento que une y transforma datos.
Amazon EMR (Elastic MapReduce) #
Qué es: Servicio para procesar Big Data utilizando frameworks como Apache Spark, Hadoop y Hive.
Cómo recordarlo: EMR = la fábrica de procesamiento masivo de datos.
Apache Spark #
Qué es: Framework de procesamiento distribuido de datos de alto rendimiento.
Cómo recordarlo: Spark = el motor rápido para Big Data.
Apache Hadoop #
Qué es: Framework para almacenar y procesar grandes volúmenes de datos de forma distribuida.
Cómo recordarlo: Hadoop = repartir el trabajo entre muchos ordenadores.
Amazon Athena #
Qué es: Servicio serverless que permite consultar datos almacenados en S3 utilizando SQL, sin administrar servidores.
Cómo recordarlo: Athena = SQL directamente sobre S3.
Amazon QuickSight #
Qué es: Servicio de Business Intelligence (BI) que crea paneles, informes y gráficos interactivos.
Cómo recordarlo: QuickSight = Power BI de AWS.
Business Intelligence (BI) #
Qué es: Conjunto de herramientas para analizar datos y generar informes que apoyen la toma de decisiones.
Cómo recordarlo: BI = convertir datos en gráficos e información útil.
Dashboard #
Qué es: Panel visual con gráficos e indicadores que resume información importante.
Cómo recordarlo: El cuadro de mandos de un coche.
Amazon OpenSearch Service #
Qué es: Servicio para buscar, analizar y visualizar datos en tiempo real, especialmente logs y métricas.
Cómo recordarlo: OpenSearch = el buscador y analizador de logs.
Observabilidad (Observability) #
Qué es: Capacidad para conocer el estado de una aplicación mediante logs, métricas y trazas.
Cómo recordarlo: La revisión médica de una aplicación.
📌 Regla mnemotécnica muy útil para el examen #
- Comprehend = Comprender texto
- Polly = Texto → Voz
- Transcribe = Voz → Texto
- Translate = Traductor
- Rekognition = Los ojos de AWS
- Textract = Extraer texto de documentos
- Kendra = Google empresarial
- Lex = Chatbot
- Personalize = Recomendador
- SageMaker = Crear modelos de ML
- Bedrock = Usar modelos fundacionales
- Amazon Q = Asistente de IA
- S3 = Data Lake
- Redshift = Data Warehouse
- Glue = ETL
- Athena = SQL sobre S3
- QuickSight = Dashboards
- OpenSearch = Buscar y analizar logs
- Kinesis = Datos en tiempo real
- Firehose = Entrega automática de datos