Resumen: IA/ML y análisis de datos

Inteligencia Artificial (IA) #

Qué es: Campo de la informática que desarrolla sistemas capaces de realizar tareas que normalmente requieren inteligencia humana, como comprender lenguaje, reconocer imágenes o tomar decisiones.

Cómo recordarlo: IA = un cerebro artificial.


Machine Learning (ML) #

Qué es: Rama de la IA que permite a los modelos aprender patrones a partir de datos sin programar reglas explícitas.

Cómo recordarlo: ML = aprender por experiencia.

No confundir con: IA, que es un concepto más amplio.


Deep Learning (DL) #

Qué es: Subcampo del Machine Learning que utiliza redes neuronales profundas para resolver problemas complejos.

Cómo recordarlo: Deep Learning = un cerebro con muchas capas.

No confundir con: Machine Learning tradicional.


Entrenamiento (Training) #

Qué es: Proceso mediante el cual un modelo aprende utilizando datos históricos.

Cómo recordarlo: Entrenar = estudiar antes del examen.


Inferencia (Inference) #

Qué es: Uso de un modelo ya entrenado para realizar predicciones o responder preguntas.

Cómo recordarlo: Inferencia = hacer el examen utilizando lo aprendido.


IA Generativa (Generative AI) #

Qué es: Tipo de IA capaz de crear contenido nuevo, como texto, imágenes, código, música o vídeos.

Cómo recordarlo: IA Generativa = un creador de contenido.


Modelo Fundacional (Foundation Model - FM) #

Qué es: Modelo de IA muy grande, entrenado con enormes cantidades de datos y reutilizable para muchas tareas diferentes.

Cómo recordarlo: FM = un cerebro ya entrenado.


LLM (Large Language Model) #

Qué es: Modelo fundacional especializado en comprender y generar texto.

Cómo recordarlo: LLM = un experto en lenguaje.

No confundir con: Un modelo de visión artificial.


Amazon Comprehend #

Qué es: Servicio de IA que analiza texto utilizando procesamiento de lenguaje natural (NLP), detectando idioma, sentimiento, entidades y temas.

Cómo recordarlo: Comprehend = comprender un texto.


Procesamiento de Lenguaje Natural (NLP) #

Qué es: Tecnología que permite a las máquinas comprender y analizar lenguaje humano.

Cómo recordarlo: NLP = enseñar a un ordenador a leer.


Amazon Polly #

Qué es: Servicio que convierte texto en voz natural.

Cómo recordarlo: Polly = el lector de textos.


Amazon Transcribe #

Qué es: Servicio que convierte voz en texto automáticamente.

Cómo recordarlo: Transcribe = escribir lo que escucha.


Amazon Translate #

Qué es: Servicio que traduce texto automáticamente entre distintos idiomas.

Cómo recordarlo: Translate = el traductor automático.


Amazon Rekognition #

Qué es: Servicio que analiza imágenes y vídeos para detectar personas, objetos, texto o actividades.

Cómo recordarlo: Rekognition = los ojos de AWS.


Amazon Textract #

Qué es: Servicio que extrae texto, tablas y formularios de documentos escaneados o imágenes.

Cómo recordarlo: Textract = sacar el texto de un documento.


Amazon Kendra #

Qué es: Motor de búsqueda inteligente para encontrar información dentro de documentos empresariales usando lenguaje natural.

Cómo recordarlo: Kendra = el Google de tu empresa.


Amazon Lex #

Qué es: Servicio para crear chatbots y asistentes virtuales mediante voz o texto.

Cómo recordarlo: Lex = el chatbot de AWS.

No confundir con: Amazon Polly o Transcribe; Lex mantiene una conversación.


Amazon Personalize #

Qué es: Servicio que genera recomendaciones personalizadas utilizando Machine Learning.

Cómo recordarlo: Personalize = el recomendador de Netflix o Amazon.


Amazon SageMaker AI #

Qué es: Servicio administrado para crear, entrenar, desplegar y supervisar modelos de Machine Learning propios.

Cómo recordarlo: SageMaker = el taller donde construyes modelos de IA.

No confundir con: Bedrock, que utiliza modelos ya creados.


Amazon SageMaker JumpStart #

Qué es: Catálogo de modelos fundacionales y soluciones prediseñadas dentro de SageMaker.

Cómo recordarlo: JumpStart = empezar con ventaja.


Amazon Bedrock #

Qué es: Servicio administrado que permite utilizar modelos fundacionales de Amazon y otros proveedores mediante una API común, sin gestionar infraestructura.

Cómo recordarlo: Bedrock = ChatGPT como servicio de AWS.

No confundir con: SageMaker, donde puedes entrenar modelos propios.


Amazon Q #

Qué es: Asistente de IA generativa de AWS para responder preguntas y automatizar tareas.

Cómo recordarlo: Amazon Q = el ChatGPT de AWS.


Amazon Q Business #

Qué es: Versión de Amazon Q orientada a usuarios de negocio para consultar documentación empresarial.

Cómo recordarlo: Q Business = el asistente de la empresa.


Amazon Q Developer #

Qué es: Versión de Amazon Q diseñada para ayudar a los desarrolladores a escribir, explicar y mejorar código.

Cómo recordarlo: Q Developer = el compañero programador.


Análisis de datos #

Data Lake #

Qué es: Repositorio donde se almacenan grandes cantidades de datos en bruto (estructurados y no estructurados). Normalmente utiliza Amazon S3.

Cómo recordarlo: Data Lake = un lago donde se vierte toda el agua (datos).

No confundir con: Data Warehouse.


Data Warehouse #

Qué es: Almacén de datos organizados y preparados para realizar consultas analíticas y generar informes. Habitualmente utiliza Amazon Redshift.

Cómo recordarlo: Data Warehouse = un almacén perfectamente ordenado.


ETL (Extract, Transform, Load) #

Qué es: Proceso de extraer datos, transformarlos y cargarlos en un sistema de destino.

Cómo recordarlo: ETL = recoger → limpiar → guardar.


ELT (Extract, Load, Transform) #

Qué es: Variante donde primero se cargan los datos y después se transforman.

Cómo recordarlo: ELT = guardar primero, ordenar después.


Cero ETL (Zero ETL) #

Qué es: Enfoque que minimiza o elimina las transformaciones manuales entre sistemas.

Cómo recordarlo: Cero ETL = conectar directamente los datos.


Canalización de datos (Data Pipeline) #

Qué es: Flujo automatizado que mueve, transforma y analiza datos.

Cómo recordarlo: Una cadena de montaje para datos.


Amazon Kinesis Data Streams #

Qué es: Servicio para capturar e ingerir datos en tiempo real.

Cómo recordarlo: Kinesis = una cinta transportadora de datos en tiempo real.


Amazon Data Firehose #

Qué es: Servicio que entrega automáticamente datos casi en tiempo real a destinos como Amazon S3 o Amazon Redshift.

Cómo recordarlo: Firehose = una manguera que envía datos automáticamente.

No confundir con: Kinesis Data Streams; Firehose entrega los datos directamente.


Amazon Redshift #

Qué es: Almacén de datos (Data Warehouse) administrado para consultas analíticas de grandes volúmenes de información.

Cómo recordarlo: Redshift = el almacén para hacer informes.

No confundir con: Amazon RDS, que está orientado a aplicaciones transaccionales.


Procesamiento Masivamente Paralelo (MPP) #

Qué es: Arquitectura utilizada por Redshift que distribuye las consultas entre múltiples nodos para acelerar el análisis.

Cómo recordarlo: Muchos trabajadores haciendo el mismo trabajo a la vez.


AWS Glue Data Catalog #

Qué es: Catálogo centralizado de metadatos que describe qué datos existen, dónde están y cómo deben interpretarse.

Cómo recordarlo: El índice de una biblioteca.


AWS Glue #

Qué es: Servicio administrado para realizar procesos ETL y preparar datos para su análisis.

Cómo recordarlo: Glue = el pegamento que une y transforma datos.


Amazon EMR (Elastic MapReduce) #

Qué es: Servicio para procesar Big Data utilizando frameworks como Apache Spark, Hadoop y Hive.

Cómo recordarlo: EMR = la fábrica de procesamiento masivo de datos.


Apache Spark #

Qué es: Framework de procesamiento distribuido de datos de alto rendimiento.

Cómo recordarlo: Spark = el motor rápido para Big Data.


Apache Hadoop #

Qué es: Framework para almacenar y procesar grandes volúmenes de datos de forma distribuida.

Cómo recordarlo: Hadoop = repartir el trabajo entre muchos ordenadores.


Amazon Athena #

Qué es: Servicio serverless que permite consultar datos almacenados en S3 utilizando SQL, sin administrar servidores.

Cómo recordarlo: Athena = SQL directamente sobre S3.


Amazon QuickSight #

Qué es: Servicio de Business Intelligence (BI) que crea paneles, informes y gráficos interactivos.

Cómo recordarlo: QuickSight = Power BI de AWS.


Business Intelligence (BI) #

Qué es: Conjunto de herramientas para analizar datos y generar informes que apoyen la toma de decisiones.

Cómo recordarlo: BI = convertir datos en gráficos e información útil.


Dashboard #

Qué es: Panel visual con gráficos e indicadores que resume información importante.

Cómo recordarlo: El cuadro de mandos de un coche.


Amazon OpenSearch Service #

Qué es: Servicio para buscar, analizar y visualizar datos en tiempo real, especialmente logs y métricas.

Cómo recordarlo: OpenSearch = el buscador y analizador de logs.


Observabilidad (Observability) #

Qué es: Capacidad para conocer el estado de una aplicación mediante logs, métricas y trazas.

Cómo recordarlo: La revisión médica de una aplicación.


📌 Regla mnemotécnica muy útil para el examen #

  • Comprehend = Comprender texto
  • Polly = Texto → Voz
  • Transcribe = Voz → Texto
  • Translate = Traductor
  • Rekognition = Los ojos de AWS
  • Textract = Extraer texto de documentos
  • Kendra = Google empresarial
  • Lex = Chatbot
  • Personalize = Recomendador
  • SageMaker = Crear modelos de ML
  • Bedrock = Usar modelos fundacionales
  • Amazon Q = Asistente de IA
  • S3 = Data Lake
  • Redshift = Data Warehouse
  • Glue = ETL
  • Athena = SQL sobre S3
  • QuickSight = Dashboards
  • OpenSearch = Buscar y analizar logs
  • Kinesis = Datos en tiempo real
  • Firehose = Entrega automática de datos