2022/07/26

S3 Gráficas de Cajas y Bigotes

GRÁFICAS DE CAJAS Y BIGOTES

Revisemos juntos
¿Qué son los gráficos de caja?
Bueno, para eso también hemos preparado un cuaderno igual que las lecciones anteriores.
Nuestro cuaderno cabe destacar que, se los repito, por favor descarguenlo en una carpeta.
Recuerdan en que carpeta va a ser porque después tiene que, el material adicional, pegarlo en la carpeta de Data para que podamos trabajar con el.
En mi caso ya lo tengo descargado y lo tengo en mi escritorio.
Entonces, voy a abrir mi cuaderno, mi cuaderno 'Gráfica de Caja'.
Mi cuaderno empieza de igual forma que los ejemplos anteriores con una pequeña explicación para la gente que no conoce ese tipo de gráficas.
Y después continuaremos haciendo algunos cuantos ejercicios, utilizando Python.
Bueno,
¿Qué es una gráfica de caja?
Las gráficas de caja son una conveniente representación gráfica de un grupo de datos utilizando sus cuartiles como referencia.
Este tipo de gráficas son utilizadas en la estadística descriptiva y son una excelente forma de analizar los datos rápidamente con la ventaja principal de que ocupan un espacio muy reducido.
¿Cuáles son las cosas que se pueden observar con un gráfico de datos?
Aquí tiene un ejemplo, aún no sabemos como se desarrolla, no sabemos como se dibujan las cajas pero va a analizar sus componentes.
tiene un extremo superior asociado o el valor mayor, tiene un extremo inferior asociado al valor menor y tiene un punto intermedio que es la mediana.
La mediana es el punto más importante en el que va a empezar a referenciar nuestras gráfica.
De la mediana a un cuartil superior va a identificar el 25 por ciento de los datos, en esta sección que nuestro ejemplo, está en un verde oscuro, el 25% de los datos que estén entre el cuartil superior y el extremo superior están en esta línea recta.
Normalmente esas líneas se conocen como bigotes, de igual forma, de la mediana al cuartel inferior se encuentra el 25% de nuestros datos y del cuartil inferior al extremo inferior se concentran en los datos restantes.
Algunas veces hay datos que son completamente atípicos que son o muy mayor o muy muy muy mayores que ya se alejan mucho o muy menores.
Estos datos atípicos en los diagramas de caja se representan como estos puntos individuales pero, bueno va a hacer un ejemplo de calificaciones, de algo del día a día para que podamos entender
¿Cómo se construye esta caja?
En la siguiente tabla se presentan las calificaciones de 15 alumnos aquí las se podra ver y están ordenadas desde el 53 que es la mínima hasta el 94 que es la máxima.
Encontramos la mediana cuando ya están ordenados localizando el punto que este exactamente a la mitad.
En el caso de aquí es el 79, el cuartil inferior lo va a encontrar buscando la mitad de los datos que están del lado izquierdo de la mediana es decir el 69 y el cuartil superior lo va a encontrar de la misma forma pero con los datos que están después de la mediana es decir la mitad de estos datos el 87.
Entonces mis datos importantes quedan como el extremo menor el 53, el cuartil 1 o cuartil inferior el 69, la media o cuartil 2 el 79, el cuartil superior o cuartil 3 el 87, y el extremo superior el 94.
Yo ubico esos puntos en mi caja, los extremos de los bigotes son el valor menor y el valor mayor.
La caja empieza a dibujarse a partir del cuartil 1 hasta el cuartil 2 con un color claro y del cuartil 2 al cuartil 3 en este caso con un color más oscuro entonces nuestra gráfica esta dividida por cuatro conjuntos de datos.
Los datos en la línea izquierda que son los que están entre el valor menor y el cuartil inferior, los datos que están en la primera sección de la caja entre el cuartil 1 y la mediana, los datos que están en la segunda sección de la caja del cuartil 2 al cuartil 3 y los datos que están entre el cuartil 3 y el valor máximo.
Normalmente en este tipo de ejemplos, en este tipo de representaciones el 50% de los datos están contenidos dentro de la caja lo cual nos permite darnos una idea sencilla y rápida de cómo se encuentran distribuidos los datos, simplemente viendo la caja y sin tener conocimiento de ellos.
Continuaremos utilizando la misma libreta para realizar algunos cuantos ejemplos, ocuparemos la misma base de datos que ocupamos en el ejercicio de los Histogramas de 'Enfermedades del corazón', de todas formas si este es el primer vídeo que estás siguiendo de manera práctica, no te preocupes aquí está el link por si quieres bajarlo desde Kaggle pero, bueno.
Empezaremos nuestro ejemplo diciéndole que va a trabajar con pandas porque necesitamos esta herramienta para trabajar los Data Frames, empieza importando pandas como un pd, le doy run y le digo mi data frame va a ser igual a lo que leas, con pandas del archivo corazón, y voy a mostrar los primeros 5 valores de esta Data Frame para ver que lo haya importado en forma correcta.
Aquí tengo los primeros 5 registros de este Data Frame y ahora sí voy a trabajar con este.
Con esto, voy a hacer unas 'Gráficas de Cajas'.
Bueno, la primera parte voy a ocupar Matplotlib y lo voy a importar como plt para poder trabajar gráficas.
Además le voy a decir que voy a ocupar en línea Matplotlib para que pueda utilizarlos dentro de esta libreta.
Bueno, mi primera parte voy a hacer un 'Box Plot' o 'Gráfico de Cajas' con la columna de colesterol y el Data Frame y a esa gráfica le voy a poner box plot de colesterol.
va a mostrarla, va a darle run y aquí está mi primera gráfica de cajas hecha a través de Matplotlib.
Matplotlib me da este valor, aquí puedo ver la la media que está cerca de 240 Puedo ver el cuartil inferior, el cuartil superior, el extremo inferior, el extremo superior y todos estos valores, son valores atípicos que están representados como puntos.
va a seguir trabajando con esto, yo puedo decirle a mi 'Box Plot' que me separe por sexo, utilizando el colesterol como referencia, entonces me va a dar un box plot para las mujeres y para los hombres.
va a ver cómo se vería.
En este caso en particular tengo esta box plot.
empieza a ver unas cuantas, como que, problemáticas en el título se ve muy agrupado el texto.
Pandas tiene la problemática de que al trabajar box plots y mostrarlas a través de Matplotlib empieza a verse un poco mal.
Bueno eso lo va a suplir ocupando la paquetería 'seaborn' para darle un poco más de estilo a nuestra gráficas pero, ahorita va a ver qué nos representa.
Aquí nos dice que existen 2 sexos 0 y 1, en esta Base de Datos '0' es para femenino, '1' es para masculino.
Así lo representaron los que subieron la Base de Datos a Kaggle y aquí se podra ver que en el caso de las mujeres tienen un rango de valores más grande en colesterol que los hombres que están distribuidos más agrupados pero, bueno.
va a ver cómo se vería la misma gráfica pero utilizando 'seaborn'.
Entonces importo 'seaborn' con las letras 'sns' y 'sns.boxplot' En la 'x' voy a ocupar el sexo que sería igual que en el ejemplo pasado y en la 'y' voy a ocupar el colesterol de donde provienen los datos de mi Data Frame donde yo estaba trabajando 'df', el que había inicializado desde arriba.
Entonces va a ver
¿Qué pasa?
Si le doy run fíjense como las gráficas son muchísimo más amistosas que las gráficas anteriores son más fáciles de distinguir, pero en particular estas cajas su ancho es muy exagerado a lo mejor en este esquema se ven bien pero, puede uno controlar ese tipo de parámetros.
¿Cómo?
A la instrucción simplemente se le agrega el parámetro ancho, del inglés 'width'.
Entonces al darle un width de 0.2 y darle ejecutar la misma gráfica ya la hace muchísimo más corta, e igual que como vimos en el ejemplo de los histogramas seaborn tiene cargada una forma de hacer un poco más estéticas las gráficas y los histogramas y las gráficas de cajas.
En este caso le va a pasar ese estilo con la función sns.set Vean como es un poco diferente, visualmente pero representan los mismos datos
¿Qué más se podra hacer?
Una mejora que se le puede dar a las gráficas de cajas es darles a los usuarios una idea de
¿Cómo están distribuidos los datos?
se podra decirle más o menos
¿cuántos datos están en cada parte de la caja?
por que a las personas que tienen poco conocimiento del tema a veces este tipo de esquema no les representa mucho la alternativa que nos presenta seaborn es esta función 'swarmplot' va a ver
¿Cómo gráfica swarmplot, por separado?
Comentando la línea de abajo le voy a poner un alfa de 0.5 para que sea un poco transparente y pueda sobreponer otra imagen encima pero, va a ver por separado como se ve.
Si yo doy esta gráfica, me hace estas distribuciones como...
En este caso aparecen como hojas.
Bueno, en la parte donde hay más líneas va a estar muy concentrada, va desde, muy probable que sea, la media En este caso ahora va a ver cómo se vería la pura gráfica de caja y va a volver a darle run.
La caja pues es la misma del ejemplo pasado Y ahora va a ver las dos en conjunto, quitando el comentario en ambas aquí tengo mi caja junto a su gráfica swarm, entonces ya uno puede completar el conocimiento de la caja sabiendo cuántos datos se están en cada sección de esta caja.
Por ejemplo, esta caja cerca de la media están la mayoría de los datos y en los extremos, en este extremo no hay ningún valor atípico, en este extremo tampoco pero, en la gráfica de las mujeres si hubo casos que se presentaron valores atípicos.
va a ponerle un título a esta misma imagen con la opción 'title' y por último va a salvar esta foto en nuestras carpetas para poderlas utilizar en algún informe, si le doy run sale mi gráfica con su título y en la carpeta donde está mi cuaderno debe existir este archivo 'boxplot.png', nos va a la libreta y aquí la tiene box plot me da mi imagen y ya la puedo utilizar en cualquier archivo.
Con esto repasamos rápido
¿Qué es una gráfica de cajas?
y presentamos una alternativa de cómo complementar la información de la gráfica de cajas y acrecentar lo que uno puede aprender de estas gráficas.
Por el momento es todo lo que va a hacer con esta libreta, pero te invitamos a que si tú tienes algún dato o quiere seguir experimentando con otras columnas de este Data Frame lo realices.
 

S3 Práctica: Histogramas

PRÁCTICA: HISTOGRAMAS

va a trabajar con un conjunto de datos de enfermedades del corazón generada por la 'UCI de Cleveland' 
Nuestra página que está aquí es un compendio de esa información en la plataforma Kaggle.
va a entrar y ver.
¿Qué es este Data Set?
Entonces tiene aquí en nuestro Data Set y contiene 76 atributos pero, en particular está sesgado a 14 de ellos.
Los 14 atributos que cada uno de los pacientes dentro de este Data Set han registrado son: La Edad, El Sexo, El Tipo de Dolor en la Caja Toráxica, La Resistencia en la Sangre, El Colesterol, Los Ácidos Grasos y Entre Otros datos en particular.
Aquí tienen toda la información, la pueden leer, pueden checarla pero, en particular
¿Qué va a hacer con esta página?
Descargarla, igual que en ejercicios anteriores.
Si ya tienen una cuenta de Kaggle accedan a ella y bajenlo si no tienen, por favor creen una y descarguenlo.
Lo que descarguemos, que es el archivo csv por favor ponganlo en la carpeta de Data en la misma raíz donde tengan todos sus cuadernos o en caso contrario memoricen la ruta porque la va a ocupar escrita en nuestra libreta.
Bueno, regresamos a la libreta, nuestra libreta cómo va a ocupar Data Sets y Data Frames va a ocupar pandas Entonces va a empezar utilizando nuestra instrucción 'import...
'import pandas as pd', damos run y ya nuestra libreta de Python tiene pandas.
va a empezar con la misma instrucción que las veces pasadas pero modificando lo que ahora sea el conjunto 'heart' -corazón- csv Le damos play y para saber que lo leímos bien el 'df.head'.
Con '.head' yo puedo saber los 5 primeros valores, puedo modificar eso aquí ponerle por ejemplo, 10.
Y me va a salir los 10 primeros pero bueno, con 5 es suficiente para hacernos de una idea general.
En esta Data Set tengo: 'El paciente 0' conozco, Su Edad, Su Sexo y sus diferentes datos.
va a ver
¿Qué se podra hacer con esto?
Entonces esta gráfica, a mí me interesa hacer un histograma, me interesa graficarlo.
Para eso voy a ocupar 'matplotlib.pyplot' y lo voy a importar as 'plt' y con la instrucción de % matplotlib inline para que se vea en esta libreta.
Entonces le doy run y ya puedo en esta libreta trabajar con matplotlib y empezar a hacer mis gráficas y le voy a decir haz una gráfica, es decir un plot, del tipo histograma 'plt.hist' con la columna Data Frame del puro colesterol.
Entonces no va a ser un histograma de todo el colesterol de nuestra tabla.
Aquí está se ve más o menos cuántas personas tienen un colesterol alto, cuántas personas tienen colesterol bajo, entre otros, entre otros muchos datos.
Pero bueno, va a ver ahora un primer parámetro entre esta celda y esta celda de acá arriba existe este primer parámetro 'bins' y le puse 20.
va a ver
¿Qué pasa al reproducir esta celda?
Nos da un histograma muy parecido pero el intervalo del eje horizontal está repartido en 20 intervalos diferentes, yo le dije exactamente en cuántos valores distintos iba a repartir el máximo de estos valores.
va a probar ahora con un bins de 5 Si se dan cuenta sólo hay cinco valores, el primer valor que va desde poquito más de 0 hasta poquito más de 200, de 200 a 300 y así sucesivamente sólo hay 5 secciones y este de aquí tiene 20 secciones.
Entonces es un poquito más delimitada la gráfica de arriba, que la gráfica abajo.
Cuando necesitas un estudio un poco más formal te recomiendo que uses más divisiones para que puedas delimitar mejor tu información si es un estudio muy rápido o algo sencillo pues con poquitas divisiones del eje horizontal te puedes dar una idea general.
Entonces esto va a depender realmente de la aplicación que tú le quieras dar.
va a continuar con la libreta, ahora va a ocupar del Data Frame igual, el colesterol con un bins de 20 pero va a ponerle, que el tipo de histograma sea de 'step' o de 'paso' Le doy run y ahora en lugar de que esté coloreada nuestra gráfica sale simplemente la línea, el escalón o el paso que se podría traducir.
Entonces esta gráfica de aquí representa la misma formación que esta de acá pero, en lugar de hacer una figura sólida y rellena, es una figura que solamente tiene su contorno y que está vacía por dentro.
A lo mejor eso hace más fácil su lectura o su comparación con diferentes líneas.
Otro de los parámetros que se podra controlar es, si queremos que nuestro histograma sea vertical o sea horizontal.
Los histogramas que hemos hecho hasta ahorita, todos han sido verticales.
Bueno, va a agregar el parámetro orientation en este caso le va a especificar 'orientation = horizontal' va a ver qué pasa.
El resto de la gráfica, es la gráfica que ya habíamos hecho acá arriba, este histograma.
Entonces ahora va a ver cómo lo presenta Python.
Sí, yo le doy ejecutar, ahora mi histograma está horizontal.
Eso me puede servir a veces para visualizar más fácil algunos datos.
¿Qué más va a hacer con esto?
Les voy a recordar que todas las gráficas que hagamos en una misma celda, como sería el caso de graficar el colesterol y de graficar la presión sanguínea, si lo hago en una misma celda, se va a ver reflejado dentro de la misma gráfica.
Van a salir sobrepuestas una imagen con la otra.
Para facilitar nuestra lectura les voy a poner un alfa de 0.5 para que se vean un poco tenue si se distingan quizás con un poco más de facilidad .Bueno, le doy run y me sale esta gráfica.
El único problema con esta gráfica es que sin conocer el conjunto de datos yo no puedo saber si el naranja corresponde al colesterol o corresponde a la presión sanguínea.
O si el azul corresponde al colesterol o a la presión sanguínea.
Entonces por eso es muy importante que le agreguemos las leyendas, recordaran de los ejercicios de visualización pasada que la leyenda era un cuadro en el que especificaba cual variable era de cada color.
Bueno, para eso yo le necesito decir a mi histograma que estoy poniendo
¿Qué etiqueta va a tener?
En este caso el histograma que vino del Data Frame, de la columna de colesterol le voy a poner la etiqueta 'chol' y al que vino de 'trestbps' le voy a poner el mismo nombre.
En ese caso si yo le doy ahora run, ahora si me especifica que el azul es colesterol y el amarillo/naranja es la presión sanguínea.
Bueno, otra librería o paquetería que me permite visualizar este tipo de histogramas es está: 'seaborn' y por convención la va a nombrar 'sns'.
Voy a graficar con 'sns.
'sns.gráfica de distribución' y aquí el nombre nos dice que es un poco diferente al histograma, porque esta paquetería además de hacer las barras del histograma también nos da la función de distribución que más se asemeja a nuestros datos.
Recordarán por ejemplo, en nuestra parte teórica, donde nosotros veíamos este histograma y decíamos que era muy parecida a la forma de esta distribución.
Bueno 'seaborn' nos da esa opción.
En particular para que sea nuestro primer ejemplo voy a poner el parámetro 'kde = false'
¿Qué hace eso?
Nos quita la distribución, solamente nos deja ver el histograma.
De default nuestra paquetería maneja esto como verdadero.Entonces verdadero cuando queremos ver la distribución, falso cuando no queremos.
Ahorita por ser el primer ejemplo va a darle un falso, va a ver.
Le decimos haz una gráfica de distribución con la columna de colesterol del Data Frame que tiene.
Le damos a ejecutar y hace nuestro histograma.
Y aquí lo se podra observar.
Ahora va a ver qué pasa cuando, si queremos eso, los mismos datos.
Ahora el 'kde' lo va a poner en verdaderos, en forma de default no hay que especificarla y va a agregar este segundo parámetro 'rug' va a ver
¿Qué pasa?
y nos da esta gráfica.
No sólo nos da el mismo histograma sino que, también nos da la gráfica de distribución y con el parámetro 'rug' se podra ver estas líneas de abajo que es como se concentra los datos en nuestro histograma.
Ahora si yo quiero juntar 2 variables en una sola visualización, hay alternativas.
No sólo existe la alternativa de poner 2 histogramas en el mismo espacio sino que 'sns' el 'seaborn' nos da esta opción 'jointplot' Le voy a decir en el eje x, por favor ponme el parámetro 'thalach', que nos dice según nuestro Data Frame el máximo ritmo cardíaco que tiene este paciente, y en el eje y le voy a poner el colesterol.
va a intentar deducir si existe una relación entre el máximo ritmo cardíaco y el colesterol.
Pero va a darle play, a ver cómo se ve esta celda.
Esta celda nos presenta en el eje 'Y' el colesterol y en el eje 'X' el máximo ritmo cardíaco.
Ok
¿Qué son estos puntos?
Estos puntos es donde más se relaciona una concentración entre ambas variables.
Esta sección de aquí ,si en estos extremos no hay muchos datos porque no hay muchos pacientes que tengan una máxima ritmo cardíaco de cercano entre 80 y 100 tampoco hay muchos pacientes que tengan un colesterol que rebase los 400.
Entonces esta sección de aquí no hay datos, más hacia abajo ya empiezan a relacionarse.
Estos cuadrantes que se generan aquí es una relación entre la variable del máximo ritmo cardíaco y la variable de colesterol y ya se podra saber para qué colesteroles hay un máximo ritmo cardíaco y se podra empezar a relacionar pero quizás ver los datos con puntos, es un poco difícil 'seaborn' nos da esta opción.
Agregarle el parámetro tipo, tipo hexágonos.
va a ver, va a sustituir los puntos por hexágonos y a ver como se ven.
Ahora ya se ve un poco más claro, por las regiones oscurecidas son las regiones donde más personas tienen esa configuración por decirlo de alguna manera.
Hay muchas personas que tienen un colesterol cercano a 220 y un ritmo cardíaco cercano a 150, esta región está muy cargada entonces muchas personas tienen esta misma coincidencia.
Pocas personas andan en los extremos claros, múltiples en los extremos oscuros.
va a correr nuestra última celda.
Simplemente agregamos esta opción 'sns.set' 'sns.set' va a ver
¿Cómo cambia?
siendo que lo demás es lo mismo, fíjense cómo se estiliza, seaborn tiene esta opción el '.set' en el que le da una temática un poco más visual y más elegante con el que es posible que se vea mejor su trabajo.
Entonces cuando ya uno lo quiere meter como un reporte, como un trabajo, como una investigación vale la pena que sepan este tipo de configuraciones.
seaborn tiene muchísimas configuraciones de colores que va a ver en más vídeos pero, por el momento es todo lo que va a revisar de histogramas espero que este y las siguientes lecciones les permitan seguir entendiendo Visualización de Datos.
 

S3 Histogramas

HISTOGRAMAS

Continuaremos con nuestro estudio de Visualización de Datos pero ahora va a conocer uno nuevo va a conocer el 'Histograma'.
va a abrirlo en una carpeta que la tengan y va a ver.
¿De qué trata, ok?
Un Histograma es una representación de la distribución de los datos a lo largo de un intervalo continuo de la variable que se esta analizando.
El histograma se compone por un conjunto de barras que representan cuantas veces apareció un dato dentro de diferentes sub intervalos de las variable.
Aquí tiene Un Ejemplo: Nuestro 1er Ejemplo habla del rango de alturas que tienen algún número de alumnos y cuántos alumnos tienen cada uno de esos rangos, Por Ejemplo nuestro 1er renglón de la tabla dice que en el rango de altura entre 1.45 m y 1.5 m hay 3 alumnos, entre 1.5 m y 1.55 m hay 33 alumnos y esto continúa.
Rápidamente se podra identificar de manera visual cuál es el rango donde existen mayores cantidades de alumnos que es entre 1.70 y 1.75 metros hay un número de 231 alumnos.
Esto lo se podra representar en nuestra gráfica, en nuestro histograma asignando barritas cada vez más grandes a medida que el número de aquí aumente, en este caso, tiene que nuestra gráfica más grande corresponde al intervalo que mencionamos y el más pequeño a este intervalo de 1.45 y 150
¿para que nos sirven los histogramas?
o
¿Por qué son importantes?
Bueno, en los histogramas se podra evidenciar que distribución tienen las estaturas.
En este ejemplo en particular nuestra distribución está muy cargada en medio y muy poquita en los laterales.
Esta distribución se parece mucho a una distribución que existe en los fenómenos naturales, en los fenómenos industriales, que se conoce como 'Distribución Normal' Para los que no saben, de Estadística la 'Distribución Normal' es una representación de los datos con una forma simétrica respecto a una medida central usualmente 'La Media' que se encuentra muy común en la naturaleza.
La 'Distribución Normal' se estudia por sus cualidades, en particular algo que se conoce como una regla empírica.
¿Qué es una regla empírica?

Algo que tiene sustentos basados en cuántas veces se ha repetido o basado en las observaciones.
Es muy común que esta regla se cumplan para cualquier fenómeno que tenga una 'Distribución Normal'.
El 68% de los datos se encuentran a menos de una Desviación Estándar de la Media, sí nosotros aquí encontramos nuestra Media.
Si yo aumento una media más la Desviación Estándar y una media menos la Desviación Estándar, es decir, esta sección de aquí en esta parte de aquí tengo el 68% de los datos a dos desviaciones estándar tengo el 95% de los datos entonces cualquier fenómeno que se encuentre representado por una Distribución Normal, la mayoría de sus datos va a estar cerca de la media y muy pocos datos en los extremos positivos y en los extremos negativos de esta curva pero, la Distribución Normal no es la única distribución que existe.
Hay diferentes distribuciones, hay una distribución cuando los valores se centran más hacia la derecha que se llama, 'Distribución Asimétrica Negativa'.
Hay una distribución cuando los valores se centran más hacia la izquierda la 'Distribución Asimétrica Positiva'.
Hay una Distribución que se llama Triangular que genera más o menos un triángulo de manera rápida.
Hay una 'Distribución Uniforme' donde casi todos los valores tienen la misma probabilidad de existir, cada conjunto de datos genera una Distribución Diferente y una de las principales Ventajas de analizarlos por medio de un histograma es que nos permite encontrar.
¿Qué Distribución tiene nuestro conjunto de datos?
Entonces en las prácticas que va a estar haciendo con esta libreta, va a Primero Importar un Data Frame, Después a Graficarlo en forma de histograma y Después Encontrar la Distribución que esos datos generan.

S3 Práctica: Gráficas de Dispersión: Parte 2

PRÁCTICA: GRÁFICAS DE DISPERSIÓN: PARTE 2

En el eje horizontal voy a poner el presupuesto el 'Budget', en el eje vertical lo que me dio de Beneficio, es decir, el Gross y aquí tengo esta 'S', ese corresponde al tamaño del punto, por la primer letra, la palabra files en inglés y le digo, el tamaño va a ser el 'ROI' x100.
De tal forma que las películas que tuvieron un ROI alto van a tener un círculo muy grande y las las películas que tienen un ROI chico van a tener un círculo un poco más chico.
va a ver como lo genera, si yo le doy run me da esta gráfica de aquí, entonces aquí ya vemos que hay películas que tuvieron mucho presupuesto, recuperaron relativamente bien pero, el valor del Dólar de esta película...
La recuperación de cada dólar que se invirtió de esta película fue menor que la recuperación que se invirtió, por ejemplo, en esta, que este círculo es muchísimo más grande que ese de aquí.
Entonces visualmente ya nos da una representación un poco más entendible pero, aún así, todos los círculos son del mismo color y no hay forma que sepamos qué película corresponde a cada círculo.
En esta gráfica en particular va a continuar trabajando con estos datos pero, ahora los va a colorear por diferentes géneros de películas.
Entonces va en esta celda, agregamos este ciclo for y le dijimos va a haber un género diferente por cada uno de los valores únicos que devuelva el Data Frame de la columna en género
¿Qué va a hacer esta instrucción?
Va a buscar todos los valores únicos de género y por cada uno de estos va a ir iterando entonces, va a generar un scatter con el primer género, otro scatter con el segundo, otro scatter con el tercero y así hasta que haya terminado con todos los géneros únicos que existen en esta Data Frame.
Esto nos da la ventaja que, por cada gráfica que se vaya haciendo en esta celda a cada una le va a ir asignando un color diferente entonces, no es necesario que yo le ponga a cada uno un color en específico sino que Python lo va a ir haciendo automáticamente asignándole un color a cada uno, aún así, yo podría cambiar eso y poner un color en específico que todas tengan el mismo color pero, va a dejarlo por el momento así.
Entonces le digo nuestra nueva variable Data, para irlo como que acortando un poquito, va a ser igual al Data Frame de cada uno de los géneros.
Entonces por el primer género específico que encuentre, voy a hacer una Sub Data o un Dato más pequeñito, nada más de ese género, entonces por decir algo todas las películas de acción van a estar aquí, después todas las películas de terror, después todas las de comedia, la romántica y silenciosamente voy a hacer una gráfica scatter en la que solamente voy a graficar el presupuesto de esta variable Data, es decir, toda la sección.
Voy a graficar el presupuesto toda la sección y la recuperación como Eje 'y' con un valor de punto de 50 Esta modificación simplemente fue para hacer más evidente la relación del rol más que en la anterior y va a ver cómo se va a ver esta gráfica.
En esta gráfica tiene 7 géneros diferentes aventura, comedia, drama, acción, animación, biográfica y de crimen y se puede empezar a generar con algunas conclusiones preliminares y se podra ver "Ah las películas de acción tienen un presupuesto muy alto" y estas películas de presupuesto alto tienen una recuperación en taquilla alta pero, si se dan cuenta el valor de los circuitos de las películas de acción son pequeños.
Eso significa que el ROI de esas películas la tasa de recuperación es chica.
Cada uno de estos muchos dólares genera pocos dólares a comparación.
A qué me refiero si se dan cuenta en este círculo Azul muy grande que está aquí de aventura con poco dinero, generó mucha recuperación en taquilla.
El ROI de este punto es mucho más grande porque los dólares, por llamarlo de alguna forma, los dólares con los que se creó se aprovecharon mejor que los dólares con los que se creó esta película.
Bueno, va a continuar con esta información y va a ver
¿Qué se podra hacer con esta?
va a darle play, esta parte de mi código es exactamente la que tenía la celda anterior entonces se va a generar la misma gráfica pero se le va a incluir esta sección, va a ver qué hace esa sección.Le damos play nos crea ahora la misma gráfica y aquí las se podra comparar
¿En qué cambio?
Bueno ocupe esta variable, este ciclo for, con la palabra Handle en inglés, una traducción aproximada sería Rótulo.
Entonces le voy a decir para cada rótulo, en mi rótulo del cuadro de leyenda, les voy a asignar un valor de 100 y si se dan cuenta los círculos del cuadrito de leyenda aquí están en un tamaño uniforme a diferencia de los círculos del tamaño y leyenda anterior donde eran de acuerdo a uno de los ROI que manejó en esa gráfica.
Entonces simplemente están estas instrucciones y fueron para estandarizar un poco el tamaño de estos puntos lo cual, le da un valor visual un poco más llamativo a nuestra gráfica.
va a continuar, en nuestra siguiente celda tiene el mismo código de la celda anterior, entonces se va a generar una gráfica muy similar a la anterior pero, se le incluyeron unas cuantas cosas.
va a ver
¿Qué hace cada una de ellas?
Se le incluyó la instrucción 'matplotlib.ticker' y eso nos va a dar la facilidad de poderle asignar títulos y formatos a los diferentes ejes, para eso primero definimos una función, definida completamente por nosotros.
Esa función se llama 'millones'
¿Y qué va a hacer?
Va a tomar un valor numérico y la va a devolver en un formato de al menos un número antes del punto decimal acompañado a la palabra millones con el formato de un exponente '- 6' y lo va a cambiar de la forma tradicional de escritura, a la notación científica de millones.
va a darle play y ahora si nuestros ejes ya tienen muchísimo más sentido que antes, antes tenían estos valores 0.5, 0.75 pero,
¿Qué era eso?
Ah, millones de dólares.
50 Millones, 75 Millones, 100 Millones y así sucesivamente esa información y ahora si ya tiene bastante sentido para nosotros.
Ya se podra ver y decir "Ah ok, esta película me costó unos 250 millones de Dólares producirla y me generó casi 900 casi cercano a los 1,000 Millones de Dólares" Bueno, nuestro siguiente Ejemplo, siguiendo esa convención es la misma gráfica pero le va a ir agregando otro factor más
¿Que fue lo nuevo?
Esta sección es exactamente lo mismo.
Entonces hasta aquí se me va a generar una gráfica con cada género de un diferente color, con una leyenda, con los mismos ejes.
¿Qué es lo nuevo?
Bueno, yo voy a encontrar cuáles fueron las mejores películas dependiendo la recuperación que tuvieron en taquilla.
El orden de ascendente se puso en 'Falso' porque lo que encontraríamos si ese orden ascendente fuera 'Verdadero' sería de la Peor a la Mejor, del Menor al Mayor, al ponerle 'Falso' estamos girando eso, estamos encontrando del Mayor al Menor y en particular no le voy a poner nombre a todos porque saturaría la información de mi gráfica y a lo mejor las etiquetas se verían feas, una encima de otra, le voy a pedir que me dé nada más las 5 Mejores Películas dependiendo de su Regreso en taquilla.
Entonces voy a buscar esas 5 Mejores Películas y en mi gráfica las voy a anotar, el nombre
¿En donde?
Bueno en donde su budget y su recuperación en taquilla nos den en la coordenada, es decir, en el punto del escatter.
Si le doy run, me da aquí mi gráfica y a las 5 Mejores Películas que tuvieron más recuperación de taquilla me puso estos títulos.
Aquí tiene, Por Ejemplo: 'Star Wars: The Force Awakens' como una de las películas que más recuperaciones en taquilla tuvo, 'AVATAR', 'Avengers', 'Titanic' y 'Dark Knight' es por mencionar algunas, coincidencialmente 4 de esas fueron de Acción, como la tendencia que habíamos comentado que era así visual pero, no significa que tuvieron el mayor ROI.
Hay unas que tuvieron más ROI.
Puedo repetir esto y cambiarlo a que en el criterio para bautizar los 5 Mejores Puntos no sea el Gross, sino el ROI, simplemente cambiando aquí a la variable ROI o el Budget, por Ejemplo.
Bueno, nuestro último Ejemplo igual que en el vídeo de Gráficas de Línea es un Ejemplo mucho más grande, un poco quizás más complicado pero, no se desanimen.
Traten de leer cada línea por separado, Traten de hacer sus suposiciones de que va a ser y les muestro qué hace y se las explicó de una manera rápida.
Si yo le doy run, yo aquí puedo ver esta gráfica un poco más grande con más títulos pero siguen siendo los mismos datos.
Aquí
¿Qué cambio?
agregamos esta función donde le digo el tamaño de la figura.
Yo puedo darle manualmente el tamaño para evitar que se hagan figuras pequeñas y se haga una más grande y un poco más entendible.
Otra cosa que cambio es que nuestra gráfica anterior no teníamos título pero, en esta sí.
Entonces ahora ya tengo esta, las películas que Mayor Recuperación en taquilla nos devolvieron en el 2016.
Simplemente con esta instrucción 'plt.title' aquí yo asigno que quiero que salga de título y 'plt.xlabel' le da el nombre al eje 'x' y 'plt.ylabel' nos da el nombre de el eje 'y'.
Aquí está la ganancia en taquilla, la inversión inicial, el título y están todos nuestros datos.
Te invito a que busques una base de datos de tu interés ya sea en Kaggle o en alguna Base de Datos que tú tengas y trates de hacer tu propia gráfica de dispersión.
En los siguientes vídeos veremos otro tipo de Visualización de Datos y continuaremos utilizando Python para realizar cada uno de ellos.
 

S3 Práctica: Gráficas de Dispersión: Parte 1,

PRÁCTICA: GRÁFICAS DE DISPERSIÓN: PARTE 1

Continuaremos utilizando la misma libreta de Gráfica de Dispersión pero ahora va a ver la parte de código, para esto hemos traído un Ejemplo tomado de 'Kaggle' donde va a analizar cómo funciona la Industria del Cine, de las Películas a través de esta Base de Datos.
La Base de Datos que se encuentra en esta liga, se podra abrir, va a ver qué es lo que va a ver, de este conjunto de Datos está en Inglés, el Título es 'Industria de las Películas', 3 décadas de películas,
¿Qué tiene este Data Set?
Nos plantea la pregunta, '¿La Industria de las Películas está muriendo?' también nos plantea la otra pregunta,
¿Netflix es el Nuevo Rey del Entretenimiento?
Bueno, el Investigador que hizo este dato se tenía estas inquietudes y decidió empezar a ver cuales son los factores de mayor impacto que intervienen en el éxito de las películas y quién se preguntó,
¿Cuáles son las películas más exitosas si los actores intervienen?,
¿Si el género interviene en que sea exitoso o no?,
¿Si el Rating del Usuario Interviene?, Entre otras cosas más, bueno, esa es la manera rápida que tiene este Data Set.
Este Data Set tiene de contenido 6,820 películas, es decir, 220 películas por año en este Intervalo de años y cada una de las películas tiene un atributo diferente.
Sabemos el Presupuesto con el que se hizo, la Compañía, el País, el Director, el Género, Cuánto nos Devolvió de Dinero en Taquilla, el Nombre, el Rating, la Fecha en que se Estrenó, el Tiempo de Duración, el Score, los Votos, Quién es el Actor Principal, Quién es el Escritor y Cuál es el Año.
Ya que sabemos más o menos que es el Data Set que voy a ocupar, le doy Descargar.
Si están trabajando en este en esta parte con Kaggle es muy probable que les exija una cuenta para poder descargar, es probable que ya la hayan tenido porque en ejercicios pasados la hemos utilizado, si es así simplemente Ingresen, Descarguenla y si no es así Creen una cuenta de Kaggle y descarguen.
Acuérdese es importante que lo grabamos en nuestra carpeta de Data que está en la misma carpeta de nuestro cuaderno, en mi caso ya lo tengo descargado.
Yo puedo venir a mi carpeta de cuadernos, tengo mi Data y tengo esta carpeta que se llama Movies, en esta carpeta está ese archivo, Ese Archivo lo puedo abrir con Excel, Por Ejemplo, y está toda la información pero, quedamos que son muchísimos, muchísisimos los datos.
Bueno, va a regresarnos a nuestra libreta.
Como estamos ocupando un Data Set va a importar Pandas para poder trabajar con él y por 'pandas as pd' como en veces pasadas lo hemos usado y empieza nuestro ejercicio.
Nuestro Data Frame es igual a lo que lea Pandas del Archivo Movies.
Fíjense que nuestra Ruta es: 'data/movies/movies.csv' si ustedes deciden ponerla en otras rutas simplemente tienen que modificar esa instrucción.
Y me sale este error, este error hay algunas Bases de Kaggle que nos presentan este pequeño errorsito con esta: 'UnicodeDecodeError utf-8' la forma de solucionarlo es hacer una pequeña modificación a nuestra instrucción 'pd.read_csv'
¿Por qué les mencionó esto?
Nosotros los invitamos a que si esta Base de Datos no les gusta, repitan la práctica con una Base de Datos diferente pero, es probable que tenga un formato distinto entonces, les pusimos este Ejemplo en particular para que vean
¿Cómo se soluciona?
Más abajo pusimos la instrucción idéntica pero, le pusimos esta extensión 'encoding = "cp1252" si yo, le doy run, ahora si lee bien el archivo.
Entonces, si están explorando por su cuenta diferentes Bases de Datos y les aparece este errorsito de 'UnicodeDecodeError utf-8' no puede ser decodificado, simplemente agregarle este en coding y con eso ya van a poder trabajarlo pero, bueno
¿Como sé que lo que leÍ está funcionado?
De igual forma que en otras veces, voy a ocupar la instrucción 'df.head' le doy run y con 'head' me presentan los 5 primeros datos de mi tabla.
Tengo para 5 películas diferentes 1.
Stand by me 2.
Ferris Bueller's Day Off 3.
Top Gun 4.
Aliens 5.Flight of the Navigator De estas 5 toda la información que antes mencionamos.
El Presupuesto, La Compañía, El País, El Director, entre otros datos.
Bueno, va a ver que se podra aprender de esto de una forma rápida, que se podra observar, para eso Pandas tiene una función muy amigable que se llama 'df.describe' ya la hemos ocupado anteriormente, en anteriores vídeos pero va a ver qué nos arroja.
Si yo le doy describe, me acorta mucho mis columnas si se dan cuenta, aquí abajo se mantiene 'Budget' igual que arriba, se mantiene 'Gross' igual que arriba pero estas 4 columnas: Company, Country, Director y Genre las omitió, estas 4 las omitió por que discribe se centra en las tablas con valores numéricos, no en valores descriptivos o en texto.
También ha omitió la columna de Nombre, de Rating, de Fecha de Estreno pero, sí respeto la columna de Run Time, la columna de Score, la columna de Votos y la del Año.
Bueno va a ver rápidamente estos datos Lo primero que va a gráficar o al menos nuestra primer columna, que está aquí es la de presupuesto, nos dice que hay 6,820 elementos en esta columna tiene una Media, que se ve aquí, una Desviación Estándar y un Mínimo de '0' pero, es imposible que se haga una película con $ 0.00 USD entonces, seguramente esta Base de Datos tiene por ahí errores equivocados dentro de sus 6,820 registros porque no hay una película que se haga con $ 0.00 USD es la primera cosa que salta a la vista que tiene que corregir.
Para eso va a ocupar la instrucción 'df.drop' o 'Dejar Caer' en español, sería de nuestro Data Frame va a buscar todos los que tengan un budget de $ 0.00 USD y los va a quitar de nuestro Data Frame.
Bueno, va a darle Ejecutar y ahí ya se eliminaron todos los registros que tengan un budget de $ 0.00 USD va a darle escribir para ver
¿Qué cambio?
fíjense ahora de escribir nos dice qué número elementos son 4,638 a diferencia de mis 6,820 Hay casi 2,200 elementos que tienen un presupuesto o un budget de $ 0.00 USD que para nuestros estudios en particular hemos desechado de este Data Frame para poder centrarnos en los que sí tienen un significado.
Para graficar igual que nuestras Gráficas de Línea va a ocupar la librería matplotlib que se importa con la instrucción 'import matplotlib.pyplot as plt' y va a ocupar la instrucción '%matplotlib inline' para que las gráficas que se generen se hagan en esta libreta.
Le doy run y le digo vas a hacer una gráfica, un plot del tipo 'scatter' que scatter en inglés es como es el equivalente a dispersión.
va a hacer un Gráfico de Dispersión
¿Qué va a hacer en este gráfico de dispersión?
el eje horizontal va a ser el presupuesto y el eje vertical va a ser
¿Cuánto dinero nos produjo?
Entonces va a darle ejecutar.
En esta gráfica que se ve llena de puntos, cada uno de esos puntos representan una película diferente y nos dice más o menos cuánto se invirtió contra cuánto recuperó esta primera gráfica visualmente no nos da una información precisa, no se podra entenderla claramente pero, nos podría ser la idea de que las películas que poco invirtieron poco ganaron contra las películas que mucho invirtieron y mucho ganaron, como esta de acá.
Esa podría ser una pequeña primera conclusión que no necesariamente está bien.
Para eso necesitamos analizar más los datos para ver que lo que va a concluir sea correcto.
Bueno, les voy a presentar una ecuación que se llama 'La Ecuación del Retorno de Inversión' por sus siglas 'ROI' y nos dice: 'ROI = beneficio - inversión / inversión' El beneficio que me trajo menos la inversión que yo gasté entre la inversión.
Entonces el 'ROI' me va a decir el porcentaje (%) que gane, contra lo que invertí y le digo a mi Data Frame en la columna 'ROI' que es la que voy a agregar, va a ser igual al Data Frame de lo que me trajo de Beneficio menos (-) el Data Frame de lo que gasté entre (/) el Data Frame de lo que gasté y voy a centrar este estudio para filtrarlo de cierta manera entre los que tengan un ROI > 1.5 es decir, aquellos que tengan una recuperación de lo que invirtieron más el 50% como mínimo.
Aparte mi Data Frame también va a estar filtrado por solamente las películas que tengan 7 de score o más y las películas que tengan un poquito más de 0.5e8 en Dólares Le doy run, ya me filtro, ya ahí yo debo de tener un Data Frame un poco más entendible con las características de qué solo las películas que tuvieron un retorno de inversión de más de 1.5 se van a ver y un score de más de 7.
va a graficar este Data Frame con la función 'SCATTER' 
 

S3 Gráficas De Dispersión

GRÁFICAS DE DISPERSIÓN

¿Qué son los gráficos de dispersión?
Les preparamos, de la misma forma que en el tema anterior, una libreta que se llama: Gráfica de Dispersión, esa libreta la descargan igual.
Yo les recomendaría que en el mismo lugar que los otros cuadernos.
Y acuérdense que es importante que lo que descarguemos lo pongamos en la carpeta que dice "Data" para que pueda ser compatible y utilizado.
En caso de que no lo hagan así, pues van a tener que buscar una carpeta adecuada y poner toda la ruta.
Bueno, va a nuestro archivo.
Nuestro archivo de gráfica de dispersión empieza de la misma forma, con una pequeña explicación.
¿Qué es una gráfica de dispersión?
Una gráfica de dispersión es la representación visual de una colección de puntos, colocados en un plano utilizando coordenadas cartesianas.
En la pantalla, se ve un Primer Ejemplo.
En este Primer Ejemplo tiene: El tiempo de estudio que le tomó a varios alumnos prepararse para una materia y La Nota que obtuvieron a la hora de presentar el examen.
La 1er persona se preparó durante media hora y obtuvo una calificación de 55 , La 2da persona se preparó 1 hora y obtuvo una calificación de 62, La 3ra persona se preparó hora y media y obtuvo 71.
Así cada uno de este par de datos representa: El tiempo que invirtió una persona y La nota que obtuvo.
Esos puntos se pueden representar en una cuadrícula y esa cuadrícula se llama 'Gráfica de Dispersión'.
Entonces aquí tiene un primer Eje, Horizontal, que se representaría 'El Tiempo de Estudio' y un Eje Vertical que representaría 'La Nota Obtenida' donde se intersecten estos 2 datos yo voy a poner mi Primer Punto.
Este punto corresponde a 1/2 Hora y el 55 de Calificación.
Ese punto corresponde a 1 hora y a un poco más de 60 a 62 en este caso y así sucesivamente.
En nuestro primer Ejemplo de Gráficas de Dispersión, cada uno de los puntos representa un alumno, como les comentaba a primera vista es muy posible que se infiera una relación favorable a que: "Mientras más horas estudies, mejor nota consigas" y de manera inversa "Mientras menos estudies, menos nota tengas" pero, para este Ejemplo en particular hay un caso que salta a la vista, que no cumple con lo anterior.
Si observan, esta persona solamente estudio 2 horas y aún así fue una de las notas más altas.
Este tipo de gráficas, nos permite ver valores diferentes, por llamarlos de alguna forma.
Valores que no se comportan de una manera similar a la población, o Valores Atípicos como también lo se podra conocer.
Ya lo habíamos platicado en vídeos anteriores pero, aquí en este tipo de representación saltan mucho a la vista.
Ahora continuaremos utilizando esta libreta pero, en la parte práctica.

S3 Práctica: Gráficas De Línea: Parte 2

PRÁCTICA: GRÁFICAS DE LÍNEA: PARTE 2

Ahora va a graficar en la misma gráfica 2 cosas.
En esta celda va a graficar el 'Valor Mínimo' y el 'Valor Máximo'.
Entonces, si yo le doy run, tengo aquí esta gráfica, esta Gráfica en Azul Low, en Naranja High, los colores se asignaron automáticamente pero, yo podría modificarlo igual que como teníamos aquí agregando un parámetro, ahorita lo voy a dejar de esta manera.
Nuestros 2 datos se parecen mucho, así que, nuestros valores se Auto-Escalan y si se dan cuenta en un eje de 8 y de 14 pero
¿Qué pasa si ahora agregó a esa misma gráfica un valor muy alejado?
Bueno para este Ejemplo va a agregar también el Valor Máximo de 'BIMBO' en la siguiente celda.
Nuestra siguiente celda va a graficar el Mínimo de 'CEMEX' el Máximo de 'CEMEX' y el Máximo de 'BIMBO' y va a darle PLAY, a ver
¿Qué pasa?
Al momento de darle Play se genera esta gráfica.
Esta gráfica tiene 3 líneas: La 'Naranja' para el Alto de 'CEMEX', La Azul para el Bajo de 'CEMEX' y el Verde para El Alto de 'BIMBO' pero, se dan cuenta que, gracias a que se incluyó BIMBO, nuestra escala creció tanto que ya es muy difícil distinguir los valores de CEMEX.
Muchas veces cuando se trabaja con datos ocurre este tipo de cosas y la forma que podríamos solucionarla es generando 2 gráficas, Una para BIMBO y Una para CEMEX.
Para que Cada Uno se auto-ajuste Bueno, Python lo puede hacer de la siguiente manera.
En nuestra siguiente celda le decimos utilizando el 'PLT' de matplot voy a hacer una figura y esa figura va a tener 2 Sub-gráficas: La Primera Sub-gráfica va a incluir a 'CEMEX' Bajo y al 'CEMEX' en Alta y nuestra Segunda Sub-gráfica va a incluir a 'BIMBO' en Baja y a 'BIMBO' en Alta.
Si yo gráfico esto (Le doy run) Me genera esta información.
Ahora sí, cada par de valores tiene su propia gráfica dentro de una imagen compartida pero, yo sé que ver Azules para Low Alta es con Naranja en ambos casos pero, no sé cuál es de CEMEX y cuál es de BIMBO.
va a continuar con este mismo código pero, lo va a modificar un poco.
En nuestra siguiente celda tiene el mismo código pero se incluyó esta 'plt.title CEMEX', 'plt.title BIMBO' que le estoy diciendo la gráfica, la Sub-gráfica de arriba le voy a dar el Título de CEMEX, La Sub-gráfica de abajo le voy a dar el título de BIMBO.
Ejecutó...
y nos aparece este CEMEX y BIMBO y ahora si ya tiene bastante más sentido y una persona que no no conocía de estos datos con la simple vista puede ver Que significa cada una de estas.
Nuestro último Ejemplo es un Ejemplo un poco más sofisticado, yo sé que aparentemente tiene demasiado código y que si esta es su primera vez podría parecerte difícil.
Pero toma tu tiempo, revisa cada una de las instrucciones, muchas veces los nombres de las instrucciones son intuitivas, muchas veces se podra aprender un poquito de ellas.
Empiezo diciendo lo que voy a graficar, una figura que va a haber un 'Sub Plot', la primera Sub-gráfica.
En esta gráfica voy a graficar de CEMEX el valor Bajo con el color 'r', con la línea punteada, ocupando la etiqueta Low, con un alza de 0.3, es decir, el 30% del color.
Tengo una de valor Alta ocupando el color Azul, con línea punteada, la etiqueta es Alta y tiene el 30% del color y tengo el valor de Cierre que su color va a ser Verde, su etiqueta es Cierre, con el 100% del color.
Esa se va a llamar CEMEX.
En esta nueva instrucción 'xslim' yo delimitó los valores del eje 'x' y delimitó los valores del eje 'y'.
Antes se auto ajustaban los valores, ahora yo se los estoy dando específicamente.
Bueno, Le digo que también va a imprimir su leyenda.
A continuación voy a hacer exactamente lo mismo, en la Gráfica II pero con los valores de BIMBO.
Entonces que se va a ver en este, en esta figura se van a ver 2 gráficas y en cada una de las gráficas va a tener 3 líneas, una línea punteada Roja, que va a representar el valor LOW.
Una línea punteada Azul, que va a representar el valor de ALTA y una línea Verde sólida que va a representar el valor de CIERRE.
va a darle Play y va a ver si se cumple.
Aquí la tiene.
Generar las gráficas muchas veces No es nuestra función principal sino compartir esa información para eso también incluimos esta última instrucción 'savefig', salva la figura, guarda la figura.
Yo le asignó un título y la terminación '.png' que puede ser sustituida por '.jpg', según el formato que quieras, y en donde lo graba.
Esta gráfica que hicimos la va a grabar en la misma carpeta donde guardamos el cuaderno.
Si yo me voy a esa carpeta donde guardamos el cuaderno y la busco, Aquí esta, 'Gráfica de línea.png' y la abro Aquí tiene nuestra gráfica, bueno, este cuaderno ha terminado hasta aquí.
Hemos visto las funciones principales de
¿Cómo generar una gráfica de línea?
y te invito a que continúes con otro tipo de gráficas.
 

S4 Cierre

Cierre Semana 4 Muchos de los problemas actuales a los que se enfrenta un científico de datos involucran el manejo de grandes cantidades de ...