Mostrando entradas con la etiqueta Ciencia de datos. Mostrar todas las entradas
Mostrando entradas con la etiqueta Ciencia de datos. Mostrar todas las entradas

domingo, 17 de septiembre de 2023

Bibliometrix R: Una herramienta para el análisis bibliométrico de la ciencia

 


¿Qué es el análisis bibliométrico?

El análisis bibliométrico es una técnica que permite estudiar la producción científica de un campo, una disciplina, una institución o un autor, a partir de los datos bibliográficos de las publicaciones. Esta técnica puede revelar aspectos como el volumen, el impacto, la colaboración, las tendencias, los temas o las redes de los documentos científicos.

¿Qué es bibliometrix r?

Bibliometrix R es un paquete de R que permite realizar análisis bibliométricos sobre grandes bases de datos científicas, como la Web of Science, Scopus, Dimensions, Cochrane, Lens.org y PubMed. Bibliometrix R fue creado y desarrollado por Massimo Aria y Corrado Cuccurullo, investigadores de la Universidad de Nápoles Federico II.

¿Qué funcionalidades tiene bibliometrix r?

Bibliometrix R ofrece varias rutinas para importar datos bibliográficos desde diferentes bases de datos, realizar análisis bibliométricos y construir redes para el análisis de co-citación, acoplamiento, colaboración científica y co-palabras. Algunas de las funcionalidades más destacadas son:

  • Biblioshiny: una aplicación web basada en shiny que permite realizar análisis bibliométricos y visualizaciones interactivas sin necesidad de escribir código.
  • Bibliomap: una función que permite crear mapas geográficos de la producción científica por países o regiones.
  • Bibliotrend: una función que permite analizar las tendencias temporales de la producción científica por años o períodos.
  • Bibliocoupling: una función que permite identificar los documentos más similares o relacionados entre sí por el número de referencias compartidas.
  • Bibliocor: una función que permite calcular la correlación entre diferentes indicadores bibliométricos, como el número de citas, el índice h o el factor de impacto.

¿Cómo se usa bibliometrix r?

Para usar bibliometrix r se necesita tener instalado R y RStudio, que son programas gratuitos y de código abierto. Luego se debe instalar el paquete bibliometrix r desde el repositorio CRAN o desde GitHub. Una vez instalado el paquete, se puede cargar con la función library(bibliometrix). A partir de ahí, se puede usar la función readFiles() para importar los datos bibliográficos desde un archivo .bib o .txt. Luego se puede usar la función convert2df() para convertir los datos en un formato adecuado para el análisis. Finalmente, se puede usar cualquiera de las funciones disponibles en el paquete para realizar el análisis deseado. Para más detalles sobre el uso del paquete, se puede consultar la documentación oficial (www.bibliometrix.org) o los tutoriales disponibles en la web.

¿Qué ventajas tiene bibliometrix r?

Bibliometrix r tiene varias ventajas sobre otras herramientas para el análisis bibliométrico, como:

  • Es gratuito y de código abierto, lo que permite su uso sin restricciones y su modificación según las necesidades del usuario.
  • Es flexible y personalizable, lo que permite adaptar el análisis a diferentes objetivos y contextos.
  • Es potente y robusto, lo que permite manejar grandes volúmenes de datos y obtener resultados fiables y reproducibles.
  • Es integrable y compatible, lo que permite combinarlo con otras herramientas y paquetes de R para ampliar las posibilidades de análisis.

Bibliometrix r es una herramienta muy útil para el análisis bibliométrico de la ciencia, que ofrece múltiples funcionalidades y ventajas para los usuarios interesados en este tipo de estudios. Si quieres saber más sobre bibliometrix r, te invitamos a visitar su página web oficial (www.bibliometrix.org).

domingo, 3 de septiembre de 2023

Plotly para Python: una excelente librería para crear gráficos interactivos


Hola, en esta entrada voy a hablar sobre la biblioteca Plotly para python, una herramienta muy útil para crear gráficos interactivos y visualizaciones de datos. Plotly es una biblioteca de código abierto que se basa en la librería JavaScript del mismo nombre, y que permite generar gráficos con solo unas pocas líneas de código. Además, Plotly ofrece una interfaz web llamada Chart Studio, donde se pueden crear y editar los gráficos de forma sencilla y compartirlos con otros usuarios.

Plotly tiene varias ventajas sobre otras bibliotecas de gráficos para python, como Matplotlib o Seaborn. Algunas de ellas son:

  •  Los gráficos son interactivos, es decir, se pueden explorar con el ratón, hacer zoom, rotar, etc.
  • Los gráficos se pueden exportar a diferentes formatos, como HTML, PDF, PNG o SVG.
  • Los gráficos se pueden integrar en aplicaciones web o de escritorio, usando frameworks como Dash o PyQt.
  • Los gráficos se pueden personalizar con gran detalle, cambiando el color, el tamaño, el tipo y la posición de los ejes, las leyendas, los títulos, etc.
  • Los gráficos se pueden combinar en paneles o dashboards, creando visualizaciones complejas y atractivas.

Para usar Plotly en python, se necesita instalar la biblioteca con el comando pip:

pip install plotly

A continuación, se puede importar la biblioteca con el alias `px`:

import plotly.express as px

Plotly Express es un módulo que ofrece funciones para crear gráficos de forma rápida y sencilla, usando datos en formato de pandas DataFrame. Por ejemplo, para crear un gráfico de barras con los datos de un DataFrame llamado `df`, se puede usar la función `px.bar`:


fig = px.bar(df, x="columna_x", y="columna_y", color="columna_z")

fig.show()


El primer argumento es el DataFrame con los datos, el segundo es el nombre de la columna que se usará para el eje x, el tercero es el nombre de la columna que se usará para el eje y, y el cuarto es el nombre de la columna que se usará para asignar un color a cada barra. El resultado es un objeto de tipo `Figure`, que se puede mostrar con el método `show`.

Plotly Express ofrece muchas otras funciones para crear distintos tipos de gráficos, como líneas, puntos, áreas, histogramas, cajas, violines, mapas, etc. Se puede consultar la documentación oficial para ver más ejemplos y opciones: https://plotly.com/python/plotly-express/

Ahora bien, ¿cómo podemos personalizar los gráficos que creamos con Plotly Express? Una forma muy sencilla es usar los argumentos opcionales que tienen las funciones de Plotly Express. Por ejemplo, si queremos cambiar el título del gráfico de barras que hemos creado antes, podemos usar el argumento `title`:


fig = px.bar(df, x="columna_x", y="columna_y", color="columna_z", title="Mi gráfico de barras")

fig.show()


De esta forma, podemos modificar aspectos como el tamaño del gráfico (`width` y `height`), las etiquetas de los ejes (`labels`), la escala de colores (`color_continuous_scale`), etc. Se puede ver la lista completa de argumentos en la documentación de cada función: https://plotly.com/python-api-reference/plotly.express.html

Otra forma más avanzada de personalizar los gráficos es usar el método `update_layout`, que permite acceder a las propiedades del objeto `Figure` y modificarlas. Por ejemplo, si queremos cambiar el fondo del gráfico a blanco y el tipo de fuente a Arial, podemos hacer lo siguiente:

fig.update_layout(

    plot_bgcolor="white",

    font_family="Arial"

)

fig.show()

De esta forma, podemos acceder a propiedades como `title`, `xaxis`, `yaxis`, `legend`, `margin`, etc. Se puede ver la lista completa de propiedades en la documentación del objeto `Figure`: https://plotly.com/python-api-reference/generated/plotly.graph_objects.Figure.html#plotly.graph_objects.Figure

 

Ejemplo

 Ahora, aquí tienes un ejemplo de código para crear un scatter plot con Plotly:

import plotly.express as px

# Datos de ejemplo (puedes reemplazarlos con tus propios datos)

x = [1, 2, 3, 4, 5]

y = [10, 11, 12, 13, 14]


# Crear el gráfico de dispersión

fig = px.scatter(x=x, y=y, title='Ejemplo de Scatter Plot')


# Personalizar el diseño (opcional)

fig.update_layout(

    xaxis_title='Eje X',

    yaxis_title='Eje Y',

    xaxis=dict(showgrid=True, zeroline=False),

    yaxis=dict(showgrid=True, zeroline=False)

)

 

# Mostrar el gráfico

fig.show()




miércoles, 29 de junio de 2022

Tablas de contingencia 📊 - jamovi - Teoría y práctica - 📈 resultados en APA 7

Las tablas de contingencia (también llamadas a veces tablas dinámicas, tablas cruzadas, o crosstabs como se conocen en inglés) son una de las técnicas estadísticas más utilizadas en análisis de datos. En este tutorial comentaré algunos conceptos básicos para su análisis y también como elaborarlas en jamovi de forma muy fácil y sencilla y es que las tablas de contingencia es uno de los análisis más utilizados en investigación social y de la salud.

¡¡Comenzamos!!

Las tablas de contingencia son tablas de doble entrada, en cuyas entradas (o sea, filas y columnas) se sitúan las diferentes categorías de cada variable. A través de un análisis de tabla de contingencia podremos saber cómo se relacionan dos variables entre sí.

Por ejemplo, seguimos analizando la base de datos de estudiantes que hemos usado en videos anteriores, en este caso queremos saber si hay relación entre el rendimiento académico y si tienen acceso a internet en casa los estudiantes.

En las casillas de la tabla se ubican las frecuencias o número de casos. Estas frecuencias son:

Observadas: es el número real de casos en nuestro estudio

Esperadas: Número de casos que debería haber en la casilla si las categorías fueran independientes.

De igual manera, podemos agregarle cuanto representan estos valores con respecto a los totales, en porcentaje.

La tabla, además, comúnmente es presentada con los totales marginales para cada nivel de las variables y un total general

Para analizar las asociaciones entre dos variables se utilizan diferentes pruebas, la mayoría de ellas basan su cálculo en determinar si las frecuencias observadas difieren significativamente de las frecuencias esperadas, bajo la hipótesis nula de que no existe asociación.

Aunque la prueba más usada es la de chi-cuadrada, veremos algunas otras apoyándonos en el cuadro de estadísticas de jamovi para las tablas de contingencia.

- La Primera es precisamente Chi-cuadrada que, como les comentaba, parte de la hipótesis de que las variables son independientes, o sea, no existe relación entre ellas y ninguna ejerce influencia sobre la otra. Esto significa que si p > 0,05 se acepta esta hipótesis nula de independencia. Esta prueba se basa en la diferencia al cuadrado entre las frecuencias observadas y las esperadas. Se debe utilizar siempre que las frecuencias esperadas sean superiores a 5.

El problema surge con el uso indiscriminado de la prueba que, a veces, nos lleva a olvidar que el estadístico que utilizamos para el contraste, la ji-cuadrado, sigue una distribución aproximada que solo es útil cuando el número de observaciones es relativamente grande, pero que pierde efectividad cuando la información de que disponemos es escasa, lo que ocurre con cierta frecuencia.

Por eso, una vez construida la tabla de contingencia, comprobamos que no haya celdas con frecuencias menores de 5. Si esto ocurre, tenemos dos formas de solucionar el problema.

- Una es, la segunda opción, Chi-cuadrada con corrección de continuidad (Yates), la cual se usa cuando al menos una celda en la tabla de contingencia tiene una frecuencia esperada menor que 5. Esta corrección se basa en restar 0,5 a la diferencia entre valores observados y esperados al calcular el valor del estadístico ji-cuadrado.

- La otra opción es el Test exacto de Fisher que también es una corrección de Chi-cuadrada para cuando haya frecuencias esperadas <5, muchos autores consideran que es más segura que la corrección de continuidad. Esta prueba construye todas las tablas de contingencia más extremas que la observada y que cumplen con la dirección de la asociación de la tabla observada. Una vez calculada esta probabilidad exacta, se comparará con el nivel de significación estadística y se procederá a resolver el contraste de hipótesis.

El problema de estos métodos era que son mucho más laboriosos, lo que ha dificultaba su mayor utilización hasta que se dispuso de la potencia de cálculo actual. Esto explica la predilección histórica por el uso de las pruebas aproximadas como la de la chi-cuadrado.

·       Razón de verosimilitud, es una alternativa al estadístico Chi-cuadrado, La diferencia estriba en que en este caso se calcula la razón entre las frecuencias observadas y esperadas y se interpreta igual a Chi-cuadrado.

·       Prueba de z para diferencias de proporciones. A través de esta prueba se determina si existe una diferencia estadísticamente significativa entre los porcentajes obtenidos por cada una de las categorías de las variables. Es utilizada para tablas de 2 x 2.

Medidas de magnitud de la asociación

Ahora bien, como X2 y las demás pruebas no indica la magnitud de la asociación de las variables hay que otros estadísticos que complementen el análisis, según el tipo de variables que presente nuestro estudio, entre los más usados están:

Nominales

·       Tablas mayores a 2 x 2: Coeficiente de contingencia y V de Cramer

·       Para tablas 2x2: Coeficiente Phi, V de Cramer

Ordinales

·       Gamma

·       Tau b de Kendall

·       Mantel-Haenszel

Coeficiente de contingencia, es una extensión de Phi para el caso de tablas mayores a 2 x 2 pero no es una medida normalizada para este tipo de tablas pues oscila entre 0 para el caso de no asociación y Cmax (calculado), valor que nunca alcanza el 1.

-        0 indica independencia absoluta

-        Según el valor máximo que puede tomar, se calcula si la asociación es baja, moderada o alta.

V de Cramer: Obtiene valores entre 0 < V < 1, es también una extensión del coeficiente Phi pero en este caso, y a diferencia del Coeficiente de Contingencia, si se encuentra normalizada. El problema de este estadístico es que tiende a subestimar el grado de asociación entre las variables.

·       0 indica nada de relación

·       0,5 relación moderada

·       0,7 relación moderada-alta

·       1 relación perfecta

El Coeficiente Phi nos permite evaluar el grado de asociación entre dos variables, pero sólo esta normalizada, es decir oscila entre 0 y 1, en tablas de 2 x 2. En tablas con otras características toma valores >1. En estos casos lo recomendable es utilizar el Coeficiente de Contingencia.

Ordinales

Gamma es una medida del grado y tipo de asociación entre dos variables cualitativas ordinales que oscila entre -1 ( a medida que aumentan los valores de una variable, los de la otra disminuyen) y 1 (a medida que aumentan los valores de una variable los de la otra también aumentan) El 0 indica no asociación. La desventaja de esta medida es que alcanza tales valores, aunque la asociación no sea total, es decir, tiende a estar sobrestimada.

Tau-b- de Kendall:

Es una extensión de Gamma pero presenta la ventaja de que alcanza los valores -1 y 1 en situaciones de total asociación, aunque sólo para tablas cuadradas.

Mantel-Haenszel

Es un Test usado para comprobar la posible confusión que puede generar una tercera variable en la relación entre dos variables que se están analizando.

Se trata de estudiar si existe o no asociación entre una variable factor y otra variable respuesta, ambas dicotómicas, cuando se dispone de información referida a varios estratos (distintos grupos de edad o sexo, pacientes con diferente sintomatología, distintos grupos étnicos, distintas dosis de fármaco, etc.).

En estos casos, utilizar el estadístico χ2 sobre el conjunto de datos agrupados puede arrojar resultados inadecuados. Por otra parte, analizar separadamente cada estrato no proporciona una idea global del efecto de la variable factor.

Medidas comparativas (tablas 2 x 2)

También tenemos medidas comparativas que solo están disponibles para tablas de 2x2

Razón de odds (razón de probabilidades) Es una estadística que cuantifica la fuerza de asociación entre 2 variables o eventos, esta medida también indica el tamaño del efecto. Es una forma de expresar las probabilidades, con la que se indica la posibilidad con que suceda un evento, en relación con la probabilidad de otro.

-        Los odd ratio oscilan entre 0 e infinito.

-        Cuando el odd ratio es 1 indica ausencia de asociación entre las variables.

-        Los valores menores de 1 señalan una asociación negativa entre las variables y los valores mayores de 1 indican asociación positiva.

-        Cuanto más se aleje el odd ratio de 1, más fuerte es la relación.

-        Cuando el odd ratio es menor de 1 es conveniente calcular la inversa, es decir, 1/OR. De esta manera podemos expresar mejor la fortaleza de la relación.

Log Razón de odds

Esta segunda opción es el logaritmo natural de la razón de odds. La conversión al logaritmo permite obtener resultados simétricos alrededor de 0, lo cual es más fácil para su análisis.

Riesgo relativo

Es una medida semejante a Odd ratio (OR), pero es la razón de las proporciones, siendo su principal inconveniente que no está normalizada. De este modo, si las variables son independientes, su valor es 1. Es importante aclarar que si las dos proporciones son muy pequeñas su diferencia será muy pequeña, pero podría ser importante.

Diferencia de proporciones

Se utiliza para comprobar si hay diferencias entre estas proporciones, es decir, si se distribuyen homogéneamente entre los niveles de la variable o por el contrario, si existen diferencias.


lunes, 20 de junio de 2022

Pirámide poblacional con Jamovi 📊 – Módulo ClinicoPath Descriptives 📈

Hola amigos, seguimos aprendiendo jamovi, hoy les traigo un gráfico muy usado en ciencias sociales y de la salud, una pirámide poblacional, como las que estamos viendo. La pirámide visualiza de forma fácil el tipo de estructura de la población. Es un doble histograma de frecuencias dispuestos horizontalmente sobre el eje de las abscisas y en el eje de las ordenadas se disponen los grupos de edad (generalmente quinquenios), las edades más bajas se encuentran más cercanas a la base y las edades avanzadas hacia la cúspide.

La pirámide poblacional es una herramienta gráfica que se utiliza para representar la estructura de edad y género de una población en un momento determinado. La pirámide se llama así porque tiene la forma de una pirámide, con las barras que representan las diferentes edades y géneros que se superponen para formar la figura.


Momentos claves
00:00 Presentación 🤓
00:54 Página Módulo ClinicoPath Descriptives
01:39 Ejecución en jamovi
03:00 Despedida

miércoles, 8 de junio de 2022

Análisis de normalidad de los datos 🔔 con Jamovi 📊

Los análisis de normalidad, también llamados contrastes de normalidad, tienen como objetivo analizar si los datos disponibles podrían proceder de una población con una distribución normal. Existen tres estrategias principales abordar este análisis:
• Representaciones gráficas
• Métodos analíticos
• Test de hipótesis.
En este video las comento y las ejecuto en jamovi.

domingo, 24 de abril de 2022

Jamovi 📊: calcular y transformar nuevas variables

Hola amigos, seguimos aprendiendo jamovi, en este tutorial vamos a transformar y calcular nuevas variables a partir de las variables que tenemos en nuestra base. Seguiremos usando la base de datos que utilizamos en el video pasado donde inspeccionamos las variables de un juego de datos de estudiantes.

En la descripción les dejo los enlaces al video y a la base de datos para que la puedan descargar y hacer sus pruebas.

viernes, 8 de abril de 2022

Curso de jamovi en video 📊 – Canal RecuEdu. Prof. Raidell Avello

Curso de estadística con jamovi en video ofrecido por el Canal de YouTube RecuEdu e impartido por Raidell Avello PhD - El curso es gratuito y esta en construcción.

=> Estadística descriptiva con Jamovi 📊 – Introducción - Tutorial 📈


=> Análisis de normalidad de los datos 🔔 con Jamovi 📊



=> Análisis de correlación lineal con Jamovi 📊 – incluye métodos robustos 📈 – APA 7



=> Error estándar de la media 📊 – intervalos de confianza 📈 – APA 7


=> JAMOVI 📊. Variables en filas o columnas?


=> JAMOVI 📊. Un robusto software libre de estadística (🔥 2.3 ya en español)


=> ¿Cómo instalar nuevos módulos a JAMOVI? Algunas sugerencias

=>  JAMOVI 📊: Inspección de variables 


=>  Jamovi. Calcular y tranformar variables.
En este tutorial vamos a transformar y calcular nuevas variables a partir de las variables que tenemos en nuestra base. Seguiremos usando la base de datos que utilizamos en el video pasado donde inspeccionamos las variables de un juego de datos de estudiantes.


=> JAMOVI 📊. Análisisd de normalidad - Kolmogorov



ESPERE MÁS VIDEOS PRÓXIMAMENTE


ANEXOS












Ciencia de datos, stats, jamovi, análisis de datos, Estadística, curso de jamovi, curso jamovi, curso de jamovi en video

Ciencia de datos, stats, jamovi, análisis de datos, Estadística, curso de jamovi, curso jamovi, curso de jamovi en video


miércoles, 28 de julio de 2021

Análisis de las variables del espermograma en pacientes de la consulta de infertilidad del municipio de Cienfuegos

 

Fundamento: El análisis de la calidad del semen es considerado un elemento básico en la evaluación de la fertilidad masculina.
Objetivo: analizar los valores del espermograma de pacientes atendidos en la consulta municipal de Infertilidad de Cienfuegos.
Métodos: estudio descriptivo, que incluyó 128 muestras resultantes de espermogramas realizados a pacientes atendidos en la consulta municipal de Infertilidad de Cienfuegos, entre los años 2019 y 2020. Los espermogramas registran las variables: edad, volumen, concentración, movilidad, morfología y vitalidad. Estas variables fueron comparadas con los valores de referencia propuestos por la OMS.
Resultados: en cuanto a la concentración, resaltó que los valores oscilaron en un rango amplio, desde 0 hasta 350 mmol/L-1, con una media de 89,1; mientras que la movilidad de los espermatozoides mostró valores muy bajos, incluso algunos con 0 %. La movilidad total (movilidad rápida más movilidad lenta) fue de un 57,7 %. El porcentaje de espermatozoides con una morfología adecuada fue de 46,3, mientras que la vitalidad fue de 71,8 %.
Conclusión
: La mayoría de las muestras analizadas mostraron valores normales en todos los parámetros. Resultó significativo el número de pacientes con leucospermia, parámetro que probablemente tenga relación directa con la infertilidad en estos sujetos.