Mostrando las entradas con la etiqueta Tesis. Mostrar todas las entradas
Mostrando las entradas con la etiqueta Tesis. Mostrar todas las entradas

Descubrimiento del Conocimiento (KDD) : “El Proceso de minería”

Proceso de Extracción del Conocimiento (KnowledgeDiscovery in Databases (KDD))

El proceso KDD lo podemos definir como “el proceso no trivial de identificar patrones válidos, novedosos y potencialmente útiles y en última instancia, comprensible a partir de los datos”. Este proceso también es conocido por diferentes nombres que podrían ser sinónimos del mismo, entre los cuales se encuentran Data Archeology ,DependencyFunctionAnalysis, InformationRecollect, Pattern Data Analysis o KnowledgeFishing.

KDD también supone la convergencia de distintas disciplinas de investigación; podemos nombrar algunas tales como el aprendizaje automático, estadística, inteligencia artificial, sistemas de gestión de base de datos, técnicas de visualización de datos, los sistemas para el apoyo a la toma de decisión (DSS) o la recuperación de información, entre otras.

¿Cómo surge?

Con la necesidad de poder manejar grandes cantidades de datos, surge un área de estudio, que se denomina descubrimiento del conocimiento en grandes volúmenes de datos (KDD).

Técnicas minería de datos.

¿Qué tipo de patrones puede encontrar la Minería de Datos?
Dependiendo del conjunto de datos a analizar y del tipo de patrones que se quiera encontrar en el proceso a utilizar.Las técnicas de Minería de Datos pueden ser descriptivas o predictivas. Las descriptivas caracterizan las propiedades generales de los datos en una base de datos y por el contrario, la predictiva realiza inferencias en los datos para poder realizar predicciones.

Técnicas Descriptivas.

Descripción de clases:Hay tres formas de ver este punto, la primera se denomina
Caracterización de los datos (Data Caracterizatión), el cuál realiza un resumen de las características generales de una clase particular de datos; los resultados suelen representarse en términos de reglas de caracterización. La segunda es la discriminación de datos (Data Discrimination), que es una comparación entre las características generales de los objetos de una clase respecto a las de otro conjunto contrastante. Finalmente, también se puede aplicar una combinación de ambas.

Análisis de asociación: Es el descubrimiento de reglas de asociación que muestran condiciones del tipo atributo-valor que ocurre con frecuencia dentro de un conjunto de datos.
La minería mediante reglas de asociación es el proceso de búsqueda interesante de correlaciones entre un conjunto grande de datos. El descubrimiento de reglas de asociación en grandes volúmenes de transacciones de negocios, puede facilitar el proceso de toma de decisiones.

KDD y minería.


Es importante discutir sobre la diferencia entre KDD y Minería de Datos, ya que muchos estudios e investigaciones dan por hecho que ambos son sinónimos. Hay muchos casos que no es posible identificar o distinguir claramente la etapa de Minería de Datos dentro del Proceso de Descubrimiento, porque a veces no es necesario realizar todas y cada una de las etapas del mismo, como pre procesamiento, limpieza de datos, etc.

Entonces, la Minería de Datos la podemos definir como una etapa particular en el proceso KDD, donde la Minería de Datos aplica algoritmos específicos o técnicas específicas para la extracción de patrones de los datos, diferenciándolo del proceso KDD que ya antes a sido definido.

Minería de Datos.


La Minería de Datos es la etapa más importante del KDD; es la que integra los procesos
de aprendizaje y métodos estadísticos para la obtención de hipótesis de patrones y modelos.

Podríamos decir que Minería de datos es  el proceso de extracción de información o conocimiento de un conjunto grande de datos. Formalizando un poco más, lo podemos definir como una etapa particular en el proceso KDD, donde la Minería de Datos aplica algoritmos específicos o técnicas específicas para la extracción de patrones de los datos.

Minería de Texto.

La Minería de Texto difiere de Minería de Datos en el trato de la información, donde la información textual difiere de la estructurada principalmente en la ausencia de estructura o en la compleja estructura implícita del texto. De este modo, se hace necesario buscar alguna representación intermedia del texto que pueda ayudar a la aplicación de técnicas de descubrimiento, que nos permitan extraer patrones útiles.
La Minería de Texto implica a diversas áreas tales como la recuperación de información, extracción de información, tecnologías de bases de datos, aprendizaje de bases de datos, por nombrar algunas.

Etapas de la minería de texto.

Para poder descubrir conocimiento en texto, se debe pasar por algunas etapas importantes en este proceso, como es la etapa del pre-procesamiento que le da al texto una Forma Intermedia (FI) que permita ser tratada computacionalmente, luego aplicar alguna técnica de Minería de Texto y finalmente la visualización de los resultados. (Como se ilustra en la siguiente figura).


                                         

Minería web y el clustering

Una de las técnicas mas utilizadas en la minería web  es el clustering (la técnica  fue aplicada sobre las sesiones de usuarios obtenidas en el pre procedimiento .

Otro estudio de clustering es el que propone una metodología dimensionable de clustering inspirada en el sistema inmunológico natural con el poder de aprender continuamente y adaptarse a patrones entrantes nuevos . los mecanismos inteligentes de búsqueda son cruciales en la minería web por la naturaleza combinatoria grande de optimización de muchos problemas .un sistema inmunológico artificial es como un ser humano donde : el servidor web juega el papel de “cuerpo humano”  y las demandas múltiples entrantes desempeñan el papel de virus/antígeno/bacteria que necesitan ser detectados por la técnica de clustering

Clustering en la minería Web de uso

En el ámbito de la Web podemos decir que se han hecho diversos estudios orientados principalmente a realizar agrupamientos por contenido. Por ejemplo, cuando hacemos búsquedas sobre algún tema lo hacemos con algún buscador de internet. Estos sistemas de búsqueda por temas son denominados motores de búsqueda, los cuales indexan (registran ordenadamente) archivos almacenados en los servidores Web, de los cuales podemos citar al sistema Grooker.

Grooker es un sistema de búsqueda que permite realizar búsquedas en la base de datos de Yahoo!, en la tienda de libros Amazon y en Librería Digital ACM. Los resultados se agrupan por similitud de contenidos y también se pueden presentar de forma gráfica, en forma de esferas (clusters) agrupando temáticas.
En el caso de la Minería Web de Uso, los elementos a agrupar pueden ser las páginas Web y las sesiones de usuarios, con el objetivo de poder realizar un estudio o análisis demográfico.

Procesamiento de datos en minería stream.

1
.        El requisito ilimitado de memoria debido al rasgo continuó de los elementos entrantes de datos.
2
.        Los algoritmos de minería toman varios pasos por encima de datos stream y esto no es aplicable por el rasgo alto de tasa de datos de los stream.
3
.        Datos stream generados de sensores y otras fuentes inalámbricas de datos crean un desafío real para transferir estas cantidades inmensas de elementos de datos para un servidor central para ser analizadas.

Minería stream. (Contemporáneo)

Minería Stream
      
   Se puede definir como “un proceso de extracción del conocimiento de estructuras de registros rápidos y continuos de datos. Los ejemplos de datos streams incluyen tráfico de la red de computadoras, conversaciones telefónicas, transacciones ATM, búsquedas web y datos de sensores.

La mayoría de los streams liberan datos en orden arbitrario, los cuales están intrínsecamente
relacionados con un aspecto temporal, esto quiere decir que los patrones que
son descubiertos en ellos siguen una tendencia dinámica, y por lo tanto son diferentes a
los conjuntos de datos estáticos tradicionales que son muy grandes.