Web Semántica y Datos Conectados. Correcciones y adiciones

Quiero presentar un fragmento de este libro recién publicado:

Modelado ontológico de la empresa: métodos y tecnologías [Texto]: monografía / [S. V. Gorshkov, S. S. Kralin, O. I. Mushtak y otros; editor responsable S. V. Gorshkov]. — Ekaterimburgo: Editorial de la Universidad de los Urales, 2019. — 234 p.: ilustraciones, tablas; 20 cm. — Los autores están indicados en la contraportada. — Bibliografía al final de los capítulos. — ISBN 978-5-7996-2580-1: 200 ejemplares.

El objetivo de la publicación de este fragmento en Habr es cuádruple:

  • Es poco probable que alguien pueda sostener este libro en sus manos si no es cliente de la respetable SergeIndex; definitivamente no está a la venta.
  • El texto ha sido corregido (las correcciones no están resaltadas a continuación) y se han realizado adiciones que no son muy compatibles con el formato de una monografía impresa: notas relevantes (bajo spoilers) y enlaces.
  • Me gustaría reunir preguntas y comentarios, para tenerlos en cuenta al incluir este texto en una versión revisada en futuras publicaciones.
  • Muchos defensores de la Web Semántica y de los Datos Conectados aún creen que su círculo es tan estrecho principalmente porque no se ha explicado adecuadamente al gran público lo maravilloso que es ser un defensor de la Web Semántica y de los Datos Conectados. El autor del fragmento, aunque pertenece a este círculo, no comparte esta opinión, pero, no obstante, considera que es su deber hacer un nuevo intento.

Así que,

Web Semántica

La evolución de Internet se puede presentar de la siguiente manera (o hablar de sus segmentos, formados en el orden indicado a continuación):

  1. Documentos en internet. Las tecnologías clave son Gopher, FTP, etc.
    Internet es una red global para el intercambio de recursos locales.
  2. Internet de documentos. Las tecnologías clave son HTML y HTTP.
    La naturaleza de los recursos expuestos considera las características del medio de transmisión.
  3. Datos en internet. Las tecnologías clave son API REST y SOAP, XHR, etc.
    La era de las aplicaciones de internet, donde los consumidores de recursos no son solo personas.
  4. Internet de datos. Las tecnologías clave son tecnologías de Datos Conectados.
    Esta cuarta etapa, predicha por Berners-Lee, creador de las tecnologías clave de la segunda etapa y director del W3C, se llama Web Semántica; las tecnologías de Datos Conectados están destinadas a hacer que los datos en la web sean no solo legibles por máquinas, sino también "comprensibles por máquinas".

Del siguiente texto, el lector comprenderá la correspondencia de los conceptos clave de la segunda y la cuarta etapas:

  • los análogos de URL son URI,
  • el análogo de HTML es RDF,
  • los enlaces HTML son análogos a las entradas URI en los documentos RDF.

La Web Semántica es más bien una visión sistémica del futuro de Internet que una tendencia concreta impulsada o promovida, aunque también puede tener en cuenta estas últimas. Por ejemplo, una característica importante de lo que se llama Web 2.0 es el "contenido generado por los usuarios". Esta consideración es, en particular, parte de la recomendación del W3C "Web Annotation Ontology" y de iniciativas como Solid.

¿Está muerto el Web Semántico?

Si se renuncia a expectativas poco realistas,, la situación con la web semántica es más o menos similar a la del comunismo en la época del socialismo desarrollado (y si se debe mantener la fidelidad a los mandatos de Ilich, cada uno debe decidirlo por sí mismo). Los motores de búsqueda de manera bastante exitosa obligan a los sitios web a utilizar RDFa y JSON-LD, y ellos mismos utilizan tecnologías relacionadas con las que se describen a continuación (Google Knowledge Graph, Bing Knowledge Graph).

En términos generales, el autor no puede decir qué impide una mayor difusión, pero puede expresar una opinión basada en la experiencia personal. Hay tareas que se resolverían "listo para usar" en condiciones de la llegada de SW, aunque no son muy masivas. Como consecuencia, aquellos que enfrentan estas tareas no tienen medios de coerción sobre quienes pueden proporcionar la solución, y proporcionar esas soluciones de manera independiente contradice sus modelos de negocio. Así que seguimos analizando HTML y uniendo varias API, una peor que la otra.

Sin embargo, las tecnologías de Linked Data se han difundido más allá de la web masiva; estas aplicaciones son precisamente el enfoque del libro. Actualmente, la comunidad de Linked Data espera que estas tecnologías se difundan aún más gracias a la fijación (o proclamación, como prefiera) de Gartner de tendencias como Knowledge Graphs y Data Fabric. Esperamos que no sean las implementaciones "de bicicleta" de estos conceptos las que tengan éxito, sino aquellas que tengan relación con los estándares del W3C que se examinan a continuación.

Linked Data

Berners-Lee definió Linked Data como la Web Semántica "bien hecha": un conjunto de enfoques y tecnologías que permiten alcanzar sus objetivos finales. Los principios básicos de Linked Data que Berners-Lee identificó son los siguientes.

Principio 1. Uso de URI para nombrar entidades.

Los URI son identificadores globales de entidades en contraposición a los identificadores de cadena locales de registros. Posteriormente, la mejor expresión de este principio se encontró en el eslogan de Google Knowledge Graph «cosas, no cadenas».

Principio 2. Uso de URI en el esquema HTTP, para que puedan ser desreferenciados.

Al referirse a un URI, debería ser posible obtener el significado detrás de este significante (aquí es clara la analogía con el nombre del operador «*» en C); más precisamente, obtener alguna representación de ese significado, dependiendo del valor del encabezado HTTP Accept:. Puede que, con la llegada de la era AR/VR, se pueda acceder al propio recurso, pero por ahora, es probable que sea un documento RDF como resultado de ejecutar una consulta SPARQL. DESCRIBE.

Principio 3. Uso de los estándares W3C — en particular, RDF(S) y SPARQL — específicamente, al desreferenciar URI.

Estas distintas «capas» del stack de tecnologías de Linked Data, también conocido como Semantic Web Layer Cake, serán descritas más adelante.

Principio 4. Utilizar enlaces a otros URI al describir entidades.

RDF permite limitarse a una descripción verbal del recurso en lenguaje natural, y el cuarto principio exhorta a no hacerlo. Con el cumplimiento universal del primer principio, surge la posibilidad de referirse a otros recursos al describir uno, incluso «ajenos», lo que hace que los datos se llamen relacionados. De hecho, el uso de URI nombrados en el diccionario RDFS es casi inevitable.

RDF

RDF (Framework de Descripción de Recursos) — formalismo para describir entidades interrelacionadas.

Sobre las entidades y sus interrelaciones se hacen afirmaciones del tipo «sujeto-predicado-objeto», llamadas tripletas. En su forma más simple, tanto el sujeto como el predicado y el objeto son URI. El mismo URI puede estar en diferentes posiciones en distintas tripletas: ser sujeto, predicado y objeto; de este modo, las tripletas forman una especie de gráfico, conocido como gráfico RDF.

Los sujetos y objetos pueden ser no solo URI, sino también llamados nodos en blanco, y los objetos pueden ser también literales. Los literales son instancias de tipos primitivos, compuestos por una representación de cadena y una indicación de tipo.

Ejemplos de representación de literales (en sintaxis Turtle, de la que hablaré más adelante): "5.0"^^xsd:float y "five"^^xsd:string. Los literales con tipo rdf:langString pueden estar también etiquetados con un idioma, en Turtle esto se escribe así: "five"@en y "cinco"@es.

Los nodos vacíos son recursos "anónimos" sin identificadores globales, sobre los cuales, sin embargo, se pueden hacer afirmaciones; una especie de variables existenciales.

Entonces (en esto, de hecho, radica toda la esencia de RDF):

  • el sujeto es un URI o un nodo vacío,
  • el predicado es un URI,
  • el objeto es un URI, un nodo vacío o un literal.

¿Por qué los predicados no pueden ser nodos vacíos?

La razón probable es el deseo de entender informalmente y traducir al lenguaje de la lógica de predicados de primer orden el triplete s p o como algo parecido a Web Semántica y Datos Conectados. Correcciones y adiciones, donde Web Semántica y Datos Conectados. Correcciones y adiciones — predicado, Web Semántica y Datos Conectados. Correcciones y adiciones y Web Semántica y Datos Conectados. Correcciones y adiciones — constantes. Las huellas de tal comprensión están en el documento "LBase: Semantics for Languages of the Semantic Web", que tiene el estatus de nota del grupo de trabajo W3C. Con tal comprensión, el triplete s p [], donde [] — nodo vacío, se traduciría como Web Semántica y Datos Conectados. Correcciones y adiciones, donde Web Semántica y Datos Conectados. Correcciones y adiciones — variable, pero ¿cómo se traduciría entonces s [] o?? Имеющий статус рекомендации W3C документ «RDF 1.1 Semantics» ofrece otra forma de traducción, pero la posibilidad de que los predicados sean nodos vacíos aún no se considera.

Sin embargo, Manuel Sporny permitió.

RDF es un modelo abstracto. RDF puede ser escrito (serializado) en varios sintaxis: RDF/XML, Turtle (el más legible), JSON-LD, HDT (binario).

El mismo RDF puede ser serializado en RDF/XML de varias maneras, por lo que, por ejemplo, validar el XML resultante con XSD o intentar extraer datos usando XPath carece de sentido. De la misma manera, JSON-LD difícilmente satisfará el deseo de un desarrollador de Javascript promedio de trabajar con RDF usando la notación de punto y corchetes de Javascript (aunque JSON-LD avanza en esta dirección, ofreciendo un mecanismo de enmarcado.).

La mayoría de las sintaxis ofrecen formas de acortar URIs largos. Por ejemplo, la declaración @prefix rdf: en Turtle permitirá escribir en lugar de <http://www.w3.org/1999/02/22-rdf-syntax-ns#type> simplemente rdf:type.

RDFS

RDFS (RDF Schema) es un diccionario básico de modelado, introduce conceptos de propiedades y clases y propiedades como rdf:type, rdfs:subClassOf, rdfs:domain y rdfs:range. Mediante el diccionario RDFS se pueden registrar, por ejemplo, las siguientes expresiones válidas:

rdf:type rdf:type rdf:Property .
rdf:Property rdf:type rdfs:Class .
rdfs:Class rdfs:subClassOf rdfs:Resource .
rdfs:subClassOf rdfs:domain rdfs:Class .
rdfs:domain rdfs:domain rdf:Property .
rdfs:domain rdfs:range rdfs:Class .
rdfs:label rdfs:range rdfs:Literal .

RDFS es un diccionario de descripción y modelado, pero no es un lenguaje de restricciones (aunque la especificación oficial y deja la posibilidad de tal uso). La palabra «Schema» no debe entenderse en el mismo sentido que en la expresión «XML Schema». Por ejemplo, :author rdfs:range foaf:Person significa que rdf:type todos los valores de la propiedad :author — foaf:Person, pero no significa que esto deba ser mencionado de antemano.

SPARQL

SPARQL (SPARQL Protocol and RDF Query Language) es un lenguaje de consultas para datos RDF. En un caso simple, una consulta SPARQL consiste en un conjunto de patrones que se emparejan con los tripletas del gráfico consultado. En los patrones, en las posiciones de sujeto, predicado y objeto pueden haber variables.

La consulta devolverá los valores de las variables, que al ser sustituidos en los patrones pueden generar un subgráfico del gráfico RDF consultado (un subconjunto de sus tripletas). Las variables del mismo nombre en diferentes patrones de tripletas deben tener los mismos valores.

Por ejemplo, en el conjunto de siete axiomas RDFS mencionado anteriormente, la siguiente consulta devolverá rdfs:domain y rdfs:range como valores ?s y ?p respectivamente:

SELECT * WHERE {
 ?s ?p rdfs:Class .
 ?p ?p rdf:Property .
}

Cabe señalar que SPARQL es declarativo y no es un lenguaje de descripción de recorrido de gráfico (sin embargo, algunos almacenes RDF ofrecen formas de ajustar el plan de ejecución de la consulta). Por lo tanto, algunas tareas gráficas estándar, como la búsqueda del camino más corto, no pueden resolverse en SPARQL, incluso utilizando el mecanismo property paths (pero, nuevamente, algunos almacenes RDF ofrecen extensiones especiales para resolver estas tareas).

SPARQL no comparte la presunción de apertura del mundo y sigue el enfoque de «negación como fallo», en él es posible construcciones como FILTER NOT EXISTS {…}. La distribución de datos se tiene en cuenta mediante el mecanismo de consultas federadas.

Un punto de acceso SPARQL, un almacén RDF capaz de procesar consultas SPARQL, no tiene equivalentes directos de la segunda etapa (ver el inicio de este párrafo). Se puede comparar con una base de datos a partir de cuyo contenido se generan páginas HTML, pero que está disponible externamente. El punto de acceso SPARQL es más bien análogo a un punto de acceso API de la tercera etapa, aunque con dos diferencias principales. En primer lugar, existe la posibilidad de combinar varias consultas «atómicas» en una (lo que se considera una característica clave de GraphQL), en segundo lugar, tal API está completamente autodocumentada (lo que HATEOAS intentó lograr).

Comentario polémico

RDF es un método para la publicación de datos en la web, por lo que los almacenes RDF deberían considerarse bases de datos documentales. Sin embargo, dado que RDF es un grafo y no un árbol, también resultaron ser gráficos. Es sorprendente que haya sido posible. ¿Quién podría haber pensado que habría personas que implementarían nodos en blanco? En el caso de Codd, no lo logró. No salió..

Existen formas menos funcionales de organizar el acceso a los datos RDF, como por ejemplo, Fragmentos de Datos Enlazados (LDF) y Plataforma de Datos Enlazados (LDP).

OWL

OWL (Lenguaje de Ontología Web) es un formalismo para la representación del conocimiento, una variante sintáctica de la lógica descriptiva Web Semántica y Datos Conectados. Correcciones y adiciones (en lo sucesivo es más correcto hablar de OWL 2, ya que la primera versión de OWL se basaba en Web Semántica y Datos Conectados. Correcciones y adiciones).

Los conceptos de las lógicas descriptivas en OWL corresponden a las clases, los roles son propiedades y los individuos mantienen sus nombres anteriores. Las axiomas también se denominan axiomas.

Por ejemplo, en la llamada sintaxis de Manchester, la axioma que ya conocemos en OWL se escribirá de la siguiente manera: Web Semántica y Datos Conectados. Correcciones y adiciones Clase: Humano Clase: Padre ClaseEquivalente: Humano y (inverso tienePadre) algunos Humanos PropiedadObjeto: tienePadre

Existen otros sintaxis para escribir OWL, como por ejemplo,

sintaxis funcional, utilizada en la especificación oficial, yOWL/XML. Además, OWL puede ser serializadoen sintaxis abstracta RDF y luego en cualquiera de las sintaxis concretas. OWL tiene una relación dual con RDF. Por un lado, se puede considerar como un diccionario que expande RDFS. Por otro lado, es un formalismo más potente, para el cual RDF es solo un formato de serialización. No todas las construcciones elementales de OWL se pueden expresar mediante un solo trípleta RDF.

Dependiendo de qué subconjunto de construcciones de OWL esté permitido usar, se habla de los llamados

perfiles de OWL. Los estandarizados y más conocidos son OWL EL, OWL RL y OWL QL. La elección de un perfil afecta la complejidad computacional de los problemas típicos. El conjunto completo de construcciones de OWL que corresponde ase llama OWL DL. A veces también se menciona OWL Full, en el cual las construcciones de OWL se pueden usar sin restricciones, inherentes a RDF, sin limitaciones semánticas y computacionales. Web Semántica y Datos Conectados. Correcciones y adicionesPor ejemplo, algo puede ser tanto una clase como una propiedad. OWL Full es indecidible. Web Semántica y Datos Conectados. Correcciones y adicionesLos principios clave para la deducción en OWL son la aceptación de la presunción de mundo abierto (open world assumption,

OWA) y el rechazo de la presunción de unicidad de nombres (unique name assumption, UNA).) y la renuncia a la presunción de unicidad de nombres (unique name assumption, UNA). A continuación, veremos a qué pueden llevar estos principios y conoceremos algunas construcciones de OWL.

Supongamos que la ontología contiene el siguiente fragmento (en sintaxis de Manchester):

Class: manyChildren
   EquivalentTo: Human that hasChild min 3
Individual: John
   Types: Human
   Facts: hasChild Alice, hasChild Bob, hasChild Carol

¿Seguirá de lo dicho que John tiene muchos hijos? La negación de UNA hará que el motor de inferencia responda negativamente a esta pregunta, ya que Alice y Bob podrían ser la misma persona. Para que la inferencia tenga lugar, será necesario añadir el siguiente axioma:

DifferentIndividuals: Alice, Bob, Carol, John

Supongamos que el fragmento de la ontología ahora tiene el siguiente aspecto (John se declara como padre de muchos hijos, pero se especifican solo dos niños):

Class: manyChildren
   EquivalentTo: Human that hasChild min 3
Individual: John
   Types: Human, manyChildren
   Facts: hasChild Alice, hasChild Bob
DifferentIndividuals: Alice, Bob, Carol, John

¿Sería esta ontología contradictoria (lo que podría interpretarse como evidencia de datos no válidos)? La aceptación de OWA hará que el motor de inferencia responda negativamente: "en algún lugar" (en otra ontología) podría decirse que Carol también es hija de John.

Para excluir esta posibilidad, añadimos un nuevo hecho sobre John:

Individual: John
   Facts: hasChild Alice, hasChild Bob, not hasChild Carol

Para excluir la posibilidad de otros niños, digamos que todos los valores de la propiedad "tener hijo" son personas, de las cuales solo tenemos cuatro:

ObjectProperty: hasChild
   Domain: Human
   Сharacteristics: Irreflexive
Class: Human
EquivalentTo: { Alice, Bill, Carol, John }

Ahora la ontología se volverá contradictoria, de lo que el motor de inferencia no dejará de informar. Con el último de los axiomas hemos de alguna manera "cerrado" el mundo, y observemos cómo se ha excluido la posibilidad de que John sea su propio hijo.

Vinculando Datos Empresariales

El conjunto de enfoques y tecnologías de Linked Data fue originalmente diseñado para publicar datos en la web. Su uso en un entorno corporativo enfrenta varios desafíos.

Por ejemplo, en un entorno corporativo cerrado, la fuerza deductiva de OWL, basada en la aceptación de OWA y la negación de UNA, es demasiado débil: decisiones condicionadas por la naturaleza abierta y distribuida de la web. Y aquí hay posibles salidas.

  • Dotar a OWL de semántica, lo que implica la negación de OWA y la aceptación de UNA, la implementación de un motor de inferencia correspondiente. — Por este camino avanza el almacenamiento RDF Stardog.
  • Descartar las capacidades deductivas de OWL a favor de motores de reglas. — Stardog soporta SWRL; Jena y GraphDB ofrecen sus propios lenguajes de reglas.
  • Descartar las capacidades deductivas de OWL, utilizando para modelar un subconjunto particular cercano a RDFS. — Ver más sobre esto más adelante.

Otro problema es la atención significativamente mayor que se puede dedicar a los problemas de calidad de datos en el mundo corporativo, y la falta de herramientas de validación de datos en la pila de Linked Data. Las salidas aquí son las siguientes.

  • Una vez más, usar la validación de construcciones OWL con semántica de mundo cerrado y unicidad de nombres siempre que existan motores de inferencia adecuados.
  • Uso SHACL, estandarizado ya después de que se fijó la lista de capas de Semantic Web Layer Cake (aunque puede usarse también como motor de reglas), o ShEx.
  • Consciencia de que todo se hace, en última instancia, a través de consultas SPARQL, creando un mecanismo simple de validación de datos usando dichas consultas.

Sin embargo, incluso el completo rechazo de las capacidades deductivas y de las herramientas de validación deja a la pila de Linked Data sin competencia en tareas que son paisajísticamente similares a la web abierta y distribuida — en tareas de integración de datos.

¿Qué pasa con un sistema de información corporativa convencional?

Es posible, pero es necesario tener claro qué problemas específicos deben resolver las tecnologías correspondientes. Aquí describiré la reacción típica de los participantes en el desarrollo para ilustrar cómo se ve esta pila tecnológica desde la perspectiva de TI convencional. Se asemeja un poco a la fábula del elefante:

  • Analista de negocios: RDF es algo así como un modelo lógico almacenado directamente.
  • Analista de sistemas: RDF es como EAV, solo que con un montón de índices y un lenguaje de consultas fácil de usar.
  • Desarrollador: bueno, todo está en la línea de las concepciones de rich model y low code, leí recientemente sobre esto.
  • Jefe de proyecto: eso es colapsando la pila!

La práctica muestra que la pila se utiliza más comúnmente en tareas relacionadas con la distribución y heterogeneidad de datos, por ejemplo, al construir sistemas del tipo MDM (Gestión de Datos Maestros) o DWH (Almacén de Datos). Tales tareas existen en cualquier sector.

En cuanto a aplicaciones con especificidad sectorial, actualmente las tecnologías de Linked Data son más populares en los siguientes sectores.

  • tecnologías biomédicas (donde su popularidad, aparentemente, está relacionada con la complejidad del área temática);

actual

En la ‘Punto de ebullición’ recientemente tuvo lugar una conferencia organizada por la asociación ‘Base Nacional de Conocimientos Médicos’ ‘Unión de ontologías. De la teoría a la aplicación práctica».

  • fabricación y operación de productos complejos (grande maquinaria, extracción de petróleo y gas; generalmente se refiere a la norma ISO 15926);

actual

Aquí también la causa es la complejidad del campo, cuando, por ejemplo, en la etapa de upstream, hablando de la industria del petróleo y gas, la contabilidad básica necesita tener algunas funciones de CAD.

En 2008 se llevó a cabo una conferencia inaugural organizada por Chevron conferencia.

ISO 15926 resultó ser un poco pesado para la industria del petróleo y gas (y probable encontró más aplicación en la ingeniería mecánica). Solo Statoil (Equinor), en Noruega, realmente se dedicó a él, formando todo un ecosistema.Otros intentan hacer algo propio. Por ejemplo, según los rumores, el Ministerio de Energía de Rusia pretende crear un ‘modelo ontológico conceptual de la industria energética’, similar, al parecer, a la creada para la electricidad..

  • instituciones financieras (incluso XBRL podría considerarse una especie de híbrido entre SDMX y la ontología RDF Data Cube);

actual

LinkedIn, a principios de año, spammeaba activamente al autor con ofertas de empleo de casi todos los gigantes de la industria financiera, que conocía por la serie ‘Suits’: Goldman Sachs, JPMorgan Chase y/o Morgan Stanley, Wells Fargo, SWIFT/Visa/Mastercard, Bank of America, Citigroup, la Reserva Federal, Deutsche Bank... Probablemente todos estaban buscando a alguien que pudiera ser enviado a la Conferencia del Grafo de Conocimiento.Muchos lograron encontrarlo: las instituciones financieras ocupaban toda la mañana del primer día..

En HeadHunter, en cambio, algo interesante solo apareció en Sberbank, donde se hablaba de un ‘almacenamiento EAV con un modelo de datos similar a RDF’.

Probablemente, la diferencia en el grado de amor por las tecnologías correspondientes entre las instituciones financieras nacionales y occidentales se debe a la naturaleza transnacional de las últimas. Aparentemente, la integración a través de fronteras estatales requiere soluciones organizativas y técnicas de calidad diferente.

  • sistemas de preguntas y respuestas con aplicaciones comerciales (IBM Watson, Apple Siri, Google Knowledge Graph);

actual

Por cierto, Thomas Gruber, el creador de Siri, es el autor de esa misma definición de ontología (en el sentido de TI) como "especificación de conceptualización". En mi opinión, cambiar el orden de las palabras en esta definición no altera su significado, lo que podría indicar que quizás no lo haya.

  • publicación de datos estructurados (con buena base, esto ya puede relacionarse con Linked Open Data).

actual

Los grandes aficionados a Linked Data son los llamados GLAM: Galleries, Libraries, Archives, and Museums. Es suficiente decir que, en reemplazo de MARC21, la Biblioteca del Congreso promueve BIBFRAME, quien proporciona una base para el futuro de la descripción bibliográfica y, por supuesto, se basa en RDF.

A menudo, se menciona como un ejemplo exitoso en el campo de Linked Open Data a Wikidata: una especie de versión legible por máquina de Wikipedia, cuyo contenido, a diferencia de DBPedia, no se genera importando de los infoboxes de los artículos, sino que se crea más o menos manualmente (y luego se convierte en fuente de información para esos mismos infoboxes).

También recomendamos la consulta lista de los usuarios del almacenamiento RDF Stardog en el sitio de Stardog en la sección "Customers".

De todos modos, en el informe de Gartner "Hype Cycle for Emerging Technologies" de 2016 "Enterprise Taxonomy and Ontology Management" se sitúa a mitad de descenso en el valle de la desilusión con la perspectiva de alcanzar el "plato de productividad" no antes de 10 años.

Conectando Datos Empresariales

Pronósticos, pronósticos, pronósticos…

Por interés histórico, resumí en la tabla a continuación las predicciones de Gartner de diferentes años sobre las tecnologías que nos interesan.

AñoTecnologíaInformePosiciónAños hasta el plato
2001Web SemánticaTecnologías EmergentesDetonante de Innovación5-10
2006Web Semántica CorporativaTecnologías EmergentesPico de Expectativas Infladas5-10
2012Web SemánticaBig DataPico de Expectativas Infladas>10
2015Linked DataAnalítica Avanzada y Ciencia de DatosFosa de la Desilusión5-10
2016Gestión de Ontologías EmpresarialesTecnologías EmergentesFosa de la Desilusión>10
2018Knowledge GraphsTecnologías EmergentesDetonante de Innovación5-10

Sin embargo, ya en el "Hype Cycle…" de 2018 apareció otra tendencia ascendente: los Graphs de Conocimiento. Hubo una especie de reencarnación: las bases de datos de gráficos, que han captado la atención de los usuarios y el esfuerzo de los desarrolladores, bajo la influencia de las exigencias de los primeros y los hábitos de los últimos, comenzaron a adquirir contornos y posicionamiento de sus predecesores competidores.

Prácticamente cada base de datos de gráficos ahora se declara como una plataforma adecuada para construir un "grafo de conocimiento" corporativo ("linked data" a veces se reemplaza por "connected data"), pero ¿hasta qué punto son justificadas tales pretensiones?

Las bases de datos de grafos siguen siendo asémanticas; los datos en una base de datos de grafos son el mismo silo de datos. Los identificadores de cadena en lugar de URI hacen que la tarea de integrar dos bases de datos de grafos siga siendo la misma tarea de integración, mientras que la integración de dos almacenes RDF a menudo se reduce simplemente a combinar dos grafos RDF. Otro aspecto de la asematicidad es la no reflexividad del modelo LPG de grafos, lo que dificulta la gestión de metadatos utilizando la misma plataforma.

Finalmente, las bases de datos de grafos no tienen motores de inferencia ni motores de reglas. Los resultados de tales motores se pueden reproducir complicando las consultas, pero esto es posible incluso en SQL.

Sin embargo, los principales almacenes RDF no tienen problemas para soportar el modelo LPG. Se considera que el enfoque más sólido fue propuesto en su momento en Blazegraph: el modelo RDF*, que combina RDF y LPG.

Más información

Se puede leer más sobre el soporte de los almacenes RDF para el modelo LPG en el artículo anterior en Habr: «¿Qué está sucediendo ahora con los almacenes RDF?». Espero que un día se escriba un artículo separado sobre Knowledge Graphs y Data Fabric. La sección final, como se puede entender fácilmente, fue escrita con prisa; sin embargo, incluso después de seis meses, estos conceptos no son mucho más claros.

Literatura

  1. Halpin, H., Monnin, A. (eds.) (2014). Philosophical Engineering: Toward a Philosophy of the Web
  2. Allemang, D., Hendler, J. (2011) Semantic Web for the Working Ontologist (2nd ed.)
  3. Staab, S., Studer, R. (eds.) (2009) Handbook on Ontologies (2nd ed.)
  4. Wood, D. (ed.). (2011) Linking Enterprise Data
  5. Keet, M. (2018) An Introduction to Ontology Engineering

Fuente: habr.com

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster