Jump to content
Menü aufrufen
Toggle preferences menu
Persönliches Menü aufrufen
Nicht angemeldet
Ihre IP-Adresse wird öffentlich sichtbar sein, wenn Sie Änderungen vornehmen.

Unser Wiki ist seit dem 2. Oktober öffentlich lesbar. Mehr dazu.

Gkc25-Session: From Data to Information and Knowledge

Aus GfWM Wiki
From Data to Information and Knowledge
Art Vortrag
KnowledgeCamp KnowledgeCamp 2025
Speaker:in Etienne Posthumus
Organisation NFDI4Culture
Track Kuratierter Track
Datum 23.10.2025
Zeit 15:00 bis 15:45 Uhr
Raum Berlin (1.OG)
Sprache Englisch
Aufzeichnung YouTube
Im Programm Programm
KI-Unterstützung GPT-6.1 Sol

Aus dem Veranstaltungsprogramm:

In the NFDI4Culture consortium, we have been working on building a research knowledge graph that ties together research data from diverse disciplines like architecture, art history and musicology to theatre, dance, film and media studies.

This means finding research data in many diverse formats, and presenting the data in a unified, user-friendly format that can be used to build further infrastructures.

In my talk I would like to share what tools we use to do this, and show some raw data and how we convert that into the RDF Data model, and especially why we do so, and what the benefits are.

In the spirit of barcamp, questions and use-cases from the audience are welcomed, and we can consider the feasibility of modelling these from a Linked Data perspective.

The RDF model (and Linked Open Data movement) has been considered an „old“ technology in many circles, but with the limits of Large Language Models now becoming pressing, has seen revived interest as an open standardised way to build knowledge graphs.For some excellent background information I would like to recommend the free course by Prof Harald Sack, which can be watched entirely on Youtube (https://www.youtube.com/playlist?list=PLNXdQl4kBgzubTOfY5cbtxZCgg9UTe-uF).

Etienne Posthumus erläutert, wie NFDI4Culture heterogene Forschungsdaten zum kulturellen Erbe in einem gemeinsamen Wissensgraphen erschließt. Ausgangspunkt sind das RDF-Datenmodell, die Verknüpfung über URIs und gemeinsam verwendete Normdaten. An Beispielen aus Wikidata, der NFDI4Culture Data Search und Iconclass zeigt er, wie daraus abfragbare und institutionenübergreifend nutzbare Informationen entstehen. Zugleich behandelt er die technischen Zugangshürden und den noch offenen Ausbau benutzerfreundlicher Darstellungen.

Gliederung und Aufbau des Vortrags

Der Vortrag verbindet eine Einführung in Datenmodellierung mit Live-Demonstrationen und Rückfragen aus dem Publikum. Posthumus beginnt mit seinem beruflichen Hintergrund zwischen Informatik, Buchgeschichte und Handschriftenforschung. Die Arbeit mit kulturellen Metadaten führte ihn zum Knowledge Engineering; die Verbindung technischer und kulturwissenschaftlicher Perspektiven prägt seinen Zugang.

Anschließend stellt er NFDI4Culture vor und entwickelt das RDF-Modell aus einem alltäglichen Tabellenproblem. Darauf folgen die Idee verknüpfter Daten und eine Demonstration von Wikidata. Im zweiten Teil überträgt er diese Grundlagen auf den Culture Knowledge Graph, erläutert Werkzeuge und zeigt die Datensuche. Den Abschluss bilden Normdaten, Iconclass und Fragen zu Ergebnissen, Visualisierungen und weiterführender Dokumentation.

Posthumus lädt wiederholt zu Unterbrechungen ein. Eine Frage zur praktischen Ausführung von SPARQL-Abfragen führt unmittelbar zu einer Demonstration des Wikidata Query Service.

Kulturelle Forschungsdaten als Integrationsaufgabe

Posthumus beschreibt NFDI als eine von der DFG finanzierte nationale Forschungsdateninfrastruktur mit Konsortien für unterschiedliche Wissenschaftsbereiche. NFDI4Culture widmet sich Forschungsdaten zum materiellen und immateriellen kulturellen Erbe. Dazu gehören Architektur, Kunstgeschichte, Musikwissenschaft, Theaterwissenschaft, Tanz und Medienwissenschaften. Universitäten, Archive und Museen bringen unterschiedliche Arbeitsweisen und Datenbestände ein.

Die Vielfalt macht die Integration anspruchsvoll. Nach den im Vortrag genannten Zahlen sind mehr als 70 Datenportale mit über 100 Millionen bekannten Einträgen beteiligt. Die Quellen enthalten unter anderem XML, JSON, Bitmap-Dateien und RDF-Tripel. Auch ihre technische Erschließung unterscheidet sich: Manche Einrichtungen veröffentlichen lediglich Webseiten, andere strukturierte Daten, wieder andere RDF mit einem SPARQL-Endpunkt.

Die Aufgabe besteht darin, diese Daten einzusammeln, zu extrahieren, nach RDF zu transformieren und standardisiert bereitzustellen. Ziel ist nicht nur eine gemeinsame Anzeige. Die Forschungsdaten sollen über ihre ursprünglichen fachlichen und institutionellen Grenzen hinweg auffindbar und miteinander verknüpfbar werden.

Als Beispiel nennt Posthumus die Frage, ob in den Forschungsdaten Drachen vorkommen. Eine entsprechende Recherche könnte Bildarchive, Musikbestände und Theateraufführungen betreffen. Unterschiedliche Sprachen oder das Fehlen des ausdrücklichen Wortes „Drache“ erschweren eine bloße Stichwortsuche.

RDF: Aussagen statt starrer Tabellen

Den Einstieg in RDF bildet eine vertraute Schwierigkeit: Eine Tabellenzeile enthält mehrere Schlagwörter oder mehrere zugehörige Objekte. In einer relationalen Datenbank würde man solche Informationen auf getrennte Tabellen verteilen und diese miteinander verbinden.

Posthumus erläutert dies anhand der Chinook-Beispieldatenbank eines Musikgeschäfts. Rechnungen, Alben, Künstler und einzelne Titel hängen miteinander zusammen. RDF stellt er als eine konsequente Fortführung dieser Zerlegung dar: Am Ende stehen Aussagen mit jeweils drei Bestandteilen.

  • Das Subjekt bezeichnet die Sache, über die etwas ausgesagt wird.
  • Das Prädikat bezeichnet die Eigenschaft oder Beziehung.
  • Das Objekt enthält einen Wert oder verweist auf eine weitere Sache.

Ein Album kann beispielsweise einen Namen besitzen und mit einem Künstler verbunden sein. Der Künstler erhält wiederum eine eigene Kennung und einen Namen. Ein Musiktitel kann auf das zugehörige Album verweisen. Das Objekt einer Aussage ist damit entweder etwa eine Zeichenfolge oder eine Verbindung zu einem anderen identifizierten Gegenstand.

Die zunächst abstrakte Struktur bildet ein Netz aus Beziehungen. Posthumus betont, dass dieses Modell anfangs ungewohnt sein kann. Er ordnet RDF als einen Ansatz ein, der früh maschinenlesbare Webinformationen ermöglichen sollte, zunächst aber wegen seines Aufwands und seiner Abstraktion nur begrenzt angenommen wurde. Für seine heutige Arbeit ist es ein zentrales gemeinsames Datenmodell.

Verknüpfung und Nutzbarkeit gehören zusammen

Zu den Tripeln kommen URIs als webbasierte Kennungen für Gegenstände und Eigenschaften. Dadurch können Daten nicht nur innerhalb eines Bestands, sondern auch mit Informationen anderer Einrichtungen verbunden werden. Posthumus erläutert dies als Grundlage von Linked Open Data.

Den Nutzen veranschaulicht er mit dem Netzwerkeffekt: Ein Netz gewinnt durch zusätzliche Verbindungen an Wert. Übertragen auf Daten entstehen neue Möglichkeiten, wenn getrennte Bestände aufeinander Bezug nehmen können. Steuerverwaltung, Museen und Bahnangebote nennt er als Beispiele für Einrichtungen, die verknüpfte Daten veröffentlichen.

Eine standardisierte Struktur allein reicht allerdings nicht aus. Posthumus verweist ausdrücklich auf die Bedeutung nutzbarer Linked Open Data und auf Arbeiten von Robert Sanderson. Daten können technisch offen und verknüpft sein, ohne dadurch bereits praktisch hilfreich zu werden. Diese Unterscheidung zieht sich durch den Vortrag: Die technische Grundlage muss mit verständlichen Zugängen verbunden werden.

Wikidata als anschauliches Beispiel

An Wikidata zeigt Posthumus, dass strukturierte und verknüpfte Daten praktisch eingesetzt werden. Er öffnet den Eintrag zu Berlin mit der Kennung Q64. Eigenschaften wie Typzugehörigkeit, übergeordnete Zusammenhänge, Entstehungsangaben oder Bilder erscheinen dort in einer lesbaren Oberfläche; darunter liegt die strukturierte Darstellung.

Wikidata beschreibt er als eigenständig gepflegte Wissenssammlung. Menschen bearbeiten Einträge, korrigieren Angaben und legen Datensätze auch unabhängig von Wikipedia-Artikeln an. Besonders hebt er das Projekt „The Sum of All Paintings“ hervor, in dem Wissen über Gemälde, ihre Urheber und ihre Aufbewahrungsorte gemeinschaftlich zusammengetragen wird.

Wikidata kann zudem als Bezugspunkt für eigene Notizen dienen. Wer etwa besuchte Orte dokumentiert, kann auf deren Datensätze verweisen und damit persönliche Informationen mit gemeinsam gepflegten Kennungen verbinden.

Abfragen und ihre Zugangshürden

Auf eine Publikumsfrage öffnet Posthumus den Wikidata Query Service. Aus dessen Beispielen führt er eine Abfrage zu Gebärdensprachen aus, die eine Karte mit Angaben zur Zahl der Nutzenden liefert. Anschließend reduziert er die Abfrage, um die zugrunde liegende Suche nach Einträgen eines bestimmten Typs sichtbar zu machen.

SPARQL bezeichnet er als Abfragesprache für RDF, vergleichbar mit der Rolle von SQL bei relationalen Datenbanken. Zugleich hält er es für unrealistisch, gewöhnlichen Nutzenden das eigenständige Schreiben solcher Abfragen abzuverlangen. Selbst mit Informatikkenntnissen könne dies schwierig sein.

Als Hilfe nennt er Sprachmodelle, die aus natürlichsprachlichen Anforderungen SPARQL-Abfragen erzeugen können. Ihre Qualität habe sich nach seiner Erfahrung verbessert. Eine solche Live-Erzeugung kündigt er als mögliche spätere Demonstration an; im dokumentierten Verlauf wird sie nicht durchgeführt.

Culture Knowledge Graph und verwendete Werkzeuge

Der Culture Knowledge Graph bildet einen gemeinsamen Index über die beteiligten Datenquellen. Posthumus unterscheidet Informationen über das Konsortium – Personen, Institutionen und Zugehörigkeiten – von Informationen über Datenportale, Formate und die eigentlichen Forschungsdaten.

Eine zentrale technische Grundlage ist Python. Posthumus setzt es für Datenverarbeitung und die Infrastruktur ein. Als Beispiele nennt er das Auslesen und Umwandeln von Excel-Dateien sowie die Verarbeitung von Markdown-Notizen. Coding-Agenten können nach seiner Darstellung beim Erstellen kleiner Skripte helfen.

Weitere vorgestellte Werkzeuge sind:

  • FastHTML, mit dem er Webanwendungen weitgehend in Python entwickelt.
  • Triple Stores als Datenbankwerkzeuge für die Speicherung und Bereitstellung von RDF.
  • Sparkle, ein von ihm entwickeltes Werkzeug zum Veröffentlichen und Durchsehen von RDF-Dateien, das technische Kenntnisse und Docker voraussetzt.
  • „Big Data“, ein weiteres Werkzeug für Abfragen über große RDF-Dateisammlungen, das er nur kurz erwähnt.

Die NFDI4Culture Data Search führt diese Grundlagen in einer Suchoberfläche zusammen. Posthumus demonstriert eine Suche nach „Bach“, die Ergebnisse aus unterschiedlichen Forschungsdatenportalen erschließt. RDF und SPARQL bleiben dabei im Hintergrund. Nutzende erhalten einen leichter zugänglichen Einstieg sowie Auswahlmöglichkeiten für Datentypen, Standards und Normdatensysteme.

Normdaten verbinden Begriffe, Sprachen und Bestände

Damit Verknüpfungen funktionieren, müssen unterschiedliche Einrichtungen erkennen können, wann sie über denselben Gegenstand sprechen. Normdaten liefern dafür gemeinsam verwendete Kennungen. Posthumus nennt die Gemeinsame Normdatei der Deutschen Nationalbibliothek als Beispiel: Wer solche URIs verwendet, kann unabhängig von unterschiedlichen Namensformen auf denselben Bezugspunkt verweisen.

Ausführlich zeigt er Iconclass, das er nach eigener Aussage seit etwa 25 Jahren betreut. Hier erhalten Konzepte und Bildinhalte eigene Kennungen, darunter konkrete Szenen ebenso wie abstrakte Begriffe wie Liebe oder Hass. Die Kennung bleibt unabhängig davon, in welcher Sprache ein Begriff benannt wird.

Eine Demonstration zum Thema Faustkampf führt zu Bildern im Bildindex in Marburg und in einem weiteren kunsthistorischen Bestand in Florenz. Gemeinsam verwendete Iconclass-Kennungen ermöglichen diese Verbindungen. Hierarchien und Querverweise erlauben außerdem, zwischen einer genauen Szene und verwandten, weiter gefassten Themen zu wechseln.

Auf die Frage, wie man erkennt, ob ein Konzept bereits vorhanden ist, verweist Posthumus auf das Nachschlagen im bestehenden System. Gemeinsame Kennungen setzen somit auch die Nutzung und Prüfung vorhandener Verzeichnisse voraus.

Ausblick und Empfehlungen

Die Datensuche zeigt zum Zeitpunkt des Vortrags vor allem Vorschaubilder und Tabellen. Auf Nachfrage erklärt Posthumus, dass an weiterführenden Visualisierungen gearbeitet wird. Geplant sind Netzwerkdiagramme, Karten, Flussdiagramme und Zeitreihen. Diese bezeichnet er ausdrücklich als nächsten Entwicklungsschritt, nicht als bereits fertige Funktionen.

Als konkrete Anregungen gibt er dem Publikum mit:

  • Wikidata selbst anzusehen und seine strukturierten Daten zu erkunden.
  • Bei Interesse den verlinkten RDF-Kurs von Professor Harald Sack zu nutzen.
  • Zeit in Python zu investieren, um wiederkehrende Datenarbeiten zu vereinfachen.
  • Präsentationen, technische Berichte und Hintergrundmaterialien auf Zenodo sowie Leitlinien und Veröffentlichungen auf der NFDI4Culture-Website nachzulesen.

Die Schlussdiskussion unterstreicht damit den Stand des Vorhabens: Die gemeinsame Datenbasis ist aufgebaut; verständliche Suchzugänge und zusätzliche Visualisierungen sollen ihren Nutzen weiter erschließen.

Cookies helfen uns bei der Bereitstellung von GfWM Wiki. Durch die Nutzung von GfWM Wiki erklärst du dich damit einverstanden, dass wir Cookies speichern.