Ontologia i bazy grafowe w AI: co jest potrzebne MŚP?
Temat: Ontologia firmy
Ontologia i baza grafowa rozwiązują różne problemy. Ontologia ustala znaczenie pojęć i relacji, graf przedstawia konkretne obiekty oraz ich powiązania, a baza grafowa może ten graf przechowywać i odpytywać. Polska firma MŚP nie musi kupować bazy grafowej, by uporządkować dane dla AI. Warto ją sprawdzić wtedy, gdy pytania wielokrotnie przechodzą przez zmienną sieć relacji i zwykłe widoki lub zapytania stają się trudne do utrzymania.
To tekst o wyborze sposobu realizacji. Podstawowe terminy wyjaśnia przewodnik po ontologii i taksonomii, a przejście od istniejących tabel opisuje artykuł o ERD i ontologii. Szerszą rolę danych w firmie pokazuje filar Dane i wiedza firmy.
Jakie pytanie naprawdę wymaga grafu?
Wyobraźmy sobie hipotetyczną firmę serwisującą urządzenia. Klient ma kilka lokalizacji, każda lokalizacja ma urządzenia, te mają części, a części pochodzą od różnych dostawców. Po informacji o wadliwej partii firma musi znaleźć wszystkie urządzenia, których dotyczy partia, aktywne umowy i właściwe osoby do powiadomienia. To pytanie o ścieżki między obiektami, nie tylko o sumę w tabeli.
Model pojęciowy definiuje, co oznaczają „partia”, „zamontowano w”, „objęty umową” i „aktywny kontakt”. Graf instancji zapisuje konkretną partię P17, urządzenie U42 i umowę S9 wraz z relacjami. Zapytanie przechodzi po tych relacjach. Wynik powinien wskazywać nie tylko klienta, lecz także ścieżkę dowodową: P17 → część C8 → U42 → lokalizacja L3 → umowa S9. Jeśli którejś relacji brakuje albo ma nieznaną aktualność, odpowiedź powinna to ujawnić.
Graf może pomóc także w analizie zależności dostaw, uprawnień czy wpływu zmiany procesu. Nie oznacza to, że model AI automatycznie rozumie firmę. Potrzebne są dobre identyfikatory, wiarygodne źródła, polityka dostępu i test odpowiedzi. Inspiracją do takiego rozdzielenia ontologii od grafu są część teoretyczna i część wdrożeniowa serii NebulaGraph, opublikowane w maju 2026 r. To materiały dostawcy bazy, dlatego ich tezę, że graf jest naturalnym wyborem, trzeba sprawdzić na własnym zadaniu.
Czy graf wiedzy oznacza bazę grafową?
Nie zawsze. Graf wiedzy to sposób przedstawienia konkretnych faktów i relacji z określonym znaczeniem. Można go zbudować na RDF, w bazie grafowej typu property graph, w bazie relacyjnej albo jako ograniczony zestaw struktur w aplikacji. Ważniejsze od etykiety produktu jest to, czy da się odpowiedzieć na potrzebne pytania z właściwymi uprawnieniami i pochodzeniem danych.
RDF opisuje fakty jako trójki i korzysta m.in. z SPARQL. Property graph używa węzłów oraz krawędzi z właściwościami i zwykle własnego języka zapytań. Ontologia nie jest synonimem żadnego z tych magazynów. W podejściu RDF można formalnie opisać pojęcia w OWL 2 i walidować dane przez SHACL. W property graph można utrzymywać uzgodniony schemat i reguły w kodzie lub metadanych. Żaden silnik nie zastąpi uzgodnienia, co naprawdę oznacza relacja „obsługuje”.
Microsoft, open source czy obecna baza?
| Wariant | Kiedy go rozważyć | Co sprawdzić w pilocie |
|---|---|---|
| Obecny SQL i widoki | Kilka stabilnych relacji, znane pytania, mały zespół | Złożoność zapytań, aktualność danych, testy definicji |
| Ontology w Microsoft Fabric IQ | Organizacja już pracuje z danymi w OneLake i potrzebuje wspólnego modelu pojęć oraz grafu | Stan preview, odświeżanie grafu, uprawnienia, koszt i zależności od Fabric |
| Azure Cosmos DB for Apache Gremlin | Potrzebny jest zarządzany graf relacji w Azure | Model zapytań, partycjonowanie, opóźnienie, koszt i kontrola dostępu |
| Apache AGE z PostgreSQL | Zespół zna PostgreSQL i chce zbadać property graph | Zgodność wersji, kopie zapasowe, zapytania, utrzymanie rozszerzenia |
| Apache Jena z TDB2 | Potrzebne są RDF, SPARQL i przenośne standardy semantyczne | Walidacja, publikacja zapytań, wydajność i model uprawnień |
To warianty architektoniczne, nie ranking produktów ani lista identycznych funkcji. Microsoft Fabric IQ Ontology był we wrześniu 2026 r. w wersji preview. Jego dokumentacja opisuje wiązanie pojęć z danymi OneLake i graf instancji, ale wymaga sprawdzenia ograniczeń odświeżania. Cosmos DB for Gremlin jest bazą grafową; sam z siebie nie wprowadza firmowej ontologii ani reguł decyzji. Otwarte narzędzia również wymagają operatora, kopii zapasowej i kontroli dostępu. Na blogu opisuję osobno Apache AGE, Apache Jena TDB2 i OWL 2, RDF oraz SHACL.
Gdzie graf pomaga agentowi AI, a gdzie nie?
Agent może wykorzystać graf do odnalezienia powiązań, których nie znajdzie łatwo po pojedynczym słowie w dokumencie. Przed odpowiedzią „których klientów dotyczy partia P17?” aplikacja przechodzi po relacjach i podaje ścieżkę. Model językowy może następnie wyjaśnić wynik zwykłym językiem. To aplikacja egzekwuje zapytanie i uprawnienia; nie należy prosić modelu, by z pamięci odtworzył fakty o urządzeniach.
Graf nie usuwa błędów źródła. Jeśli identyfikator części został źle przypisany albo dostawa jest sprzed dwóch tygodni, agent poda spójną, lecz błędną ścieżkę. Wymagaj daty aktualizacji, właściciela relacji i widocznego braku danych. Osoba mająca dostęp do informacji o urządzeniu nie musi mieć dostępu do marży klienta. Politykę dostępu trzeba sprawdzić dla każdego etapu pobrania i prezentacji danych, a nie wyłącznie dla końcowego tekstu odpowiedzi.
Mały test dla MŚP przed wyborem technologii
- Wybierz jedno pytanie o relacje, które dziś wymaga ręcznego uzgadniania co najmniej dwóch źródeł.
- Zdefiniuj pięć do dziesięciu typów obiektów i relacji oraz ich właścicieli. Nie zaczynaj od całego przedsiębiorstwa.
- Zbuduj próbkę z prawdziwymi wyjątkami: duplikat, brak powiązania, wycofana część, nieaktualna umowa.
- Porównaj tę samą odpowiedź w obecnym SQL i w wybranym wariancie grafowym. Zmierz poprawność, czas odpowiedzi i nakład utrzymania.
- Sprawdź, czy użytkownik bez uprawnienia nie zobaczy ani rekordu, ani jego nazwy w ścieżce.
- Policz pełen koszt: integracja, odświeżanie, infrastruktura, kopie zapasowe, testy i osoba utrzymująca model.
Jeśli SQL daje czytelne odpowiedzi przy akceptowalnym koszcie, nie ma powodu dodawać bazy grafowej. Jeśli trudność leży w różnych znaczeniach tych samych danych, zacznij od ontologii i mapowania źródeł, zanim porównasz silniki. Zakres takiego rozpoznania znajduje się na stronie współpracy; decyzja o platformie powinna wynikać z pomiaru, nie z obietnicy „AI-ready”.
- Dane i analityka
- Agenci AI
- Open source

