Um Unternehmensinformationen von einer Website zuverlässig zu extrahieren, lege die Felder fest, die du benötigst, sammle die relevanten Seiten, halte jede Tatsache mit ihrer Quelle fest und prüfe zeitkritische Details, bevor du das Ergebnis verwendest.
Ziel ist strukturierte Daten – kein umgeschriebenes Firmenprofil. Ein gutes Extraktions-Workflow erklärt dir, was die Website aussagt, wo sie es aussagt, wann die Informationen veröffentlicht wurden und welche Felder weiterhin unbekannt bleiben.
Zuerst das Ausgabeschema definieren
Ohne ein Schema neigen manuelle Recherchen und KI-Tools dazu, alles zu sammeln, was interessant aussieht. Entscheide, was das Ziel benötigt, bevor du die Website besuchst.
Ein grundlegender Datensatz zu einem Unternehmen kann Folgendes enthalten:
| Feld | Beispielwert | Wahrscheinliche Quelle |
|---|---|---|
| Offizieller Name | Northline Systems, Inc. | Footer, Recht-Seite |
| Website | northline.example | Aktuelle URL |
| Beschreibung | Workflow-Software für Field-Teams | Startseite, Über uns |
| Branche | Field-Service-Software | Produktseiten |
| Produkte/Dienstleistungen | Dispatch, Terminplanung, Reporting | Produkts-Navigation |
| Zielgruppe | Regionale Servicebetreiber | Solutions-Seiten |
| Hauptsitz | Denver, Colorado | Kontakt, Über uns |
| Gegründet | 2018 | Über uns, Press Kit |
| Führungsteam | Namen und aktuelle Titel | Leadership-Seite |
| Kontakt | Öffentliche Teamadresse | Kontaktseite |
| Zuletzt geprüft | 24. September 2026 | Forschungsnotiz |
Für Vertriebsrecherchen könntest du öffentliche Initiativen, Einstellungsindikatoren und aktuelle Ankündigungen ergänzen. Für ein Verzeichnis können Kategorie-, Standort- und Kontaktfelder bereits ausreichen. Vermeide es, persönliche oder sensible Daten zu sammeln, die der Anwendungsfall nicht erfordert.
Kartiere die Seiten, die hilfreiche Fakten enthalten
Die Startseite enthält selten alles. Prüfe die Hauptnavigation und sammle Seiten mit klaren Rollen:
- Über uns: Identität, Historie, Mission, Standorte;
- Produkt- oder Serviceseiten: Angebote, Funktionen und Anwendungsfälle;
- Solutions oder Branchen: Zielgruppe und Marktschwerpunkt;
- Leadership: Namen und Titel;
- Newsroom oder Press Kit: Daten, Meilensteine, freigegebene Beschreibungen;
- Karriere: Sprache im Team und öffentliche Informationen zur Einstellung;
- Kontakt und Footer: Adresse, rechtlicher Name und öffentliche Kanäle;
- AGB oder Datenschutzseiten: verantwortliche Einheit und Rechtsgebiet.
Wenn eine Seite hinter einem Login liegt, blockiert oder entfernt wurde, markiere sie als nicht verfügbar. Leite den Inhalt nicht aus einem Suchsnippet ab.
Behauptungen mit Herkunft extrahieren
Für jede wesentliche Tatsache speichere:
- den Feldnamen;
- den extrahierten Wert;
- die exakte Quell-URL;
- den Seitentitel oder den Abschnitt;
- das auf der Seite angezeigte Datum, falls vorhanden;
- das Datum, an dem du sie aufgerufen hast; und
- eine Konfidenz- oder Prüfungs-ID.
So wird aus einer Ansammlung kopierten Textes prüfbare Information. Das macht Updates außerdem einfacher: Wenn sich ein Leiter ändert oder ein Produkt umbenannt wird, weißt du, welche Quelle du erneut prüfen musst.
Halte direkte Aussagen der Website getrennt von deiner Klassifizierung. Eine Website kann sich beispielsweise als „eine Betriebsplattform für mobile Teams“ beschreiben. Die Zuordnung dieses Ausdrucks zu einer Datenbankkategorie wie „Field-Service-Management-Software“ ist eine Interpretation und sollte als solche gekennzeichnet werden.
Widersprüchliche Informationen auflösen
Unternehmenswebsites enthalten häufig Widersprüche. Eine Pressemitteilung könnte eine alte Mitarbeiterzahl verwenden, eine regionale Kontaktseite zeigt vielleicht ein lokales Büro als Hauptsitz, oder das Bio eines Leiters bleibt nach einer Rollenänderung bestehen.
Nutze diese Regeln:
- ziehe zuerst die aktuellste Quelle der eigenen Website vor, wenn sich Fakten ändern;
- bevorzuge Rechts- oder Kontaktseiten für die verantwortliche Einheit und die Adresse;
- hänge Daten an Kennzahlen;
- erfasse bei nicht auflösbaren Konflikten beide Werte;
- markiere das Feld für eine menschliche Prüfung, statt die bequemere Antwort auszuwählen.
Externe autoritative Quellen können helfen, öffentliche Einreichungen oder die rechtliche Identität zu bestätigen, aber mische sie nicht stillschweigend in „aus der Website extrahierte“ Daten ein. Bewahre die Art der Quelle.
KI für die Extraktion nutzen – nicht für Erfindungen
KI ist hilfreich, wenn Seiten lang sind oder dieselben Felder über mehrere URLs hinweg gesammelt werden müssen. Gib dem Modell ein striktes Schema vor und fordere Nullwerte für fehlende Informationen.
Versuche eine Aufforderung wie:
Extrahiere nur Informationen, die explizit in den bereitgestellten Webseiten angegeben sind. Gib eine Tabelle mit Feld, Wert, Quell-URL, Seiten-Datum und Prüfnotiz zurück. Verwende „nicht gefunden“, wenn ein Feld fehlt. Leite weder den Hauptsitz, das Gründungsjahr, die Mitarbeiterzahl, Kunden, Umsatz noch die Marktposition ab.
iWeaver’s AI Website Summarizer kann helfen, öffentliche Webseiten zu komprimieren, während der Company Research Generator mehrere Unternehmensquellen in strukturiertes Research organisieren kann. Vergleiche immer wichtige Felder mit der ursprünglichen Seite.
Beispiel für eine durchgeführte Extraktion
Angenommen, die Startseite eines Softwareunternehmens sagt, es helfe „unabhängigen Kliniken, Patientenkommunikation zu koordinieren“. Die Produktseite nennt Termin-Erinnerungen und Message Routing. Die Über-uns-Seite führt Boston als seinen Standort an, während eine zwei Jahre alte Ankündigung New York als Hauptsitz bezeichnet.
Die korrekte Extraktion ist nicht, Boston ohne Kommentar zu übernehmen. Halte Boston aus der aktuellen Über-uns-Seite fest, behalte den älteren New-York-Wert als Konflikthinweis bei und markiere den Hauptsitz zur Bestätigung. Die Produktliste kann wie angegeben erfasst werden. „Healthcare SaaS“ kann eine nützliche Kategorie sein, sollte aber als vom Research zugewiesene Klassifizierung gekennzeichnet werden – nicht als direkte Zitierung.
Daten bereinigen und normalisieren
Standardisiere nach der Extraktion Groß-/Kleinschreibung, Ländernamen, Telefonformate und Kategorienkennzeichnungen, ohne die Bedeutung zu ändern. Dubliere Produktnamen, die in Navigation und Fließtext vorkommen, einmalig (Deduplicieren). Bewahre den Rohwert neben dem normalisierten Wert auf, wenn die Daten in ein CRM oder eine Datenbank übernommen werden.
Führe einfache Validierungen durch: erforderliche Felder vorhanden, URLs gültig, Daten in einem Format, ein Wert pro Feld, wenn erwartet, und keine nicht unterstützten Zahlen. Bei einem wiederkehrenden Projekt vergleiche die neue Extraktion mit der vorherigen Version, damit Änderungen geprüft werden.
Extraktion ist nur die erste Stufe
Strukturierte Website-Daten können ein Verzeichnis-Record, ein Account-Brief, ein Factsheet oder einen Schreib-Workflow speisen. Wenn die nächste Aufgabe darin besteht, verifizierte Inputs in lesbaren Unternehmensinhalt zu verwandeln, siehe was ein Company-Information-Generator macht.
Überspringe nicht die Grenze zwischen diesen Stufen. Extraktion fragt: „Was sagt die Quelle?“ Content-Generierung fragt: „Wie sollen die genehmigten Fakten für dieses Publikum präsentiert werden?“ Wenn du sie getrennt hältst, werden beide Ausgaben zuverlässiger.
Die beste Extraktion ist nicht die längste. Sie ist ein nachverfolgbares Datenset mit klaren Lücken, datierten Belegen und genug Struktur für eine Person – oder ein anderes System –, um es zu nutzen, ohne zu raten, woher die Fakten stammen.

