Die ersten Webcrawler!
Das Netzwerk hat seine ersten kleinen Agenten. Kleine KI-Webcrawler durchsuchen ausgewählte Webseiten, ziehen die Inhalte heraus und lassen sie von einem lokalen Sprachmodell zusammenfassen.
Erledigt
- Ersten Crawler geschrieben: [Hauptsächlich Python, benutzt nur wenig KI-Modell Weight]
- RSS-Feeds und Websitequellen festgelegt, die regelmäßig abgefragt werden
- Anbindung an den lokalen KI-Server: Das Modell fasst jeden neuen Artikel in drei Sätzen zusammen
- Ergebnisse landen gesammelt auf einem lokalen Server
- Erster Durchlauf: 54 Seiten gelesen, 16 Zusammenfassungen erstellt
Offen
- Doppelte Meldungen zuverlässig erkennen
- Zeitplan einrichten, damit die Crawler automatisch laufen
- Mehrere Crawler als Agenten zusammenarbeiten lassen
- Qualität der Zusammenfassungen systematisch prüfen
Notiz
Das Abrufen der Webseiten war schnell gelöst. Die eigentliche Arbeit steckt im Aufräumen: Menüs, Werbung und Cookie-Hinweise müssen raus, bevor das Modell den Text sinnvoll zusammenfassen kann.
Ebenso wichtig ist ein klar abgestecktes Aufgabenfeld. Unsere Bots beachten die robots.txt jeder Seite, legen Pausen zwischen den Abrufen ein und fragen nur öffentlich zugängliche Inhalte ab. Wer ein Netzwerk aufbaut, sollte anderen nicht das eigene lahmlegen.
Die Crawler sind der zweite Knoten im Netzwerk, direkt verbunden mit unserem lokalen Server. Aus ihren Funden entstehen künftig die Beiträge für die Felder Finanzen und Innenpolitik, natürlich immer geprüft, bevor sie erscheinen.