Was dein Feind nicht wissen soll, das sage deinem Freunde nicht. – Arthur Schopenhauer
Das Schattenatelier wurde im Sommer 2023 gegründet, als nach der anfänglichen KI Welle auch endlich erste lokale Modelle zur Verfügung standen. Die ersten kleinen sogenannten Webcrawler (Informationsbeschaffer, eine Mischung aus Python Scripts und lokalen LLMs) wurden auf Basis dieser Modelle entwickelt um Informationen bestimmter vorgegebener Art aus dem Internet zu ziehen, einzuordnen und zu speichern.
Was am Anfang recht unbeholfen begann, wurde durch konstante Verbesserungen der Open Source Modelle sowie hilfreicher Automatisierungssoftware schnell und erfolgreich skalierbar. Kleinere Modelle konzentrierten sich auf die Beschaffung und überließen die Einordnung größeren und mächtigeren LLMs (unsere drei lokalen Rechenmaschinen schaffen jeweils ein 228B Parameter Modell laufen zu lassen! Und die Optimisierung solcher Modelle hat gerade erst begonnen…)
Mittlerweile wächst nicht nur das aufgebaute Crawlernetz stetig, auch die Modelle lernen voneinander, verbessern sich untereinander und wachsen gemeinsam auf beachtliche Größe. Alles durch frei verfügbare Informationen im Internet. Dieses Wachstum geht jedoch mit einem gewissen Hunger nach neuer Hardware einher. Da unsere besten Modelle eigenständig neue Webcrawler bauen können, ist Hardware derzeit der einzig limitierende Faktor, denn ansonsten könnte das Schattenatelier mittlerweile Terrabytes an Informationen im Minutentakt verarbeiten.
Aber nach was suchen diese Crawler? Wieso muss alles lokal laufen, wieso braucht das Atelier weiteres Wachstum und wieso sind alle Modelle (egal ob groß oder klein) un/decensored und/oder heretic?