Zurück zum Chat

Datenschutzerklärung

1. Verantwortliche Stelle

Verantwortlich für den Betrieb dieses Angebots ist: Leonhard Hucho, Wörther Straße 7, 10435 Berlin, E-Mail: leonhard.hucho@web.de.

Diese Datenschutzerklärung beschreibt die Datenverarbeitung beim Ersti Chat, einem Chatbot für Fragen rund um das Studium und den Studienstart an der HU-WiWi. Der Ersti Chat ist keine offizielle Beratungsstelle der Humboldt-Universität zu Berlin.

2. Funktionsweise und Zwecke

Der Ersti Chat beantwortet Fragen mithilfe einer auf dem Anwendungsserver gespeicherten Wissensbasis. Ohne konfiguriertes Sprachmodell wird die Antwort direkt aus dieser Wissensbasis gebildet. In diesem Betriebsmodus werden keine Chatnachrichten an einen externen Sprachmodell-Endpunkt gesendet.

Ist ein Sprachmodell aktiviert, sendet der Anwendungsserver einen begrenzten Gesprächsausschnitt und passende Wissensbausteine an einen OpenAI-kompatiblen Chat-Completions-Endpunkt. Die aktuelle Beispiel- und Deployment-Konfiguration sieht dafür den HU-LLM-Endpunkt des Computer- und Medienservice der HU vor. „OpenAI-kompatibel“ bezeichnet hier das technische API-Format und bedeutet nicht, dass Daten an OpenAI übermittelt werden.

3. Verarbeitete Daten

Beim Aufruf und bei der Nutzung können insbesondere folgende Daten verarbeitet werden:

Bitte gib keine sensiblen personenbezogenen Daten in den Chat ein, zum Beispiel Matrikelnummern, Gesundheitsdaten, private Kontaktdaten oder vertrauliche Unterlagen. Der Dienst ist nicht für die Verarbeitung solcher Angaben vorgesehen. Wenn du sie trotzdem in eine Nachricht schreibst, werden sie technisch wie der übrige Nachrichteninhalt verarbeitet und vorübergehend protokolliert.

4. Keine Accounts, keine Cookies, kein Werbe-Tracking

Der Ersti Chat bietet keine Nutzerkonten an und setzt keine Cookies und kein Werbe-Tracking durch Dritte ein.

Im sessionStorage des Browsers wird eine zufällige, kryptografisch erzeugte, pseudonyme Sitzungs-Kennung gespeichert. Sie enthält unmittelbar weder Namen noch Kontaktdaten. Die Kennung wird mit Chat- und Nutzungsdauer-Anfragen an den Anwendungsserver gesendet. So werden Gesprächskontexte getrennt und Nachrichten sowie Nutzungsdauer derselben Sitzung zugeordnet. Sie gilt nur für den aktuellen Tab, wird beim Start eines „Neuen Chats“ ersetzt und beim Schließen des Tabs vom Browser normalerweise gelöscht. Funktionen zur Wiederherstellung geschlossener Tabs können dieses Verhalten je nach Browser beeinflussen.

Der sichtbare Chatverlauf wird nicht im Browser gespeichert. Er liegt nur im Arbeitsspeicher der geöffneten Seite. Beim Neuladen oder mit „Neuer Chat“ verschwindet er aus der Oberfläche. Bereits übermittelte Servereinträge werden dadurch nicht sofort gelöscht, sondern nach der in Abschnitt 9 beschriebenen Frist entfernt.

Im localStorage merkt sich der Browser unter der Kennung tobyIntroduced lediglich, ob die kurze Toby-Einführung bereits angezeigt wurde. Dieser Komforteintrag enthält keine Sitzungskennung und keine Chatnachrichten, wird nicht an den Server übermittelt und bleibt grundsätzlich bis zum Löschen der Website-Daten im Browser gespeichert. Browser-Einstellungen, privates Surfen oder eine automatische Speicherbereinigung können ihn bereits vorher entfernen.

5. Nachrichten-Protokoll, Sitzungen und Rate-Limit

Der Anwendungsserver verarbeitet deine Nachricht, um passende Wissensbausteine zu suchen und eine Antwort zu erzeugen. Erfolgreich abgeschlossene Gespräche werden zur Qualitätssicherung und Verbesserung des Angebots vorübergehend in einem Nachrichten-Protokoll gespeichert. Ein Eintrag enthält den Nachrichteninhalt, einen Zeitstempel, die Rolle als Frage oder Antwort und die zufällige Sitzungs-Kennung.

IP-Adressen werden weder in diesem Nachrichten-Protokoll noch in der Sitzungsstatistik gespeichert. Davon zu unterscheiden sind technisch mögliche Verbindungs- und Zugriffsprotokolle des Reverse-Proxys, des Betriebssystems oder des Hostinganbieters, die in Abschnitt 7 und 9 beschrieben werden.

Je Sitzung speichert der Server den ersten und letzten erfassten Zeitpunkt, die Anzahl der Fragen und die aktive Nutzungsdauer. Als aktive Nutzungsdauer zählt die Zeit, in der die Seite geöffnet und sichtbar ist. Die daraus bereitgestellte Statistik enthält nur zusammengefasste Werte wie Sitzungszahl, durchschnittliche Nutzungsdauer und Gesamtzahl der Fragen. Ihr Abruf ist im Produktivbetrieb geschützt.

Zum Schutz vor Missbrauch und Überlastung führt die Anwendung allgemeine und LLM-bezogene Anfragezähler pro IP-Adresse. IP-Adresse, Zeitfenster und Anfragezahl liegen nur im Arbeitsspeicher des Serverprozesses. Sie werden nicht in der Anwendungsdatenbank oder im Nachrichten-Protokoll gespeichert und fallen spätestens beim Neustart des Serverprozesses weg. Die Zähler dienen nicht der Werbung oder der Bildung von Nutzerprofilen.

6. Einsatz eines Sprachmodells

Wenn das Sprachmodell aktiviert ist, werden die aktuelle Frage, ein begrenzter Ausschnitt der zuletzt serverseitig protokollierten Unterhaltung, relevante Wissensbausteine und Systemanweisungen an den konfigurierten LLM-Endpunkt gesendet. Die aktuelle Konfiguration sieht den OpenAI-kompatiblen HU-LLM-Endpunkt vor. Die Anwendung fügt die Sitzungs-Kennung und die Client-IP-Adresse nicht als eigene Felder oder Metadaten in den LLM-Anfrageinhalt ein. Angaben, die Nutzende selbst in eine Nachricht schreiben, bleiben dagegen Teil des Nachrichteninhalts. Der LLM-Endpunkt erhält technisch außerdem Verbindungsdaten des Anwendungsservers oder des vorgeschalteten VPN-Proxys.

Falls der HU-Endpunkt nur aus dem HU-Netz erreichbar ist, kann die Deployment-Konfiguration ausschließlich den LLM-Verkehr durch einen HU-VPN-Proxy leiten. Der übrige Webverkehr erhält dadurch keine globale VPN-Route. Welche technischen Protokolle der jeweils konfigurierte LLM-Betreiber führt und wie lange er diese aufbewahrt, wird nicht durch den Code des Ersti Chats bestimmt.

Eine automatisierte Entscheidung mit rechtlicher Wirkung oder vergleichbar erheblicher Beeinträchtigung findet nicht statt. Die Antworten dienen nur der allgemeinen Studieninformation. Wird ein anderer LLM-Anbieter konfiguriert, müssen Empfänger, Speicherpraxis und mögliche Drittlandübermittlungen vor dem Einsatz neu geprüft und diese Erklärung angepasst werden.

7. Hosting und technische Dienstleister

Der in der aktuellen Deployment-Konfiguration eingetragene Anwendungsserver wird bei Hetzner Online GmbH am Standort Helsinki, Finnland betrieben. Finnland ist Mitglied der Europäischen Union. Hetzner führt Helsinki als Standort hel1; eine Übersicht stellt Hetzner in der Dokumentation der Cloud-Standorte bereit.

Die Anwendung läuft dort in Docker. Das dauerhafte Datenverzeichnis für Nachrichten und Sitzungsstatistik ist als Server-Volume eingebunden und bleibt daher bei Software-Aktualisierungen erhalten. Ein Nginx-Reverse-Proxy nimmt die öffentlichen Webanfragen entgegen. Beim Hosting und bei der Übertragung können Hetzner sowie beteiligte Netzbetreiber technisch notwendige Verbindungs- und Betriebsdaten verarbeiten.

Der Anwendungscode legt keine Speicherdauer für Nginx-, Betriebssystem- oder Hoster-Protokolle fest. Je nach tatsächlich eingesetzter Server- und Anbieter-Konfiguration können solche Sicherheits- und Zugriffsprotokolle insbesondere IP-Adresse, Zeitpunkt, Anfragepfad, Statuscode und Browserangaben enthalten. Bei einem Wechsel von Hoster oder Serverstandort ist dieser Abschnitt vor dem Einsatz zu aktualisieren.

Für aufgelockerte Smalltalk-Antworten ruft der Anwendungsserver zusätzlich in Intervallen das aktuelle Berliner Wetter beim Wetterdienst Open-Meteo (open-meteo.com) ab. Diese Abfrage erfolgt ausschließlich serverseitig mit festen Berlin-Koordinaten und ohne API-Schlüssel; Chatinhalte, Sitzungs-Kennungen oder IP-Adressen der Nutzerinnen und Nutzer werden dabei nicht übermittelt.

8. Rechtsgrundlagen

Soweit personenbezogene Daten verarbeitet werden, stützt sich die Verarbeitung grundsätzlich auf Art. 6 Abs. 1 lit. f DSGVO. Die berechtigten Interessen liegen im Betrieb eines niedrigschwelligen Informationsangebots, in der Beantwortung freiwillig eingegebener Fragen, in der begrenzten Qualitätssicherung und Nutzungsstatistik sowie in Betriebssicherheit und Missbrauchsverhinderung. Die kurze Speicherdauer, die pseudonyme Sitzungs-Kennung und der Verzicht auf Werbe-Tracking begrenzen die Eingriffe in die Rechte der Nutzenden.

Die Sitzungs-Kennung im sessionStorage ist erforderlich, um den ausdrücklich aufgerufenen Chat-Kontext bereitzustellen und Sitzungen voneinander zu trennen. Soweit § 25 TDDDG auf diese Speicherung und den Zugriff im Endgerät anwendbar ist, wird hierfür § 25 Abs. 2 Nr. 2 TDDDG herangezogen. Der reine lokale Komforteintrag zur Toby-Einführung löst keine zusätzliche serverseitige Verarbeitung personenbezogener Daten aus.

9. Speicherdauer

Das Nachrichten-Protokoll (Chatinhalte, Zeitstempel, zufällige Sitzungs-Kennung) und die Nutzungsdauer-Statistik werden auf dem Server gespeichert und bleiben auch über Software-Aktualisierungen hinweg erhalten. In der aktuellen Konfiguration werden Einträge, die älter als 7 Tage sind, automatisch gelöscht. Die Bereinigung läuft beim Start der Anwendung und anschließend ungefähr alle sechs Stunden. Eine Löschung erfolgt daher regelmäßig kurz nach Ablauf der Sieben-Tage-Frist. Zusätzlich können Daten auf Anfrage gelöscht werden (siehe Abschnitt 11). Anhand der zufälligen Sitzungs-Kennung allein ist eine Zuordnung zu einer bestimmten Person in der Regel nicht möglich. Wenn eine Nachricht selbst Namen, Kontaktdaten oder andere identifizierende Angaben enthält, kann ihr Inhalt trotzdem personenbezogen sein.

„Neuer Chat“ löscht die sichtbaren Nachrichten und ersetzt die Sitzungs-Kennung, löscht aber bereits protokollierte Nachrichten nicht sofort. Die Sitzungkennung im sessionStorage endet mit dem Tab. Der localStorage-Eintrag zur Toby-Einführung bleibt bis zum Löschen der Website-Daten im Browser bestehen.

Für die Container-Logs sieht die Compose-Konfiguration eine größenbasierte Rotation mit maximal drei Dateien zu je 10 MB pro Dienst vor. Die Node-Anwendung schreibt dort Start-, Status- und Fehlermeldungen und fügt diesen nicht gezielt Client-IP-Adressen hinzu. Für mögliche Nginx-, Betriebssystem- und Hoster-Protokolle gilt die tatsächlich aktive Konfiguration des Servers beziehungsweise des Anbieters; aus dem Anwendungscode lässt sich dafür keine feste Aufbewahrungsfrist ableiten.

10. Empfänger und Drittlandübermittlungen

Zugriff auf personenbezogene Daten können der Verantwortliche und, soweit dies für den Betrieb erforderlich ist, technische Dienstleister erhalten. Dazu gehören insbesondere Hetzner als Hostinganbieter und bei aktiviertem Sprachmodell der konfigurierte HU-LLM-Endpunkt.

Der Anwendungsserver steht in Finnland und damit innerhalb der EU. Für die in der Projektkonfiguration vorgesehenen Dienste ist keine Übermittlung in ein Drittland außerhalb des Europäischen Wirtschaftsraums dokumentiert. Sollte künftig ein Hoster, Sprachmodell oder sonstiger Empfänger außerhalb des EWR eingesetzt werden, werden die Voraussetzungen der Art. 44 ff. DSGVO, geeignete Garantien und die damit verbundenen Risiken vorab geprüft und hier beschrieben.

11. Deine Rechte

Du hast nach Maßgabe der jeweiligen gesetzlichen Voraussetzungen insbesondere Rechte auf Auskunft, Berichtigung, Löschung und Einschränkung der Verarbeitung. Ein Recht auf Datenübertragbarkeit besteht nur in den gesetzlich vorgesehenen Fällen. Gegen eine Verarbeitung auf Grundlage berechtigter Interessen kannst du aus Gründen, die sich aus deiner besonderen Situation ergeben, Widerspruch einlegen. Außerdem hast du das Recht, dich bei einer Datenschutzaufsichtsbehörde zu beschweren.

Anfragen kannst du an die in Abschnitt 1 genannte E-Mail-Adresse richten. Weil keine Nutzerkonten geführt und IP-Adressen nicht mit dem Nachrichten-Protokoll verknüpft werden, kann für eine gezielte Auskunft oder Löschung eine möglichst genaue Angabe zu Zeitpunkt und Inhalt der Nachricht sowie, falls noch vorhanden, die Sitzungs-Kennung erforderlich sein. Eine zusätzliche Identitätszuordnung wird nicht allein für spätere Anfragen angelegt.

Für Angebote mit Bezug zu Berlin kommt insbesondere die Berliner Beauftragte für Datenschutz und Informationsfreiheit in Betracht: https://www.datenschutz-berlin.de/.

12. Änderungen

Diese Datenschutzerklärung wird angepasst, wenn sich Betrieb, Serverstandort, Hosting, LLM-Anbieter, Protokollierung, Speicherdauer oder andere relevante Datenflüsse ändern. Maßgeblich ist die hier angegebene Fassung zum Zeitpunkt der Nutzung.