Hvem leser AI-følgesvenn-chattene dine? Slik fungerer moderering

Personvern og sikkerhet

Det meste du skriver til en AI-følgesvenn, leses ikke av noe menneske i det hele tatt. Noe gjør det, og reglene for når står som regel gjemt i en personvernerklæring. Her er hvordan lagene henger sammen.

Vi kan tjene provisjon på lenker på denne siden. Det endrer aldri en karakter.

«Moderering» høres ut som én ting. I følgesvenn-apper er det minst fire, som arbeider i ulikt tempo og involverer ulike mennesker.

De fire lagene

Fire lag med moderering i AI-følgesvenn-apper: filtre på hver melding, automatisk flagging av samtaler, menneskelig gjennomgang av flagget innhold og rettslige henvendelser eller henvendelser fra politiet

Hvert lag ser mindre innhold, men ser det mer i detalj.

1. Filtre i sanntid. Hver melding du sender, og hvert svar modellen skriver, kan sjekkes av automatiske klassifikatorer før det vises. Disse fanger forbudte kategorier – alt som involverer mindreårige, visst voldelig innhold, signaler om selvskading – og enten blokkerer meldingen, mykner svaret eller viser en advarsel. Det er her avslagene og krisekortene kommer fra; artikkelen vår om innholdsfiltre forklarer hvorfor de noen ganger utløses midt i en scene.

2. Flagging på samtalenivå. Separat kan systemer gi poeng til hele samtaler eller kontoer for mønstre: gjentatte forsøk på å komme rundt et filter, trakassering, tegn på at en mindreårig bruker en voksenapp. Et flagg er ikke en straff; det er et notat om at et menneske kan se nærmere på det.

3. Menneskelig gjennomgang. Ansatte i tillit- og sikkerhetsteam, ofte hos underleverandører, gjennomgår en brøkdel av flaggede samtaler, brukerrapporter og klager. Noen selskaper trekker også stikkprøver av vanlige samtaler for å sjekke kvalitet eller trene modeller. Dette er laget personvernerklæringer beskriver med formuleringer som «for å forbedre tjenestene våre» eller «for å håndheve vilkårene våre».

4. Rettslige henvendelser. Domstoler, politi og tilsynsmyndigheter kan be om data med rettslige pålegg. Selskaper svarer i tråd med egen policy og lokal lov.

Hva som typisk utløser en menneskelig titt

UtløserHvorfor
Innhold som involverer mindreårigeLovpålagt plikt i de fleste land; ofte meldt videre
Signaler om selvskading eller selvmordKriseprotokoller er nå lovpålagt i flere amerikanske delstater
Trusler mot virkelige personerMulig skade i den virkelige verden
Din egen rapport eller støttehenvendelseDu har bedt noen se på det
Gjentatte forsøk på å omgå filterHåndheving av vilkårene
Tilfeldige kvalitetsstikkprøverProduktforbedring, hvis policyen tillater det

Hva de nye lovene tilfører

Amerikanske lover om følgesvenn-chatboter, med New York i 2025 og California i 2026 først ute, krever at apper oppdager uttrykk for selvmordstanker og selvskading og henviser brukere til krisetjenester. California krever også at selskapene rapporterer om protokollene sine. I praksis betyr det mer automatisk overvåking av de mest sensitive samtalene, ikke mindre. Detaljene står i AI-følgesvenn-lovene i USA.

Slik leser du policyen for dette

Søk i personvernerklæringen og vilkårene etter:

  • «review», «moderate», «human» – om mennesker leser samtaler og hvorfor.
  • «contractors» eller «service providers» – om gjennomgangerne jobber for noen andre.
  • «improve», «train» – om vanlige chatter trekkes ut i stikkprøver.
  • «law enforcement», «legal process», «court order» – når data utleveres, og om det kreves en rettskjennelse.

En nøye policy navngir utløserne og sier at gjennomgangere bare ser samtaler når det er nødvendig. En vag policy som lar ansatte få tilgang til «alt innhold for enhver forretningsmessig hensikt», forteller deg også noe. Våre fire personvernsjekker dekker resten av dokumentet.

Praktiske konklusjoner

  • Skriv som om en gjennomganger kan lese det, for i et lite antall tilfeller vil en gjøre det.
  • Hold andres identifiserende detaljer utenfor chattene, særlig i eksplisitte scener – en gjennomganger som leser en flagget samtale, ser dem også.
  • Hvis et filter slår feil i fiksjon, løser en merknad utenfor rollen som regel det; å diskutere i rollen kan gi flere flagg.
  • Hvis det viktigste for deg er hvem som kan lese chattene dine, er det eneste oppsettet der ingen andre kan, en følgesvenn som kjører på din egen datamaskin – se kjøring av en AI-følgesvenn lokalt.

Moderering er ikke det samme som overvåking. For det store flertallet av samtaler ser ingenting og ingen lenger enn det automatiske filteret. Men det er policyen, ikke appens varme, som avgjør unntakene – og det er verdt å kjenne dem før du trenger dem.

Ofte stilte spørsmål

Leser ansatte AI-kjæreste-chattene mine?

Vanligvis ikke som rutine, men de fleste apper forbeholder seg retten. Ansatte ser typisk samtaler som er flagget av automatiske systemer, rapportert, involvert i en støtteforespørsel eller trukket ut i stikkprøver for å forbedre produktet. Personvernerklæringen bør si hva som gjelder.

Hva skjer hvis jeg blir flagget?

De fleste flagg fører til ingenting du merker, eller til en blokkert melding eller en advarsel. Gjentatte eller alvorlige brudd kan føre til utestengelse av kontoen. Innhold som involverer mindreårige eller reelle trusler kan meldes til myndighetene.

Kan politiet få tak i AI-følgesvenn-chattene mine?

De kan be selskapet om dem, og selskaper etterkommer gyldige rettslige pålegg. Mozillas gjennomgang fra 2024 fant at de fleste produsenter av romantiske chatboter sa at de kunne dele data med myndigheter, noen ganger uten rettslig kjennelse. Gå ut fra at alt som er lagret, kan bli utlevert.