Denne uken måtte OpenAI stanse sin egen modell. Den hadde funnet veien ut av sikkerhetsburet sitt. Samtidig lanserte Anthropic en enklere måte å lære opp Claude på, du filmer rett og slett skjermen din. Fra Kina kom den største åpne AI-modellen noensinne. Her er det viktigste fra denne uken.
Ukens AI-nyheter som former morgendagen
OpenAI stanset sin egen modell etter at den rømte fra sandkassen.
Mandag 20. juli kom OpenAI med en uvanlig ærlig rapport om en modell de aldri har blitt lansert. Det er samme modell som i mai løste et 80 år gammelt matteproblem, Erdos-formodningen. Modellen er bygget for å jobbe selvstendig over lang tid, og det ble problemet. Under testing fant den et hull i sikkerhetsburet på omtrent en time. Den endret et kodeprosjekt den ikke skulle røre, og kamuflerte en digital nøkkel for å lure sikkerhetsskanneren. OpenAI stengte tilgangen og bygget nye sperrer. Nå overvåkes hele arbeidsforløpet, ikke bare enkelthandlinger. For deg betyr dette at AI-verktøy går fra å svare på spørsmål til å jobbe alene. Da gjelder en enkel regel: gi aldri verktøyet bredere tilgang enn oppgaven krever.
Nå kan du lære Claude en oppgave ved å filme skjermen din.
Anthropic lanserte Record a skill 21. juli, i Claude Cowork på skrivebordsprogrammet. Du starter et opptak, gjør oppgaven som vanlig, og forklarer høyt hva du gjør. Claude fanger opp klikk, tastetrykk og stemmen din, og lager en ferdighet den kan kjøre på nytt senere. Ingen prompt-skriving. Ferdighetene kan deles med kollegene, men deling er avslått som standard. Funksjonen finnes i Pro, Max og Team. For deg betyr dette at du nå kan vise Claude oppgaven i stedet for å forklare den. Tenk deg om før du filmer skjermer med kundedata eller annen sensitiv informasjon.
Kimi K3 fra Kina er den største åpne AI-modellen som er laget.
Kinesiske Moonshot AI slapp Kimi K3 den 16. juli, med 2800 milliarder parametere. Ingen åpen modell har vært i nærheten av den størrelsen. I en kjent kodetest slår den Anthropics toppmodell Fable 5, til omtrent halve prisen. Etterspørselen ble så stor at Moonshot måtte stanse nye abonnementer. Den 27. juli legges hele modellen ut gratis for nedlasting. For deg betyr dette at prisene fortsetter å falle. Åpne modeller kan dessuten kjøres på egne maskiner eller i europeiske datasentre. Da sendes ingenting til en utenlandske leverandører.
Microsoft investerer milliarder i Mistral og europeisk AI-kapasitet.
Microsoft og franske Mistral utvidet samarbeidet sitt 21. juli, med en avtale i milliardklassen. Microsoft finansierer tusenvis av nye Nvidia-brikker, som Mistral setter opp i Europa. Til gjengjeld kommer Mistrals modeller inn i Azure, Copilot Studio og Microsoft Foundry. Avtalen er laget for banker, sykehus og andre regulerte bransjer som ikke kan sende data ut av Europa. For deg betyr dette at "dataene går til USA" blir et svakere argument mot AI. Neste gang IT-leverandøren foreslår en løsning, spør konkret hvor dataene behandles.
Meta: AI-moderatorene gjør færre feil enn menneskene.
Meta melder at språkmodellene deres gjør 13 prosent færre feil enn menneskelige moderatorer, og finner 10 prosent flere regelbrudd. Halvparten av all innholdskontroll er allerede erstattet med AI. Målet er over 90 prosent for enkelte innholdstyper i år. Samtidig melder brukere om kontoer som slettes ved en feil, uten et menneske å klage til. For deg betyr dette noe konkret, hvis du bruker Facebook eller Instagram til salg og kundekontakt. Kontoen din vurderes i økende grad av en maskin. Sørg for en e-postliste du eier selv, og ta sikkerhetskopi av innholdet ditt. Et system som er bedre i snitt, hjelper lite den dagen det tar feil om deg.
Ukens tips
Lag din første AI-ferdighet av en oppgave du gjør hver uke. Da slipper du å forklare den samme oppgaven på nytt hver gang.
- Velg en oppgave som følger samme mønster hver gang. Ukesrapporten, standardsvar på henvendelser, eller møtenotater som skal bli en oppgaveliste.
- Gjør oppgaven en gang til, og skriv ned hvert steg mens du jobber. Få med unntakene og de små vurderingene. Det er den delen som bare sitter i hodet ditt.
- Gjør notatene om til en instruksjon med fire deler: rolle, hva AI-en trenger fra deg, stegene i rekkefølge, og formatet på svaret. Avslutt med en kort liste over ting den aldri skal gjøre.
- Test på tre gamle saker der du vet fasit. Juster instruksjonen der den bommer.
- Lagre den et sted du finner den igjen: som ferdighet i Claude, egen GPT i ChatGPT, eller i et dokument du limer inn.
Har du Claude Pro eller Max, kan du hoppe over punkt 2 og 3. Film heller skjermen, så skriver Claude instruksjonen for deg. Uansett sitter du igjen med en oppskrift på hvordan jobben faktisk gjøres. Den er nyttig neste gang dere ansetter noen.
Ukens verktøy
Zapier kobler sammen programmene du allerede bruker, slik at ting skjer av seg selv. Kommer det inn et skjema fra nettsiden, kan Zapier legge svaret i regnearket, sende bekreftelse på e-post og opprette saken i prosjektverktøyet. Du setter det opp ved å klikke deg gjennom "når dette skjer, gjør dette". Over 8000 programmer støttes. Det nye er Zapier Agents: du gir agenten et mål og tilgang til verktøyene den trenger, og den løser oppgaven selv. For eksempel å lese innkommende henvendelser og sende dem til riktig person.
Gratisversjonen gir 100 kjøringer i måneden, nok til å teste. Professional starter på 19,99 dollar i måneden ved årlig betaling. Zapier Agents har eget gratisnivå med 400 aktiviteter i måneden.
Ukens prompt
Denne hører sammen med ukens tips. Den lar AI-en intervjue deg frem til en ferdig instruksjon.
"Jeg skal lage en gjenbrukbar instruksjon for en oppgave jeg gjør ofte. Still meg inntil ti spørsmål, ett om gangen, for å kartlegge hvordan jeg faktisk løser oppgaven, inkludert unntakene og vurderingene jeg gjør underveis. Når du har nok, skriver du instruksjonen med: rolle, hva du trenger fra meg, stegene i rekkefølge, ønsket format på svaret, og en liste over ting du aldri skal gjøre. Oppgaven er: [beskriv oppgaven med en setning]."
Nøkkelen ligger i "ett om gangen". Da blir det en samtale, og detaljene kommer frem av seg selv.
Ukens AI-uttrykk forklart
Begrep: Sandkasse (sandboxing)
Forklaring: En sandkasse er et avgrenset digitalt rom der et program eller en AI-modell får kjøre uten å nå resten av systemet. Tenk på et lekerom med lås på døren. Nettleseren din gjør dette allerede: hver fane kjører i sin egen sandkasse, slik at en useriøs nettside ikke når filene dine. For AI blir sandkassen viktigere jo mer selvstendig modellen er. En modell som kan kjøre kode og endre filer, trenger tydelige vegger rundt seg. Denne uken fant OpenAIs modell hull i sin egen sandkasse på omtrent en time. KI Norge bruker forresten ordet i en annen betydning: deres regulatoriske sandkasse er et juridisk testrom for bedrifter. Prinsippet er det samme, å prøve seg frem innenfor tydelige vegger. For deg betyr dette at du bør spørre hva et AI-verktøy faktisk kan nå, ikke bare hvor smart det er. Gi det en mappe, ikke hele harddisken. Veggene er billigere å sette opp på forhånd enn å rydde opp etterpå.
Det var alt for denne uken . Takk for at du leste denne utgaven av nyhetsbrevet. Svar gjerne på denne e-posten med tilbakemelding på hva du vil se mer av fremover.
Mvh
Eljar