aijour · Gennembrud og forskning · AI-agenter · 20. september 2026 · Erfaren
Forkert opsætning af AI-kodeassistent kan femdoble prisen
En ny undersøgelse viser, at den software, der omgiver en AI-model under kodningsopgaver, kan gøre løsningen op til fem gange dyrere uden at give bedre resultater. Simplere opsætninger klarer sig ofte lige så godt som komplekse.

En ny undersøgelse kaldet HarnessTax har set nærmere på, hvad der sker, når man pakker en AI-model ind i forskellig software - en såkaldt »harness«. Det er det program, der styrer, hvordan AI-modellen bruger værktøjer som at læse filer, skrive kode og køre kommandoer, når den løser en kodningsopgave.
Forskerne testede 21 kombinationer af syv AI-modeller og tre forskellige harnesses: Claude Code, Codex CLI og Pi. Hver kombination blev afprøvet på 30 opgaver fra to kendte test-samlinger for kodningsopgaver, SWE-bench Lite og Terminal-Bench 2.0. Både hvor ofte opgaverne blev løst korrekt, og hvor meget det kostede i AI-forbrug, blev målt.
Store prisforskelle for næsten samme resultat
Et af de tydeligste fund er, at valget af harness kan gøre stor forskel i pris - uden at give tilsvarende bedre resultater. Modellen Claude Fable 5 løste 97,8 procent af opgaverne korrekt med Claude Code til en pris af 1,33 dollar pr. forsøg. Med harnesset Pi løste den 96,7 procent - altså næsten det samme - men kun til 0,67 dollar. Det er omtrent dobbelt så billigt for en forskel på blot 1,1 procentpoint i succesrate.
Forklaringen er, at Claude Code fra start bruger ti gange så meget »kontekst« som Pi. Kontekst er den mængde tekst - instruktioner og beskrivelser af værktøjer - som AI-modellen skal læse og forholde sig til, før den overhovedet går i gang med opgaven. Jo mere kontekst, jo dyrere bliver hvert forsøg.
Simple løsninger klarer sig godt
Harnesset Pi bruger kun fire grundlæggende værktøjer: at læse, skrive, redigere og køre kommandoer (bash). Alligevel gav det det bedste forhold mellem pris og resultat på begge test-samlinger og opnåede den højeste nøjagtighed inden for givne budgetter.
Undersøgelsen viser også, at det ikke altid er den bedste løsning at bruge den harness, som leverandøren selv anbefaler til sin model. På tværs af seks modeller fra Anthropic og OpenAI og de to test-samlinger gav et andet harness end standardvalget den højeste succesrate i ni ud af 12 sammenligninger. Modellen GPT-5.6 Sol løste for eksempel 83,3 procent af opgaverne med Pi til 0,42 dollar pr. forsøg, mod 78,9 procent med Codex CLI til 0,76 dollar.
Forskerne anbefaler, at udviklere selv tester forskellige kombinationer af model, harness og opgavetype på en repræsentativ stikprøve af opgaver - og måler både succesrate, pris og svartid - i stedet for blot at stole på generelle benchmarktal eller de indstillinger, som leverandøren sætter som standard.
Kilde
Mere om emnet
Få ugens AI-nyheder i indbakken
Vælg selv niveau, emner og længde. Én mail om ugen, afmeld når som helst.
Tilmeld dig Promptly Nyhedsbrev


