Der Browser-Agent von StackAI läuft mit GPT-6.1 Sol. Asana setzte GPT-6 Astra in Codex ein, um verschiedene Einstellungen für den Agenten systematisch zu testen. In einer Studie mit 144 Durchläufen prüfte das Team GPT-6.1 Sol und drei weitere Modelle, die als Model A, B und C bezeichnet wurden. Bei jedem Durchlauf sollte der Agent für 32 Bücher aus einem öffentlichen Demo-Katalog jeweils sechs Angaben sammeln.
Als wirksamste Einstellung erwies sich, Screenshots zunächst anzusammeln und erst bei 20 Bildern zu kürzen. Zusätzlich wurde ein größeres Budget für den Browserverlauf verwendet. Mit dieser Konfiguration lagen die geschätzten Modellkosten für GPT-6.1 Sol im Durchschnitt bei 0,47 US-Dollar pro Durchlauf; die Bearbeitung dauerte etwa vier Minuten. Bei GPT-6.1 Sol sanken die Kosten durch die Anpassungen von 1,97 auf 0,47 US-Dollar.
Der Vergleich mit dem ursprünglichen Produktionssetup bezieht sich auf Model B. Dort lagen die Kosten laut OpenAI zunächst bei mindestens 36,21 US-Dollar pro Durchlauf. Nach der Optimierung mit Model B waren es 1,24 US-Dollar, mit GPT-6.1 Sol anschließend 0,47 US-Dollar. Die optimierten Durchläufe erledigten die Aufgabe korrekt. Beim größeren Verlaufsspeicher waren die Antworten in 18 von 18 Durchläufen richtig; mit dem kleineren Budget gelang das in 3 von 18 Durchläufen.
Asana hat die Änderungen für die Browser-Navigation in StackAI veröffentlicht. Außerdem will das Unternehmen wiederholbare Tests in die Bewertung seiner Plattform integrieren, damit Kunden und interne Teams Kosten, Laufzeit und Antwortqualität vergleichen können. Nach Einschätzung von Frank Hidalgo, CTO von StackAI bei Asana, hätte die Untersuchung von Hand ein bis zwei Monate gedauert. Mit GPT-6 Astra in Codex dauerte sie etwa eine Woche. Asana verwendet das Modell in Codex auch, um Produktfunktionen vor ihrer Veröffentlichung zu testen.
