Blog

Ein Brief, drei Bauten: drei Agenten-Setups im Vergleich

Wir haben ein Konzept einmal geschrieben und dreimal bauen lassen, mit identischem Brief und identischem Modell. Nur das Agenten-Setup war anders. Hier sind alle Messwerte, die drei fertigen Shops und was wir daraus für die Standardeinstellung gelernt haben.

· Von Melta

Der Aufbau

Jeder Bau bei Melta beginnt mit einem Konzept. Für diesen Vergleich haben wir es genau einmal erzeugen lassen, aus einer kurzen Idee: ein Online-Shop für nummerierte Sammler-Enten aus smaragdgrünem Edelglas, mit Katalog, Editionen, Warenkorb, Kasse, Kundenkonto, Zertifikat-Download, Newsletter und Admin-Bereich. Das fertige Konzept ist 33'293 Zeichen lang und enthält neben der Kundensicht den vollständigen technischen Bauplan.

Dieses eine Dokument haben wir dreimal als Brief in den Bau gegeben, Wort für Wort gleich. Gebaut hat jedes Mal Claude Opus 5 in Claude Code, in einem eigenen isolierten Container, mit denselben Werkzeugen, denselben Plattform-Modulen und denselben Prüfungen. Verändert haben wir nur zwei Schalter:

  1. Multi-Agent an, Stufe medium. Der Agent darf die Arbeit auf Subagenten verteilen und muss vor dem Abschluss eine eigene Prüfrunde fahren, in der separate Agenten das Produkt kritisch durchgehen. Stufe medium ist, was Claude Code auf einem Abo seit dem Frühjahr 2026 als Standard setzt.
  2. Multi-Agent aus, Stufe medium. Ein Agent macht alles selbst, ohne Subagenten, ohne Prüfrunde.
  3. Multi-Agent aus, Stufe high. Wie Variante zwei, aber mit ausdrücklich gesetzter Denkstufe high.

Alle drei liefen am 4. und 5. September 2026, jeweils bis der Bau die Vorschau erreichte. Die Vorschau bekommt bei Melta automatisch Demo-Daten, drei Test-Logins und einen Katalog mit acht Posten.

Die Zahlen

Multi-Agent, medium Einzel-Agent, medium Einzel-Agent, high
Laufzeit bis zur Vorschau 140 min 92 min 110 min
Output-Tokens gesamt 1,07 Mio. 380'000 333'000
davon Subagenten 786'000 0 0
Cache-Reads 105 Mio. 90 Mio. 58 Mio.
Kosten zu API-Listenpreisen 102 USD 59 USD 44 USD
Kosten im Verhältnis 2,3-fach 1,35-fach 1-fach

Die Kosten sind der Wert der Tokens zu den API-Listenpreisen von Claude Opus 5, also 5 USD je Million Input-Tokens, 25 USD je Million Output-Tokens, 6,25 USD je Million Cache-Writes und 0,50 USD je Million Cache-Reads, plus die generierten Bilder. Das Verhältnis bezieht sich auf die günstigste Variante. Die Tokens stammen aus der Telemetrie von Claude Code, getrennt nach Hauptlauf und Subagenten, nicht aus einer Schätzung.

Zwei Dinge fallen sofort auf. Die Multi-Agent-Variante hat mehr als doppelt so viele Output-Tokens erzeugt, drei Viertel davon in Subagenten, und sie hat am längsten gebraucht. Und die Variante auf Stufe high hat weniger Cache-Reads als dieselbe Variante auf medium: sie hat weniger gesucht und mehr gedacht, und war damit die günstigste der drei.

Die drei Shops

Alle drei laufen als öffentliche Vorschau mit Demo-Daten und Demo-Leiste. Käufe gehen über ein Test-Zahlungskonto, an der Kasse funktioniert die Testkarte 4242 4242 4242 4242. Jeder Shop ist das, was der jeweilige Lauf abgeliefert hat, mit Katalog, Editionen, Warenkorb, Kasse, Kundenkonto und Admin-Bereich.

Der Shop aus dem Multi-Agent-Bau

Multi-Agent, medium: der Shop aus dem ersten Setup.

Der Shop aus dem Einzel-Agent-Bau auf Stufe medium

Einzel-Agent, medium: der Shop aus dem zweiten Setup.

Der Shop aus dem Einzel-Agent-Bau auf Stufe high

Einzel-Agent, high: der Shop aus dem dritten Setup.

Was wir daraus lesen

Ein Datenpunkt ist kein Beweis, und wir werden das Experiment wiederholen, mit anderen Konzepten und mit den nächsten Modellen. Zwei Dinge nehmen wir jetzt schon mit:

Themen: Benchmark, Agenten, Bauen

Beschreib dein Produkt - den Rest übernimmt Melta.

Ein Konzept kostet nur wenige Credits. Gebaut, online gestellt und betrieben wird es, sobald du es freigibst.

Frühzugang sichern