Aus der Praxis
Notizen
Kurze, belegte Beiträge zu Dingen, die ich gebaut und gemessen habe – Vision-LLMs, Agenten, Evals und was dabei schiefgeht.
- 4 Min. Lesezeit
Acht Werkzeuge, null Schreibrechte: Freigabe-Gates für KI-Agenten als Code
Die nützliche Frage ist nicht, ob ein Agent danebenliegt, sondern was er dann anrichten kann. Wie ein Werkzeugvertrag, Schreibzugriff nur als Vorschlag und eine Versionsprüfung das begrenzen – und wo die Grenze aufhört zu helfen.
- AI Agents
- Tool-Rechte
- Approval-Gates
- Audit Ledger
- 6 Min. Lesezeit
LangGraph Deep Research: Zitate verifizieren statt nur verlinken
Wie Abundance Behauptungen, zugelassene Belege und wörtliche Zitate im Code bindet – und warum die semantische Prüfung bewusst nur im Schattenmodus misst.
- LangGraph
- Deep Research
- Citations
- Claim Verification
- 6 Min. Lesezeit
LLM-Evals mit kleinem Referenzdatensatz: Was 12 Fälle leisten
Was ein versionierter Eval-Satz mit zwölf Fällen zuverlässig absichert, wie drei Läufe mit 11/12, 10/12 und 11/12 bewertet werden – und wo die Aussage endet.
- LLM Evals
- Golden Dataset
- Regression Testing
- Claim Verification
- 4 Min. Lesezeit
Optical Context Compression: OCR-lastige PDFs als Bildpakete für Vision-LLMs
Warum Text als Bild günstiger sein kann, wie die Pipeline mit Mistral OCR und einem Sizing-Modell aufgebaut ist und was ein 22-seitiges Testdokument ergibt: bis zu 85 % weniger Kontext.
- Vision-LLM
- OCR
- MCP
- Token-Kosten