Evaluierung lokaler LLMs und agentischer Coding-Systeme

Beginn: Ab sofort

Erstbetreuer: Dr. Akdag

Zweitbetreuer: Prof. Dr. Heisenberg

Niveau: Masterarbeit


Problemstellung:
Die Nutzung von Large Language Models (LLMs) für die Softwareentwicklung hat rasant an Bedeutung gewonnen. Während kommerzielle Cloud-APIs dominieren, gewinnen datenschutzkonforme, lokal betriebene Open-Source-Modelle zunehmend an Relevanz. Ziel dieser Arbeit ist es, die Leistungsfähigkeit führender lokaler Coding-Modelle systematisch zu untersuchen und zu benchmarken. Neben der reinen Code-Generierung soll insbesondere evaluiert werden, wie gut sich diese Modelle als fundamentale Bausteine in autonomen Software-Agenten schlagen. Hierfür wird die Leistungsfähigkeit komplexer, multi-agentischer Workflows analysiert, um reale Programmieraufgaben kollaborativ zu lösen.
Vorarbeiten:
  • Eine leistungsstarke NVIDIA DGX Spark Workstation steht lokal für das Hosting und Inference-Testing rechenintensiver Modelle zur Verfügung.
  • Etablierte Benchmarks existieren zur Messung der Code-Generierungsqualität.
  • Frameworks wie LangGraph bieten fortgeschrittene zyklische Architekturen zur Implementierung robuster und deterministischer Multi-Agenten-Systeme.
Offene Aufgaben:
  • Recherche und Auswahl der top-performanten lokalen Coding-Modelle (orientiert an aktuellen Rankings).
  • Deployment und Optimierung der Modelle via LM Studio oder Ollama auf der NVIDIA DGX Spark.
  • Konstruktion und Implementierung eines agentischen Coding-Systems (Coding Agents) unter Verwendung von LangGraph.
  • Entwicklung und Durchführung eines standardisierten Benchmark-Szenarios für die isolierte Code-Generierung sowie für die agentischen Workflows.
  • Vergleichende Evaluierung der Modelle hinsichtlich Latenz, Token-Durchsatz, Genauigkeit und Fehlerkorrekturfähigkeit innerhalb des Agenten-Setups.
  • Dokumentation der Best Practices für das On-Premises-Hosting von Entwicklungs-Assistenten.

Ziel der Arbeit ist es, eine fundierte Entscheidungsgrundlage zu schaffen, inwieweit moderne, lokale LLMs in Kombination mit agentischen Frameworks wie LangGraph eine konkurrenzfähige und datenschutzkonforme Alternative zu proprietären Cloud-Diensten im Software-Engineering darstellen.

Interessiert?
Wenn Sie sich für modernste KI-Hardware, Open-Source-Sprachmodelle und die Architektur von KI-Agenten interessieren, bietet diese Masterarbeit eine exzellente Schnittstelle zwischen theoretischer Evaluierung und praktischer Implementierung. Sie arbeiten direkt auf dedizierter NVIDIA Hardware und gestalten die Zukunft automatisierter Softwareentwicklungsprozesse aktiv mit.