Observe and evaluate LLM Coding Agents
📅 活動時間:2026-08-09 🔗 活動連結 📘 聯繫我 Facebook 📑 投影片 Title Observe and evaluate LLM Coding Agents Outline 在導入 LLM Coding Agent 到日常開發後,很多團隊會遇到問題:品質不穩、風險難估、模型升級缺少客觀依據。本分享會從實務流程出發,介紹如何觀測 Agent 行為、把評估流程自動化,並建立可持續迭代的 decision system。 為什麼 LLM Coding Agent 需要 O11y 與 Evaluation 從 trace 開始:觀測 agent 任務、工具調用與失敗模式 Observability != Decision System:看得到不代表能決策 LLM-as-a-judge 在 coding 任務中的價值與限制 從 daily coding logs 抽取 dataset 建立 regression evaluation pipeline 與 quality gate 用量化結果比較不同模型與 agent framework 把模型升級與框架切換變成可驗證工程流程 Demo & POC https://github.com/chechiachang/llm-o11y Trace and observe local coding agents Build coding-task evals with LLM-as-a-judge Extract datasets from real developer-agent interactions Run regression tests for model / framework change decisions Target group 正在導入 AI coding workflow 的工程團隊 關心品質、成本、延遲與回歸風險的 Tech Lead / SRE / Platform Team 已有 tracing / logging,但缺少可執行評估與 deployment gate 的團隊 Slides 完整投影片與講稿 Author Che-Chia Chang 是一名專注於後端開發、開發維運、容器化應用及 Kubernetes 開發與管理的技術專家,同時也是 Microsoft 最有價值專業人士(MVP)。 ...