- 職位
開發
- 工作地點
北京
- 招聘人數
8
- 發布時間
2026-05-29 15:26:11
崗位職責
1.負責大模型評測體系的工程建設與日常運維,重點圍繞代碼能力評測和智能體能力評測,搭建穩定、可復現的評測運行環境。具體包括:
2.接入并適配主流開源評測集,完成數據解析、執行沙箱搭建及評分邏輯對齊。
3.針對代碼類評測集,構建安全可控的代碼執行環境,包括容器化沙箱、資源隔離、超時控制等,保障多語言代碼編譯與運行的正確性和安全性。
4.針對Agenic評測集,搭建端到端的Agent運行環境,包括模擬交互界面、文件系統、終端、瀏覽器等依賴組件,確保Agent能在真實或仿真場景中完成多步驟任務。
5.接入和適配Agent評測框架,實現評測流程的標準化和自動化調度。
6.設計并實現MCP工具層,為評測中的模型調用提供標準化的工具接口,支持工具注冊、調用鏈路追蹤和結果校驗。7.維護評測基礎設施的可觀測性,建設評測結果的存儲、對比與可視化看板,支撐研究團隊的快速迭代需求。
任職資格
1.學信網統招本科學歷,扎實的計算機基礎,熟悉Linux系統管理、容器技術及編排工具。
2.熟練掌握Python,具備良好的工程編碼習慣,了解至少一種其他編程語言。
3.對大模型推理服務的調用鏈路有實際經驗,了解OpenAIAPI兼容協議、流式輸出處理等。
4.了解主流LLM評測方法論與常見評測集的設計思路,有實際跑通過至少一個代碼或Agent評測集的經驗優先。
5.了解MCP協議規范或有類似工具編排系統的開發經驗。
6.具備CI/CD及自動化流水線搭建能力。
7.較強的文檔能力和技術溝通能力,能與研究團隊緊密協作,理解評測需求并轉化為工程方案。
加分項:
1.有主流Agent評測開源項目的貢獻或深度使用經驗。
2.有構建多租戶代碼執行沙箱的經驗。
聯系方式
18317038973