实验与证据图谱¶ 109 Experiment Records 先看证据状态,再看结果¶ 实验卡记录问题、设计、环境、Artifact和限制。目录出现不代表实验结论已经复核。 搜索实验 109项 全部 已审查 E4 E3 待证据审查 CHAPTER 014 experiments 1-1上下文组件消融E4已审查 1-2Kimi K3 模型即 Agent,具备基础深度搜索能力,能进行多轮搜索和信息整合E2待证据审查 1-3模型自主多轮搜索 + 服务端代码执行的 Deep Research 闭环,先澄清意图再执行;官方 GPT-5.6 路径保E2待证据审查 1-4具体/宽泛两类需求 × 工作流(kimi-k3 改写 + 通义万相)与原生(Gemini / GPT-Image 2)双E2待证据审查 CHAPTER 0210 experiments 2-1跨平台本地 LLM 部署,自动选 vLLM/Ollama 后端,展示 0.6B 小模型也能有出色工具调用E2待证据审查 2-2可视化 LLM 完整 token 序列与注意力权重分布,理解模型如何处理上下文、推理与调用工具E2待证据审查 2-3稳定前缀与KV CacheE4已审查 2-4扩展 Tau-Bench,量化语气风格、指令组织、工具描述等因素对任务完成率的影响E2待证据审查 2-5Prompt Injection攻击与防御矩阵E4已审查 2-6固定 Anthropic 官方 PPTX Skill + 真实论文 PDF,运行时可为 Claude Code 或等价的E2待证据审查 2-7从个人范文创建“去 AI 味”写作 Skill;练习 Skill 的触发条件、规则、示例、作用域与迭代维护,不依赖独立代E0待证据审查 2-8可视化 LLM 完整 token 序列与注意力权重分布,理解模型如何处理上下文、推理与调用工具E2待证据审查 2-9研究系统提示对 Agent 行为的影响,探索如何通过优化系统提示提升性能E2待证据审查 2-10上下文压缩策略E3已审查 CHAPTER 0312 experiments 3-1长期用户记忆系统,让 Agent 记住偏好与历史交互、提供个性化服务E2待证据审查 3-2长期用户记忆系统,让 Agent 记住偏好与历史交互、提供个性化服务E2待证据审查 3-3智能日志脱敏系统,基于本地 Ollama 模型检测并脱敏日志中的密钥和 PII 敏感数据E2待证据审查 3-4向量相似性搜索服务,对比 ANNOY(树)与 HNSW(图)两种 ANN 算法的权衡E2待证据审查 3-5从零实现基于 BM25 的稀疏向量搜索引擎,可视化内部工作机制E2待证据审查 3-6稠密 + 稀疏 + 神经重排序的完整流水线,用测试用例展示混合检索的互补效果E2待证据审查 3-7实现并对比 RAPTOR(递归抽象树)与 GraphRAG(知识图谱)两种结构化索引E2待证据审查 3-8对比 Non-Agentic 与 Agentic RAG,展示 ReAct 主导的迭代检索在司法问答上的优势E2待证据审查 3-9用 Agentic RAG 管理用户对话历史,实现跨会话记忆检索E2待证据审查 3-10实现 Anthropic 的上下文感知检索,为分块生成前缀摘要,失败率降低 49–67%E2待证据审查 3-11结合 Advanced JSON Cards 与上下文感知 RAG,形成双层记忆结构实现主动服务E2待证据审查 3-12以司法判例跑通「因子发现 → 聚类原型 → 对话式建议」三段流水线E2待证据审查 CHAPTER 045 experiments 4-1Qwen3-4B 真实对照中两组均 3/3 完成、准确率均 100%(未证明准确率提升);主动发现的 schema 暴露E2待证据审查 4-2感知工具 MCP:网络搜索、多模态理解、文件系统、公共数据源(DuckDuckGo/Open-Meteo/Yahoo/OE2待证据审查 4-3对比原生多模态、提取为文本、工具化分析三种策略在保真度、成本和灵活性上的权衡E2待证据审查 4-4执行工具 MCP:20 次正式调用已通过 13/15 门禁,含 GitHub PR、Xvfb 桌面 Computer UE2待证据审查 4-5协作工具 MCP:浏览器自动化、HITL、Email/Telegram/Slack/Discord 通知、定时器,支持管E2待证据审查 CHAPTER 0516 experiments 5-1六种厂商组合 × 三种做法的真实接管:中立格式 6/6 切换成功并算对总额,原样直传 3/6、剥离思考 4/6,四次失败E2待证据审查 5-2流式输出在思考/正文/参数三处被切断后的恢复对照:正文断点上续写省 15%~66% 输出 token,参数断点上却会拼出E2待证据审查 5-330 道 AIME 2024 同模型真实对照:代码臂全部调用沙箱(含 sympy/numpy/scipy),53.3% E2待证据审查 5-4固定版本 K&K 数据集 84 题真实对照:代码臂 100% 调用 python-constraint,实测 39.3%E2待证据审查 5-5本地 Qwen3-4B 的 60×2 配对 τ-bench 风格活动:代码化规则臂 91.7% vs 控制组 95.0%E2待证据审查 5-6固定真实论文 PDF 的 20 页双臂正式对照:三张原图均带页码/裁剪/变换/哈希来源;两组独立 Vision 均以 9E2待证据审查 5-712 页真实幻灯片逐页经 Kimi K3 生成讲解词、Qwen-VL-Max 对照像素审核、Fish Audio S1 E2待证据审查 5-8一段多场景视频 + 一句自然语言需求,两步 Vision 定位剪出片段,Reviewer 抽帧核对不合格则迭代E2待证据审查 5-9同一法兰盘规格双路线实测:Kimi 写的 17 行 CadQuery 全尺寸零偏差;Hunyuan3D-2.1(HF 公E2待证据审查 5-10遇到无法解析的新格式时不报错,交给代码 Agent 生成 parse 函数,测试通过后热更新进引擎,全程无人介入E2待证据审查 5-11诊断 Agent 读真实 HTTP 轨迹/架构文档/PRD,定位根因、生成回归测试并在修复前后重放;正式活动通过官方 GE2待证据审查 5-12信息不全时动态生成含级联逻辑的 HTML 表单让用户一次性补全,汇总 JSON 交回 AgentE2待证据审查 5-13中文自然语言转 SQL 由 DB 执行,artifact 模式让 LLM 只生成 SQL 制品不搬运数据,省 tokenE2待证据审查 5-14自然语言提 UI 定制需求(颜色/字体/文案/布局),Agent 改 React 源码借 Vite HMR 即时生效E2待证据审查 5-15在 PostgreSQL 之上的权限内嵌对象存储:应用层代码可以动态生成,但每次读写仍由数据层强制执行权限、校验、引用完E2待证据审查 5-16模板/从零双臂均已通过结构、编译、测试、真实 Kimi K3 任务和语义门禁;正式对照完整结束。模板质量非劣且创建更高效E2待证据审查 CHAPTER 0614 experiments 6-1FastAPI 事件驱动 Agent,原生异步集成前三组 MCP 工具,通过 HTTP API 接收 Web/IM/GiE2待证据审查 6-2asyncio 单线程事件驱动框架 Flux:事件队列按紧急度分派、异步工具并行、运行中打断、长任务取消与状态查询E2待证据审查 6-3三层用户记忆评估集;实验 6-3 的四档多维 Rubric、逐维证据与幻觉一票否决E2待证据审查 6-4真实单轮证据完成麦克风媒体 → Silero VAD → 本地 Whisper → ARK 流式 LLM → Fish E2待证据审查 6-5canonical 本地验收运行 Qwen2-Audio 递增前缀与 600ms VAD + Whisper:8/8 执E2待证据审查 6-6真实本地运行在单张 RTX PRO 6000 上执行固定 revision 的 MiniCPM-o 4.5:端到端与自级E2待证据审查 6-7真实 Fish Audio S1 4×3×2=24 条参考音库与 A/B/C 媒体齐全;三次位置平衡的真实 VoxtraE2待证据审查 6-8正式运行从固定源码本地构建镜像,用 claude-sonnet-4-5-20250929 完成 16 次真实响应与 15E2待证据审查 6-9正式开放模型运行使用 qwen/qwen3-vl-32b-instruct:Google CAPTCHA 后转 weatE2待证据审查 6-10真机遥操作 XLeRobot 整理桌面:把红色杯子放进托盘、把黄色废纸放进垃圾盒,最后重新观察并确认状态E2待证据审查 6-11在模拟器中测量同一桌面任务的理想控制上限,不代表真机已经运行E2待证据审查 6-12使用 Gemini Robotics-ER 1.5 自主驱动真实 XLeRobot 完成同一整理桌面任务E2待证据审查 6-13在模拟器中比较开环、逐步检查和预测式闭环三种同任务策略E2待证据审查 6-14对同一桌面任务进行 RGB 跨环境测试,检查视觉策略对背景、外观、光照和噪声变化的适应性E2待证据审查 CHAPTER 0714 experiments 7-110,000 局 Q-learning + 100 局评估与官方 Kimi K3 第一局双臂实测已验收;证据记录 KimE2待证据审查 7-210,000 局 Q-learning + 100 局评估与官方 Kimi K3 第一局双臂实测已验收;证据记录 KimE1待证据审查 7-3四档多维 Rubric 已在 60 用例 × 3 系统的 180/180 条真实评判记录上完整执行E2待证据审查 7-460 用例 × 3 系统共 180/180 条真实轨迹,零错误且原生币种定价完整E2待证据审查 7-5真实验收完成 OpenAI/Fish 两 provider × 四类语料的 8/8 双音频 Voxtral 四维评审;候E2待证据审查 7-6对已保留的 T3A 日志做离线失败归因。全体统计(自原始日志重算):53 个任务块,其中 1 块是基准自身 initiaE2待证据审查 7-7已用真实 openai/gpt-5.6-sol 经 OpenRouter 完成 11 个 trajectory-prefE2待证据审查 7-8正式全量验收处理 1,799,991 条公开 Arena 记录(1,670,250 条盲选票、129 个模型),在线 EE2待证据审查 7-9同一中性 Coding Harness 下完成 GPT-5.6-sol / Claude Sonnet 5 × 三任务 E2待证据审查 7-10多轮 Agent 任务(客服退款)全链路成本拆解 + KV-cache 友好设计/上下文压缩的 A/B 节省量化E2待证据审查 7-11完整 8K/32K/128K × 512/2048、限流爬坡、Agent 成本与 168 小时可用性 campaign E0待证据审查 7-12全矩阵验收完成 60 用例 × 24 单元(4 嵌入 × 3 reranker × 2 主模型)共 1,440/1,44E2待证据审查 7-13评估 Agent 在 Android 环境的应用导航、UI 交互与任务完成能力(外部基准仓库;7-2 的实际结果见上行)E1待证据审查 7-14正式单卡运行完成 chunk 1/25 各 128 IID + 128 OOD episodes,严格门禁及 512 个E2待证据审查 CHAPTER 0819 experiments 8-1同一确定性寻宝环境下完成 10,000 局 Q-learning、100 局贪婪评估与官方 Moonshot kimi-E2待证据审查 8-2同一确定性寻宝环境下完成 10,000 局 Q-learning、100 局贪婪评估与官方 Moonshot kimi-E2待证据审查 8-3规范训练报告绑定原始与 QK-Norm + Muon 两臂在预训练、SFT、DPO 后的 49 份历史输出、8 次匿名 E2待证据审查 8-4规范训练报告保留 8 配置 × 8 图片的 64 份历史输出及 8 次真实图像感知匿名 ARK 评审,固定原版/改进版源E2待证据审查 8-5规范训练报告绑定 RTX-4090 三阶段原始输出、15 份生成、5 次匿名 ARK 盲评、源码与当前复现 revisiE2待证据审查 8-6有界本地 GPU 实验已完成两条真实语音 SFT 轨道:各 60 次 LoRA 更新、留出集损失、40 个基线/微调音频E2待证据审查 8-7多语言思考 SFT 实现;需训练 checkpoint 与跨语言基准前后对照才算完成E0待证据审查 8-8正式保留运行包含 160/160 训练与 80/80 留出 Kimi K3 教师回执、真实 CUDA 训练的 SmolLE2待证据审查 8-924/24 Kimi K3 教师轨迹均已完成并经规则过滤,23 条进入 SFT;真实 CUDA checkpoint 与E2待证据审查 8-10历史训练报告记录公开 W&B 主运行 wubbn5tj:8×H100,step 300 三基准响应长度均显著下降,但 AE2待证据审查 8-11bojieli/SFTvsRL 的 GeneralPoints-L/VL:同预算 SFT 与 PPO 的 ID/OOD E1待证据审查 8-12同一 bojieli/SFTvsRL checkout 的 V-IRL-L/VL 训练与跨城市/规则 OOD 评估,不是E1待证据审查 8-13PRIME-RL/SimpleVLA-RL 主仓与内嵌 verl/ 已固定;OpenVLA-OFT、LIBERO/RobE1待证据审查 8-14ReTool 配方来自 bojieli/verl,实时代码执行依赖 bojieli/SandboxFusion;不是一个E1待证据审查 8-15bojieli/AWorld 中的 GAIA MCP 沙盒与训练入口,bojieli/verl 为训练后端E1待证据审查 8-16完整训练/评估代码来自固定到 1ad30bc… 的 19PINE-AI/rlvp;当前 checkout 缺失,训练未运E1待证据审查 8-17待人工提炼。E2待证据审查 8-18中文弯引号作用域 Bad Case:人工审计合成数据 + 显式 Skill 正反规则 → Qwen3-8B bf16 LE2待证据审查 8-19oldstring/特殊字符串精确复制 Bad Case:未见随机字符串、相似字符串选择和工具 JSON 参数 → QwE2待证据审查 CHAPTER 099 experiments 9-128 条真实客服调用、8 次 Judge 调用与 8 条专家标注样本已通过验收;证据同时记录关键违规稳定性E2待证据审查 9-2τ²-bench telecom 上由模型从 19 条失败轨迹提炼转接与工具使用规则;迁移集 114 条通E2待证据审查 9-3真实任务 Agent、LLM Judge 与 Coding Agent 跑完初始/自动/人工三组完整保留集E2待证据审查 9-4从用户反馈中进化“需求澄清 + Spec 确认”Skill;正文给出三臂 A/B 设计、指标和发布门槛,配套实现待补充E0待证据审查 9-5真实 ARK Agent + Chromium 在可重置本地消息站完成探索、独立验证、参数化回放、假成功对E2待证据审查 9-6真实 Coding Agent 从重复故障生成补丁,并与确定性提案、故意过宽的反例通过同一回归/灰度/回滚E2待证据审查 9-7用户纠正/点踩/事后审计触发“高风险调用确认门禁”提案,经 AST 静态检查、未完成任务回放和正常操作回放E2待证据审查 9-8把整本书和源码交给 Hermes;它读完后选择一项改进,亲手修改自己,并把每次 Reviewer 的退回变E1待证据审查 9-9static、append-only、evolving 三臂 × 3 seeds × 14 任务共 126E2待证据审查 CHAPTER 106 experiments 10-1正式 v2 对照完成 30 对任务、12 条边界轨迹、289 份模型回执、31 份 Tavily 回执和 60 次异源盲E2待证据审查 10-2正式 ARK v4在英文版第 1–2 章的 242,090 字节、23 图、14 代码块上完成 26 单元双臂对照:12E2待证据审查 10-3主路径的 WebRTC raw-v4用真实 ARK 自主工具调用、Playwright、双向 RTP、本机 TTS/WhE2待证据审查 10-4同一次真实验收运行覆盖 10 站点串并行与 4 会话级联:12/12 门禁通过、实测加速 1.872×、24 份完整浏览E2待证据审查 10-5Qwen 3.7 Flash 正式运行完成三组各 25 Agent、17,280 步、两个虚拟日的完整社会实验;148,E1待证据审查 10-6同一次 v11 真实验收完成 3 个昼夜投票循环、6 次 LLM 工具→macOS say→OpenRouter 原生音E2待证据审查
实验与证据图谱¶ 109 Experiment Records 先看证据状态,再看结果¶ 实验卡记录问题、设计、环境、Artifact和限制。目录出现不代表实验结论已经复核。 搜索实验 109项 全部 已审查 E4 E3 待证据审查 CHAPTER 014 experiments 1-1上下文组件消融E4已审查 1-2Kimi K3 模型即 Agent,具备基础深度搜索能力,能进行多轮搜索和信息整合E2待证据审查 1-3模型自主多轮搜索 + 服务端代码执行的 Deep Research 闭环,先澄清意图再执行;官方 GPT-5.6 路径保E2待证据审查 1-4具体/宽泛两类需求 × 工作流(kimi-k3 改写 + 通义万相)与原生(Gemini / GPT-Image 2)双E2待证据审查 CHAPTER 0210 experiments 2-1跨平台本地 LLM 部署,自动选 vLLM/Ollama 后端,展示 0.6B 小模型也能有出色工具调用E2待证据审查 2-2可视化 LLM 完整 token 序列与注意力权重分布,理解模型如何处理上下文、推理与调用工具E2待证据审查 2-3稳定前缀与KV CacheE4已审查 2-4扩展 Tau-Bench,量化语气风格、指令组织、工具描述等因素对任务完成率的影响E2待证据审查 2-5Prompt Injection攻击与防御矩阵E4已审查 2-6固定 Anthropic 官方 PPTX Skill + 真实论文 PDF,运行时可为 Claude Code 或等价的E2待证据审查 2-7从个人范文创建“去 AI 味”写作 Skill;练习 Skill 的触发条件、规则、示例、作用域与迭代维护,不依赖独立代E0待证据审查 2-8可视化 LLM 完整 token 序列与注意力权重分布,理解模型如何处理上下文、推理与调用工具E2待证据审查 2-9研究系统提示对 Agent 行为的影响,探索如何通过优化系统提示提升性能E2待证据审查 2-10上下文压缩策略E3已审查 CHAPTER 0312 experiments 3-1长期用户记忆系统,让 Agent 记住偏好与历史交互、提供个性化服务E2待证据审查 3-2长期用户记忆系统,让 Agent 记住偏好与历史交互、提供个性化服务E2待证据审查 3-3智能日志脱敏系统,基于本地 Ollama 模型检测并脱敏日志中的密钥和 PII 敏感数据E2待证据审查 3-4向量相似性搜索服务,对比 ANNOY(树)与 HNSW(图)两种 ANN 算法的权衡E2待证据审查 3-5从零实现基于 BM25 的稀疏向量搜索引擎,可视化内部工作机制E2待证据审查 3-6稠密 + 稀疏 + 神经重排序的完整流水线,用测试用例展示混合检索的互补效果E2待证据审查 3-7实现并对比 RAPTOR(递归抽象树)与 GraphRAG(知识图谱)两种结构化索引E2待证据审查 3-8对比 Non-Agentic 与 Agentic RAG,展示 ReAct 主导的迭代检索在司法问答上的优势E2待证据审查 3-9用 Agentic RAG 管理用户对话历史,实现跨会话记忆检索E2待证据审查 3-10实现 Anthropic 的上下文感知检索,为分块生成前缀摘要,失败率降低 49–67%E2待证据审查 3-11结合 Advanced JSON Cards 与上下文感知 RAG,形成双层记忆结构实现主动服务E2待证据审查 3-12以司法判例跑通「因子发现 → 聚类原型 → 对话式建议」三段流水线E2待证据审查 CHAPTER 045 experiments 4-1Qwen3-4B 真实对照中两组均 3/3 完成、准确率均 100%(未证明准确率提升);主动发现的 schema 暴露E2待证据审查 4-2感知工具 MCP:网络搜索、多模态理解、文件系统、公共数据源(DuckDuckGo/Open-Meteo/Yahoo/OE2待证据审查 4-3对比原生多模态、提取为文本、工具化分析三种策略在保真度、成本和灵活性上的权衡E2待证据审查 4-4执行工具 MCP:20 次正式调用已通过 13/15 门禁,含 GitHub PR、Xvfb 桌面 Computer UE2待证据审查 4-5协作工具 MCP:浏览器自动化、HITL、Email/Telegram/Slack/Discord 通知、定时器,支持管E2待证据审查 CHAPTER 0516 experiments 5-1六种厂商组合 × 三种做法的真实接管:中立格式 6/6 切换成功并算对总额,原样直传 3/6、剥离思考 4/6,四次失败E2待证据审查 5-2流式输出在思考/正文/参数三处被切断后的恢复对照:正文断点上续写省 15%~66% 输出 token,参数断点上却会拼出E2待证据审查 5-330 道 AIME 2024 同模型真实对照:代码臂全部调用沙箱(含 sympy/numpy/scipy),53.3% E2待证据审查 5-4固定版本 K&K 数据集 84 题真实对照:代码臂 100% 调用 python-constraint,实测 39.3%E2待证据审查 5-5本地 Qwen3-4B 的 60×2 配对 τ-bench 风格活动:代码化规则臂 91.7% vs 控制组 95.0%E2待证据审查 5-6固定真实论文 PDF 的 20 页双臂正式对照:三张原图均带页码/裁剪/变换/哈希来源;两组独立 Vision 均以 9E2待证据审查 5-712 页真实幻灯片逐页经 Kimi K3 生成讲解词、Qwen-VL-Max 对照像素审核、Fish Audio S1 E2待证据审查 5-8一段多场景视频 + 一句自然语言需求,两步 Vision 定位剪出片段,Reviewer 抽帧核对不合格则迭代E2待证据审查 5-9同一法兰盘规格双路线实测:Kimi 写的 17 行 CadQuery 全尺寸零偏差;Hunyuan3D-2.1(HF 公E2待证据审查 5-10遇到无法解析的新格式时不报错,交给代码 Agent 生成 parse 函数,测试通过后热更新进引擎,全程无人介入E2待证据审查 5-11诊断 Agent 读真实 HTTP 轨迹/架构文档/PRD,定位根因、生成回归测试并在修复前后重放;正式活动通过官方 GE2待证据审查 5-12信息不全时动态生成含级联逻辑的 HTML 表单让用户一次性补全,汇总 JSON 交回 AgentE2待证据审查 5-13中文自然语言转 SQL 由 DB 执行,artifact 模式让 LLM 只生成 SQL 制品不搬运数据,省 tokenE2待证据审查 5-14自然语言提 UI 定制需求(颜色/字体/文案/布局),Agent 改 React 源码借 Vite HMR 即时生效E2待证据审查 5-15在 PostgreSQL 之上的权限内嵌对象存储:应用层代码可以动态生成,但每次读写仍由数据层强制执行权限、校验、引用完E2待证据审查 5-16模板/从零双臂均已通过结构、编译、测试、真实 Kimi K3 任务和语义门禁;正式对照完整结束。模板质量非劣且创建更高效E2待证据审查 CHAPTER 0614 experiments 6-1FastAPI 事件驱动 Agent,原生异步集成前三组 MCP 工具,通过 HTTP API 接收 Web/IM/GiE2待证据审查 6-2asyncio 单线程事件驱动框架 Flux:事件队列按紧急度分派、异步工具并行、运行中打断、长任务取消与状态查询E2待证据审查 6-3三层用户记忆评估集;实验 6-3 的四档多维 Rubric、逐维证据与幻觉一票否决E2待证据审查 6-4真实单轮证据完成麦克风媒体 → Silero VAD → 本地 Whisper → ARK 流式 LLM → Fish E2待证据审查 6-5canonical 本地验收运行 Qwen2-Audio 递增前缀与 600ms VAD + Whisper:8/8 执E2待证据审查 6-6真实本地运行在单张 RTX PRO 6000 上执行固定 revision 的 MiniCPM-o 4.5:端到端与自级E2待证据审查 6-7真实 Fish Audio S1 4×3×2=24 条参考音库与 A/B/C 媒体齐全;三次位置平衡的真实 VoxtraE2待证据审查 6-8正式运行从固定源码本地构建镜像,用 claude-sonnet-4-5-20250929 完成 16 次真实响应与 15E2待证据审查 6-9正式开放模型运行使用 qwen/qwen3-vl-32b-instruct:Google CAPTCHA 后转 weatE2待证据审查 6-10真机遥操作 XLeRobot 整理桌面:把红色杯子放进托盘、把黄色废纸放进垃圾盒,最后重新观察并确认状态E2待证据审查 6-11在模拟器中测量同一桌面任务的理想控制上限,不代表真机已经运行E2待证据审查 6-12使用 Gemini Robotics-ER 1.5 自主驱动真实 XLeRobot 完成同一整理桌面任务E2待证据审查 6-13在模拟器中比较开环、逐步检查和预测式闭环三种同任务策略E2待证据审查 6-14对同一桌面任务进行 RGB 跨环境测试,检查视觉策略对背景、外观、光照和噪声变化的适应性E2待证据审查 CHAPTER 0714 experiments 7-110,000 局 Q-learning + 100 局评估与官方 Kimi K3 第一局双臂实测已验收;证据记录 KimE2待证据审查 7-210,000 局 Q-learning + 100 局评估与官方 Kimi K3 第一局双臂实测已验收;证据记录 KimE1待证据审查 7-3四档多维 Rubric 已在 60 用例 × 3 系统的 180/180 条真实评判记录上完整执行E2待证据审查 7-460 用例 × 3 系统共 180/180 条真实轨迹,零错误且原生币种定价完整E2待证据审查 7-5真实验收完成 OpenAI/Fish 两 provider × 四类语料的 8/8 双音频 Voxtral 四维评审;候E2待证据审查 7-6对已保留的 T3A 日志做离线失败归因。全体统计(自原始日志重算):53 个任务块,其中 1 块是基准自身 initiaE2待证据审查 7-7已用真实 openai/gpt-5.6-sol 经 OpenRouter 完成 11 个 trajectory-prefE2待证据审查 7-8正式全量验收处理 1,799,991 条公开 Arena 记录(1,670,250 条盲选票、129 个模型),在线 EE2待证据审查 7-9同一中性 Coding Harness 下完成 GPT-5.6-sol / Claude Sonnet 5 × 三任务 E2待证据审查 7-10多轮 Agent 任务(客服退款)全链路成本拆解 + KV-cache 友好设计/上下文压缩的 A/B 节省量化E2待证据审查 7-11完整 8K/32K/128K × 512/2048、限流爬坡、Agent 成本与 168 小时可用性 campaign E0待证据审查 7-12全矩阵验收完成 60 用例 × 24 单元(4 嵌入 × 3 reranker × 2 主模型)共 1,440/1,44E2待证据审查 7-13评估 Agent 在 Android 环境的应用导航、UI 交互与任务完成能力(外部基准仓库;7-2 的实际结果见上行)E1待证据审查 7-14正式单卡运行完成 chunk 1/25 各 128 IID + 128 OOD episodes,严格门禁及 512 个E2待证据审查 CHAPTER 0819 experiments 8-1同一确定性寻宝环境下完成 10,000 局 Q-learning、100 局贪婪评估与官方 Moonshot kimi-E2待证据审查 8-2同一确定性寻宝环境下完成 10,000 局 Q-learning、100 局贪婪评估与官方 Moonshot kimi-E2待证据审查 8-3规范训练报告绑定原始与 QK-Norm + Muon 两臂在预训练、SFT、DPO 后的 49 份历史输出、8 次匿名 E2待证据审查 8-4规范训练报告保留 8 配置 × 8 图片的 64 份历史输出及 8 次真实图像感知匿名 ARK 评审,固定原版/改进版源E2待证据审查 8-5规范训练报告绑定 RTX-4090 三阶段原始输出、15 份生成、5 次匿名 ARK 盲评、源码与当前复现 revisiE2待证据审查 8-6有界本地 GPU 实验已完成两条真实语音 SFT 轨道:各 60 次 LoRA 更新、留出集损失、40 个基线/微调音频E2待证据审查 8-7多语言思考 SFT 实现;需训练 checkpoint 与跨语言基准前后对照才算完成E0待证据审查 8-8正式保留运行包含 160/160 训练与 80/80 留出 Kimi K3 教师回执、真实 CUDA 训练的 SmolLE2待证据审查 8-924/24 Kimi K3 教师轨迹均已完成并经规则过滤,23 条进入 SFT;真实 CUDA checkpoint 与E2待证据审查 8-10历史训练报告记录公开 W&B 主运行 wubbn5tj:8×H100,step 300 三基准响应长度均显著下降,但 AE2待证据审查 8-11bojieli/SFTvsRL 的 GeneralPoints-L/VL:同预算 SFT 与 PPO 的 ID/OOD E1待证据审查 8-12同一 bojieli/SFTvsRL checkout 的 V-IRL-L/VL 训练与跨城市/规则 OOD 评估,不是E1待证据审查 8-13PRIME-RL/SimpleVLA-RL 主仓与内嵌 verl/ 已固定;OpenVLA-OFT、LIBERO/RobE1待证据审查 8-14ReTool 配方来自 bojieli/verl,实时代码执行依赖 bojieli/SandboxFusion;不是一个E1待证据审查 8-15bojieli/AWorld 中的 GAIA MCP 沙盒与训练入口,bojieli/verl 为训练后端E1待证据审查 8-16完整训练/评估代码来自固定到 1ad30bc… 的 19PINE-AI/rlvp;当前 checkout 缺失,训练未运E1待证据审查 8-17待人工提炼。E2待证据审查 8-18中文弯引号作用域 Bad Case:人工审计合成数据 + 显式 Skill 正反规则 → Qwen3-8B bf16 LE2待证据审查 8-19oldstring/特殊字符串精确复制 Bad Case:未见随机字符串、相似字符串选择和工具 JSON 参数 → QwE2待证据审查 CHAPTER 099 experiments 9-128 条真实客服调用、8 次 Judge 调用与 8 条专家标注样本已通过验收;证据同时记录关键违规稳定性E2待证据审查 9-2τ²-bench telecom 上由模型从 19 条失败轨迹提炼转接与工具使用规则;迁移集 114 条通E2待证据审查 9-3真实任务 Agent、LLM Judge 与 Coding Agent 跑完初始/自动/人工三组完整保留集E2待证据审查 9-4从用户反馈中进化“需求澄清 + Spec 确认”Skill;正文给出三臂 A/B 设计、指标和发布门槛,配套实现待补充E0待证据审查 9-5真实 ARK Agent + Chromium 在可重置本地消息站完成探索、独立验证、参数化回放、假成功对E2待证据审查 9-6真实 Coding Agent 从重复故障生成补丁,并与确定性提案、故意过宽的反例通过同一回归/灰度/回滚E2待证据审查 9-7用户纠正/点踩/事后审计触发“高风险调用确认门禁”提案,经 AST 静态检查、未完成任务回放和正常操作回放E2待证据审查 9-8把整本书和源码交给 Hermes;它读完后选择一项改进,亲手修改自己,并把每次 Reviewer 的退回变E1待证据审查 9-9static、append-only、evolving 三臂 × 3 seeds × 14 任务共 126E2待证据审查 CHAPTER 106 experiments 10-1正式 v2 对照完成 30 对任务、12 条边界轨迹、289 份模型回执、31 份 Tavily 回执和 60 次异源盲E2待证据审查 10-2正式 ARK v4在英文版第 1–2 章的 242,090 字节、23 图、14 代码块上完成 26 单元双臂对照:12E2待证据审查 10-3主路径的 WebRTC raw-v4用真实 ARK 自主工具调用、Playwright、双向 RTP、本机 TTS/WhE2待证据审查 10-4同一次真实验收运行覆盖 10 站点串并行与 4 会话级联:12/12 门禁通过、实测加速 1.872×、24 份完整浏览E2待证据审查 10-5Qwen 3.7 Flash 正式运行完成三组各 25 Agent、17,280 步、两个虚拟日的完整社会实验;148,E1待证据审查 10-6同一次 v11 真实验收完成 3 个昼夜投票循环、6 次 LLM 工具→macOS say→OpenRouter 原生音E2待证据审查