给一个本地LLM同时接8个代理 — Ollama并发吞吐量实测
我以为并行触发子代理会让本地模型也随之变快。实测发现默认的Ollama会把请求排队处理,接8个和接1个的总吞吐量一样。我在M1 16GB上实测了调高OLLAMA_NUM_PARALLEL带来的吞吐增益,以及它的代价。
标签
4篇文章
我以为并行触发子代理会让本地模型也随之变快。实测发现默认的Ollama会把请求排队处理,接8个和接1个的总吞吐量一样。我在M1 16GB上实测了调高OLLAMA_NUM_PARALLEL带来的吞吐增益,以及它的代价。
我在 Vitest 4.1.7 中直接验证了模拟 Anthropic SDK messages.create() 和流式响应的实战模式。涵盖 vi.fn().mockImplementation(function(){...}) 与箭头函数的区别、用 async function* 生成器重现 SSE 流的方法,以及 9 个测试在 142ms 内通过的完整过程。
深度解析2026年5月Code with Claude SF大会发布的Dreaming、Outcomes和多代理编排技术架构。剖析Harvey 6倍数据的背景、LLM-as-judge的产品化,以及自我改进循环的治理风险。
Claude Code Routines 只需一次配置提示词、代码库和连接器,即可在 Anthropic 基础设施上自主运行。本指南详解定时调度、API 调用、GitHub 事件三种触发方式的设置步骤,并分享从 PR 审查自动化到文档漂移检测的实战用例。