最近在 GitHub 上翻到一个挺有意思的项目,叫 PenguinHarness。一开始是被它的 slogan 吸引的——“Let AI Build AI”(让 AI 来构建 AI)。 
说实话这种口号我见多了,大部分都是噱头。但看到作者是 LlamaFactory 的 Yaowei Zheng(郑耀威),我决定花点时间研究一下。毕竟 LlamaFactory 在微调圈子里算是标杆级的项目(70k+ Star),作者出手的东西一般不会太离谱。
用了一段时间,发现这东西确实有点东西。今天就来聊聊我的使用体验。
一句话解释 PenguinHarness:你用小段自然语言描述想要什么 Agent 应用,它自动帮你把代码、脚手架、运行说明全生成出来。
先说说它解决的是什么问题
搭过 Agent 应用的人应该都有体会:选框架、搭脚手架、配工具、调 Prompt、跑测试、改 Prompt、再测试……一圈下来,真正花在业务逻辑上的时间可能只占三成,剩下七成都在跟框架本身较劲。
PenguinHarness 的思路很直接:这些活儿,让 Agent 自己干。
你只需要用一句话描述需求,比如"帮我做一个 RAG 应用,读取 ./docs 目录,支持自然语言问答",它就会生成一个完整可运行的应用。
RAG 一句话解释:让 AI 先去翻资料,再根据资料回答你的问题,而不是瞎编。就像开卷考试和闭卷考试的区别。
我实测生成了一个 RAG 应用,token 成本大概 ¥0.2(用的是 DeepSeek V4 Pro)。这个价格说实话有点离谱——两毛钱,连个包子都买不到。
![建议配图:PenguinHarness 主界面截图,展示从输入需求到生成应用的流程]
核心能力:三个让我意外的点
1. 成本低得有点不真实
官方给的数据是:在数据分析任务上,PenguinHarness 的成本约为 Claude Code 的 1/70。
我一开始以为看错了,确认了一下确实是七十分之一。
它是怎么做到的?核心在于刻意精简的工具集。大多数 Agent 框架恨不得给你塞几百个工具,模型每次决策都要在海量选项里挑,token 哗哗地烧。PenguinHarness 反其道而行,工具数量少、接口干净,模型决策路径清晰,token 消耗自然就降下来了。
这就像点菜——菜单 200 页的餐厅,你光翻菜单就得半小时;菜单只有 10 道菜的馆子,坐下就能点。
2. RSI:Agent 自己迭代自己
RSI 是 Recursive Self-Improvement(递归自我改进)的缩写。听起来很玄乎,但它的实际流程很具体:
初始版本 Agent
↓
跑基准测试(benchmark-design + agent-evaluation 技能)
↓
找出哪里失分、为什么失分
↓
生成改进版本(agent-optimization 技能)
↓
存快照 + 版本对比
↓
重复,直到达标或人工介入
关键在于:评估和优化都是 Agent 自己完成的。人的角色变成了设定目标和最终审批。
而且每一轮迭代都有完整快照,可以回退到任意历史版本。不是那种"黑盒自动优化",整个过程是透明的、可以干预的。
3. 每一步工具调用都要经过你同意
SDK 里有个 approve 回调,设计得很妙:
for await (const output of session.run(
[userText("分析 ./data/sales.csv,输出月度趋势图")],
{
approve: async (toolCall) => {
console.log(`即将执行: ${toolCall.name}`);
return "allow"; // 或 "deny"
},
}
)) {
console.log(output);
}
每次工具要执行操作(读文件、跑命令、发请求),都会先问你一句"允许吗?"。这在生产环境里太重要了——你不会希望 AI 半夜偷偷把你数据库删了。
![建议配图:Trace 视图截图,展示工具调用链路和 token 消耗]
内置技能组:开箱即用的四大类
PenguinHarness 内置了一批技能(Skill),按用途分成四组:
| 办公生产力 | data-analysis、firecrawl、bento-slides、humanizer | 数据分析、网页抓取、做 PPT、文本润色 |
| 软件开发 | web-design、software-engineering、remote-claude-code | 建站、写代码、远程调 Claude Code |
| AI 应用开发 | penguin-sdk、penguin-cli、vllm、ollama、llamafactory | 接本地模型、部署推理服务 |
| Agent 调优 | benchmark-design、agent-evaluation、agent-optimization | 设计评测、跑分、迭代优化 |
其中 data-analysis 技能在官方基准里精度最高、成本最低,适合需要高频跑分析任务的场景。
怎么用?三种方式
方式一:桌面应用(最省事)
去 penguin.ooo/download 下载对应平台的安装包,内置服务器,不用碰终端。macOS 和 Windows 版都做了签名/公证。
方式二:npm 命令行
npm install -g @prismshadow/penguin-cli
penguin web # 打开 http://127.0.0.1:7364
方式三:一键脚本(Linux/macOS)
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
装好之后,配置模型、生成应用、交互式对话都是几行命令的事:
# 配置模型
penguin config model add \\
–provider deepseek \\
–model-id deepseek-v4 \\
–api-key sk-...
# 一句话生成应用
penguin run -m "创建一个 RAG 应用,读取 ./docs 目录,支持自然语言问答"
# 交互式对话
penguin chat
# 无 UI 服务器模式
penguin server
![建议配图:终端里运行 penguin run 命令后,生成应用的输出过程]
架构设计:几个值得说的细节
我翻了一下它的架构,有两点印象比较深。
Monorepo + 共享数据目录。桌面应用和 CLI 共用同一个数据目录:
~/.penguin/data/
├── agents/ # Agent 配置
├── sessions/ # 会话快照(RSI 每轮迭代存这里)
├── traces/ # 完整工具调用轨迹
└── models/ # 模型配置
这意味着你在 Web UI 里跑的会话,CLI 里也能看到,配置完全一致。
SDK 用 async generator 模式。把 Agent 执行流建模成"事件流"而不是单次返回,这样每个中间步骤都能被观测和干预。这个设计在需要审批的场景下特别顺手。
async generator 一句话解释:一种可以"边执行边吐结果"的函数,不用等全部跑完才拿到返回值。
和主流框架比,它有什么不一样
| 核心定位 | 手工拼积木 | 多 Agent 协作 | AI 构建 AI |
| 工具集规模 | 大(几百个) | 中 | 小(刻意精简) |
| 自我优化 | 无 | 无 | 原生 RSI |
| 本地优先 | 否 | 否 | 是 |
| 全透明轨迹 | 部分 | 部分 | 完整 Trace |
| 上手成本 | 高 | 中 | 低(一句话) |
| 模型兼容性 | 广 | 广 | 1000+ 模型 |
需要说明的是,这不是说 LangChain 或 AutoGen 不好。它们各有各的适用场景。PenguinHarness 更像是给"想快速验证想法"的人准备的一条捷径。
模型支持:基本啥都能接
支持任何 OpenAI 协议的 endpoint,覆盖 1000+ 模型:
- 国产:DeepSeek V4、Kimi K3、GLM 5.3、Hunyuan 3、Qwen 3.8 Max
- 海外:GPT 5.6、Gemini 3.7 Flash、Claude 5
- 本地:vLLM / Ollama 部署的任意模型
本地模型接入是内置技能,不是让你自己折腾。对不想依赖第三方 API 的团队来说,这点挺友好。
适合谁用?
我梳理了一下,这几类人应该会比较有感觉:
- 想快速验证 Agent 想法的开发者:不想花一周搭框架,想先看到效果再说
- 需要定期跑数据分析的团队:data-analysis 技能成本和精度都有优势
- AI 平台工程师:需要一套可解释、可审计的 Agent 开发基础设施
- 开源模型用户:通过 vLLM/Ollama 集成,完全本地跑,无 API 依赖
项目信息
- GitHub:github.com/Prism-Shadow/penguin-harness
- 官网:penguin.ooo
- Stars:1,900+
- Forks:198
- License:Apache-2.0
- 主要语言:TypeScript
- 安装:npm install -g @prismshadow/penguin-cli
同作者的相关项目还有 LlamaFactory(LLM 微调框架,70k+ Star),以及内置支持的 vLLM 和 Ollama。
我的看法
PenguinHarness 最有意思的地方在于它回答了一个问题:如果 Agent 已经足够强,为什么不让它来构建自己?
它没有试图做一个"什么都能干"的万能框架,而是把工具集收窄、把成本压下来、把过程透明化。这种克制在当下的 Agent 框架里反而比较少见。
当然,它也不是没有短板。项目还比较年轻(1.9k Star),生态和文档还在完善中。RSI 的实际效果在不同任务上可能有波动,需要自己跑一跑才知道适不适合你的场景。
但如果你正好想快速验证一个 Agent 应用的想法,或者想找一套成本可控、过程透明的 Agent 开发基础设施,花两毛钱试一下,不亏。
网硕互联帮助中心





评论前必须登录!
注册