云计算百科
云计算领域专业知识百科平台

2 毛钱生成一个 Agent 应用,这个开源项目有点东西

最近在 GitHub 上翻到一个挺有意思的项目,叫 PenguinHarness。一开始是被它的 slogan 吸引的——“Let AI Build AI”(让 AI 来构建 AI)。 在这里插入图片描述

说实话这种口号我见多了,大部分都是噱头。但看到作者是 LlamaFactory 的 Yaowei Zheng(郑耀威),我决定花点时间研究一下。毕竟 LlamaFactory 在微调圈子里算是标杆级的项目(70k+ Star),作者出手的东西一般不会太离谱。

用了一段时间,发现这东西确实有点东西。今天就来聊聊我的使用体验。

一句话解释 PenguinHarness:你用小段自然语言描述想要什么 Agent 应用,它自动帮你把代码、脚手架、运行说明全生成出来。


先说说它解决的是什么问题

搭过 Agent 应用的人应该都有体会:选框架、搭脚手架、配工具、调 Prompt、跑测试、改 Prompt、再测试……一圈下来,真正花在业务逻辑上的时间可能只占三成,剩下七成都在跟框架本身较劲。

PenguinHarness 的思路很直接:这些活儿,让 Agent 自己干。

你只需要用一句话描述需求,比如"帮我做一个 RAG 应用,读取 ./docs 目录,支持自然语言问答",它就会生成一个完整可运行的应用。

RAG 一句话解释:让 AI 先去翻资料,再根据资料回答你的问题,而不是瞎编。就像开卷考试和闭卷考试的区别。

我实测生成了一个 RAG 应用,token 成本大概 ¥0.2(用的是 DeepSeek V4 Pro)。这个价格说实话有点离谱——两毛钱,连个包子都买不到。

![建议配图:PenguinHarness 主界面截图,展示从输入需求到生成应用的流程]


核心能力:三个让我意外的点

1. 成本低得有点不真实

官方给的数据是:在数据分析任务上,PenguinHarness 的成本约为 Claude Code 的 1/70。

我一开始以为看错了,确认了一下确实是七十分之一。

它是怎么做到的?核心在于刻意精简的工具集。大多数 Agent 框架恨不得给你塞几百个工具,模型每次决策都要在海量选项里挑,token 哗哗地烧。PenguinHarness 反其道而行,工具数量少、接口干净,模型决策路径清晰,token 消耗自然就降下来了。

这就像点菜——菜单 200 页的餐厅,你光翻菜单就得半小时;菜单只有 10 道菜的馆子,坐下就能点。

2. RSI:Agent 自己迭代自己

RSI 是 Recursive Self-Improvement(递归自我改进)的缩写。听起来很玄乎,但它的实际流程很具体:

初始版本 Agent

跑基准测试(benchmark-design + agent-evaluation 技能)

找出哪里失分、为什么失分

生成改进版本(agent-optimization 技能)

存快照 + 版本对比

重复,直到达标或人工介入

关键在于:评估和优化都是 Agent 自己完成的。人的角色变成了设定目标和最终审批。

而且每一轮迭代都有完整快照,可以回退到任意历史版本。不是那种"黑盒自动优化",整个过程是透明的、可以干预的。

3. 每一步工具调用都要经过你同意

SDK 里有个 approve 回调,设计得很妙:

for await (const output of session.run(
[userText("分析 ./data/sales.csv,输出月度趋势图")],
{
approve: async (toolCall) => {
console.log(`即将执行: ${toolCall.name}`);
return "allow"; // 或 "deny"
},
}
)) {
console.log(output);
}

每次工具要执行操作(读文件、跑命令、发请求),都会先问你一句"允许吗?"。这在生产环境里太重要了——你不会希望 AI 半夜偷偷把你数据库删了。

![建议配图:Trace 视图截图,展示工具调用链路和 token 消耗]


内置技能组:开箱即用的四大类

PenguinHarness 内置了一批技能(Skill),按用途分成四组:

技能组代表技能能干什么
办公生产力 data-analysis、firecrawl、bento-slides、humanizer 数据分析、网页抓取、做 PPT、文本润色
软件开发 web-design、software-engineering、remote-claude-code 建站、写代码、远程调 Claude Code
AI 应用开发 penguin-sdk、penguin-cli、vllm、ollama、llamafactory 接本地模型、部署推理服务
Agent 调优 benchmark-design、agent-evaluation、agent-optimization 设计评测、跑分、迭代优化

其中 data-analysis 技能在官方基准里精度最高、成本最低,适合需要高频跑分析任务的场景。


怎么用?三种方式

方式一:桌面应用(最省事)

去 penguin.ooo/download 下载对应平台的安装包,内置服务器,不用碰终端。macOS 和 Windows 版都做了签名/公证。

方式二:npm 命令行

npm install -g @prismshadow/penguin-cli
penguin web # 打开 http://127.0.0.1:7364

方式三:一键脚本(Linux/macOS)

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

装好之后,配置模型、生成应用、交互式对话都是几行命令的事:

# 配置模型
penguin config model add \\
–provider deepseek \\
–model-id deepseek-v4 \\
–api-key sk-...

# 一句话生成应用
penguin run -m "创建一个 RAG 应用,读取 ./docs 目录,支持自然语言问答"

# 交互式对话
penguin chat

# 无 UI 服务器模式
penguin server

![建议配图:终端里运行 penguin run 命令后,生成应用的输出过程]


架构设计:几个值得说的细节

我翻了一下它的架构,有两点印象比较深。

Monorepo + 共享数据目录。桌面应用和 CLI 共用同一个数据目录:

~/.penguin/data/
├── agents/ # Agent 配置
├── sessions/ # 会话快照(RSI 每轮迭代存这里)
├── traces/ # 完整工具调用轨迹
└── models/ # 模型配置

这意味着你在 Web UI 里跑的会话,CLI 里也能看到,配置完全一致。

SDK 用 async generator 模式。把 Agent 执行流建模成"事件流"而不是单次返回,这样每个中间步骤都能被观测和干预。这个设计在需要审批的场景下特别顺手。

async generator 一句话解释:一种可以"边执行边吐结果"的函数,不用等全部跑完才拿到返回值。


和主流框架比,它有什么不一样

维度LangChainAutoGenPenguinHarness
核心定位 手工拼积木 多 Agent 协作 AI 构建 AI
工具集规模 大(几百个) 小(刻意精简)
自我优化 原生 RSI
本地优先
全透明轨迹 部分 部分 完整 Trace
上手成本 低(一句话)
模型兼容性 广 广 1000+ 模型

需要说明的是,这不是说 LangChain 或 AutoGen 不好。它们各有各的适用场景。PenguinHarness 更像是给"想快速验证想法"的人准备的一条捷径。


模型支持:基本啥都能接

支持任何 OpenAI 协议的 endpoint,覆盖 1000+ 模型:

  • 国产:DeepSeek V4、Kimi K3、GLM 5.3、Hunyuan 3、Qwen 3.8 Max
  • 海外:GPT 5.6、Gemini 3.7 Flash、Claude 5
  • 本地:vLLM / Ollama 部署的任意模型

本地模型接入是内置技能,不是让你自己折腾。对不想依赖第三方 API 的团队来说,这点挺友好。


适合谁用?

我梳理了一下,这几类人应该会比较有感觉:

  • 想快速验证 Agent 想法的开发者:不想花一周搭框架,想先看到效果再说
  • 需要定期跑数据分析的团队:data-analysis 技能成本和精度都有优势
  • AI 平台工程师:需要一套可解释、可审计的 Agent 开发基础设施
  • 开源模型用户:通过 vLLM/Ollama 集成,完全本地跑,无 API 依赖

项目信息

  • GitHub:github.com/Prism-Shadow/penguin-harness
  • 官网:penguin.ooo
  • Stars:1,900+
  • Forks:198
  • License:Apache-2.0
  • 主要语言:TypeScript
  • 安装:npm install -g @prismshadow/penguin-cli

同作者的相关项目还有 LlamaFactory(LLM 微调框架,70k+ Star),以及内置支持的 vLLM 和 Ollama。


我的看法

PenguinHarness 最有意思的地方在于它回答了一个问题:如果 Agent 已经足够强,为什么不让它来构建自己?

它没有试图做一个"什么都能干"的万能框架,而是把工具集收窄、把成本压下来、把过程透明化。这种克制在当下的 Agent 框架里反而比较少见。

当然,它也不是没有短板。项目还比较年轻(1.9k Star),生态和文档还在完善中。RSI 的实际效果在不同任务上可能有波动,需要自己跑一跑才知道适不适合你的场景。

但如果你正好想快速验证一个 Agent 应用的想法,或者想找一套成本可控、过程透明的 Agent 开发基础设施,花两毛钱试一下,不亏。

赞(0)
未经允许不得转载:网硕互联帮助中心 » 2 毛钱生成一个 Agent 应用,这个开源项目有点东西
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!