分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

\n

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

Yo, whatss up ?! 大家好!

This is B&B in your house。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

我这段时间一直在琢磨自己整一个agent。这原因嘛,想必大家都懂,这天杀的anthropic不知道上辈子遭了咱们什么样的迫害,逮着咱就是一通乱封。

所以整一个属于自己的agent 是一件势在必行的事情了。

这不,Bubble Code (初始版本)就来了嘛!

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

(Claude Code: 你问我几分像从前。。。)

但其实一直还有两个问题困扰着我,一个是大部分的agent完成任务就是写完就算完了,有的就算说明了你要测试验证,它也会给你瞎写,还有一件事是,现在存的Skills实在太多了。

该怎么让Agent 在完成任务的同时,要交给我一个至少它自己经过五六七八轮仔细验证过的结果?以及成堆的Skills 除了盲目的删掉之外,有没有什么好的方法让他们有效的组合利用起来?

正好我这两天在GitHub上大刷特刷的时候,还真让我发现个宝藏项目,

OpenSquilla。 

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

他们刚刚升级到了0.4.1 版本。

我体验了下来,觉得它有几个做的非常有意思的地方,给了我启发。正好也给大家分享分享。

第一个,是coding task ,是专门用来做代码任务上的。

一般的agent 让它写代码,其实没啥毛病,都能写。但是写完之后也就是写完了,你也不知道它到底写了啥,有没有通过单元测试,就算没能通过,它也有可能给你伪造一条测试,说自己代码写的没毛病。

Coding task 就是为了解决这个问题的。

它会让Agent 写的代码必须全部通过测试之后,再停下,来提高交付的质量。

举个例子来说。

我最近特别喜欢下五子棋。但是这个五子棋绝对不是超级简单的那种我左右脑互搏,一会儿当黑棋,一会儿当白棋,来体验AI生成的前端的,那太低级了。

我想要的是至少有点难度,有点体验的,是有算法在背后的。

我尝试用MCTS ,也就是蒙特卡洛树搜索来作为我这个五子棋背后的算法。

(OK,你不用管MCTS的具体原理,只要知道用了它之后,你如果一个不当心,还真有可能下不过机器)

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

我的需求其实很难评,又要尽可能难,又要注意用户的游戏体验,然后我又只配了deeepseek 模型。活生生一副又要马儿跑,又要马儿不吃草的样子。

它会识别到这个是代码任务之后,会自动给我启动code-task。 然后开始给我哐哐一顿写。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

可以看到哪怕我用的是deepseek 的flash 模型,它也要花将近10分钟才能写好这个HTML文件,因为大部分的时间都用来进行测试验证了。

一个任务,通过了21个测试验证。

然后我随机玩了一把,录了一个屏,让大家感受一下它通过有效的测试的coding task 做出来的效果。哪怕这个模型是一个一般的模型。

靠北,我还下不过它哈哈啊哈。 这个体验也确实蛮好的,没有让我等待很长的时间。

第二个就更加有意思了,是MetaSkill,称之为元技能。  

Squllia内置了5个元技能。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

它和我们日常普通的说的Skills最大的区别就就在于,

我们平时说的Skills 其实是一个单点能力、一个任务模式、一组提示词或脚本。

但是Meta Skill更像是一个工作流,它自动把所需要的多个Skills都联结起来,进行编排,组成一个可以稳定运转的流程。 

举个例子,比如我有一个任务是写一篇关于loop engineer 的论文。

我可以直接通过meta skills 唤起内置的meta-paper-write 来进行写作。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

OpenSquilla 会自动开始执行这个Meta Skill,核对需要具备的条件。比如这里就会问我想要写的topic 是什么,然后希望的论文风格是什么样的。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

等我填写、选择好之后,会发现OpenSquilla会帮我把我的偏好,以Prompt的形式再输入给模型。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

而且这里其实有个细节是,OpenSquilla 在这里不是光单纯依赖一个模型的,它的内部机制里其实有个路由机制在帮你判断什么任务在什么样的阶段,适合什么样的模型。

主要目的其实就一个,省钱 。

就我相信大家不用我说也能感受到,

Agent时代对吧,Token烧起来真是肉疼。我的AI可能不疼,但我这心里是真疼。所以但凡有一个产品能愿意帮用户省Token的,我都要拍手叫好!

而且官方还特地跑了个测试,对于用路由,多模型组合这件事儿。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

一共25个任务,在OpenClaw里用Claude Opus 4.7 得分是0.9255,总成本是6.233; 但是在OpenSquilla 里,多个模型组合起来用,得分非常接近,但是成本只有0.68美金。。。

真的便宜到夸张了。。。

OKK,然后我们回来,接着可以看到这个meta skills 开始工作了。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

整个流程其实还是蛮复杂,它不是一般我们常见的那种一个Skill对应一个任务。

大体上是这样一个思路:

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

我又去翻了一下它的这个meta skill的md 文档,

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

是直接把多个Skill 组合在了一起,每个写论文的阶段,都有一个对应的Skill; 、

这样,它在运行的过程中,会自动派出多个子代理来完成章节的书写。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

子代理写完所有章节之后,最后还会派一个agent 来专门负责全文的修订。

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

最后展示一下它写的论文,还挺有模有样的:

分享一个让我大受启发的开源Agent项目,老板听完拍手叫好。

用Latex 排的版,非常专业。

这可是我一句话就吐出来的产物!下次老板问我啥是loop engineer 的时候,我就可以把这个玩意交给它了。

Agent发展到现在这个阶段,其实已经不只是模型之间的竞争了。

大家都知道模型是底层能力的决定因素,但真正拉开Agent体验差距的,往往是成本控制,Skills的组织方式,任务执行的成功率,以及整个流程是否足够稳定和可验证。

OpenSquilla给我的启发就在这里。

它做的事情表面看是工程优化,但本质上是在解决一个很现实的问题:

如何让Agent在复杂任务里持续稳定且有效地跑完一整条流程,同时不让成本和不可控性一起失控。

当这些能力被系统化之后,AI就不再只是一个会聊天或者会写代码的工具,而是可以真正进入生产流程,去承担具体交付结果的执行单元。

模型会持续进化,但真正能沉淀下来的,是一整套把任务稳定跑通的方法论,是把不确定性一点点减小的工程能力。

很多时候,决定上限的是你能不能把一堆看起来很聪明的能力,组织成一个真正靠谱的系统。

以上,

若觉得内容有帮助,欢迎点赞、推荐、关注。别错过更新,给公众号加个星标⭐️吧!祝您在2026年里天天开心,快乐,身体健康,万事如意!期待与您的下次相遇~

暂无评论,快来发表第一条评论吧!

📮 需求咨询