股票配资卖出技巧
昨天,MiniMax 在发布 MiniMax Code CLI v0.4.12 版本时,同时宣布了 MiniMax Code CLI 正式以 MIT 协议开源的消息。

如果只是又多了一个编程 Agent,那么说实话,这早已不算是什么稀奇的事,但是令老狐感到意外的是,它的性能表现可以说是相当不错。
按照 MiniMax 官方的说法:在 FrontierHarness Eval 中,MiniMax Code 搭配 Kimi K3 完成了 30 个软件工程任务中的 23 个,通过率达到 76.7%,成功任务的中位耗时只有 4 分 33 秒,从跑分数据来看,甚至超过了最近极其流行的 Pi。

但是它的水平真的这么强吗?
今天就让老狐带着大家一起测试一下它的性能表现究竟如何,不过在开始测试之前,老狐先和狐友们简单介绍一下什么是 Agent Harness,也就是 MiniMax Code CLI 究竟是个什么东西。
模型虽强,但干活不能没有 Harness
如果我们将 Deepseek、Kimi 和 Minimax 这些大模型比作大脑,那么Deepseek Harness、Kimi Code 和 Minimax Code CLI 就像是给这个大脑配上了眼睛、手,还有工具箱。
如今,编程 Agent 可以完全自主地完成读取代码、搜索代码、修改代码、调用工具运行测试,再阅读测试结果,进而进行下一步修改。

这一整套流程所需的内容上下文、需要调用的工具,以及 AI 权限边界,都是由 Harness 赋予、决定的。
元股证券:ygzq.hk可以说,如果没有 Harness,那么大模型就相当于一个没有调料和厨具的厨师,脑子里只有菜谱,什么都做不了。
回到这次 MiniMax 发布时所使用的 FrontierHarness Eval 基准图,老狐觉得最有意思的地方也正在于此,它就是要尽可能使用相同的模型、执行相同的任务,从而比较不同 Harness 之间的性能差距。

同样使用 Kimi K3,不同 Harness 的任务通过率在50%~60% 左右浮动。而使用 MiniMax Code CLI 时,通过率就猛涨到了76.7%。
不过毕竟这也不是我们亲眼看到的数据,真想知道 MiniMax Code CLI 和其他 Harness 的差距,老狐认为还得亲自比较一下。

所以这次老狐就用自己常用的 Pi 与 MiniMax Code CLI 都采用相同的模型 MiniMax M3,并执行完全相同的任务,看谁的表现更出色。
同一个 MiniMax M3,换个 Harness 能差多少?
鉴于 MiniMax M3 是一款多模态模型,所以本轮测试便采用了比较困难的「图片倒推产品」测试方法。
老狐只会交给 MiniMax Code CLI 和 Pi 中的 MiniMax M3 一张模糊的图片,以及一段提示词,全程保持 0 干预的原则。
先让狐友们看一下本次测试的图片:

这张图片乍一看就有非常多错误和不合理的地方,比如侧边栏突出的升级会员卡片、中部黑乎乎的图表,以及右侧没能完整呈现的内容,这便是老狐故意为之的考验,看看谁能更好地还原、实现更出色的效果。
本次使用的提示词如下:


从整体实现完成度来看,我认为可以打 80 分,主要的扣分点在于:左侧边栏的颜色与我们的参考图有比较明显的差异,从原本的蓝灰色直接转为了紫色,而且中部三个横向卡片的图标也比较粗糙。

而反观 MiniMax Code CLI 的表现,它的优势比较明显,无论是整体配色风格的还原,还是原图中错误内容的修复、不合理内容的优化,都做得比较好。
值得一提的是,在一些细节完整度上,比如中部三个卡片中的图标,也做得非常好,而且信息卡片的层级和配色都比较清晰。

这里老狐比较诧异的是,作为 Pi 的深度用户,没想到 MiniMax Code CLI 对任务目标的把控做得也很好,比较明显的是,它的迭代轮次相比 Pi 少了一倍。
这意味着它能让模型更精准地了解到当前任务的完成度,不必过度优化,整体用起来会更省 Token,直白一点说,就是更省钱。
开源,更放心的理由
除了性能,这一次还让我比较惊喜的是,Minimax 在开源声明中直言不讳地表示:「我们希望通过开源,让开发者能够审视工具调用和权限处理,构建可靠的企业级应用。也让社区参与发现问题、贡献修复。让使用更放心,让安全机制在实际使用和审查中持续完善。」

这种开放、坦诚的姿态,也让 MiniMax 在如今动辄闹出侵犯用户隐私数据的 AI 圈变得有些不同。
这里老狐提一个比较意思的事情,就在今年 7 月的时候,马斯克旗下的 SpaceX 刚推出 Grok Build(Grok 官方 Harness)不久,就被国外的安全研究员发现,Grok Build 存在将用户的代码文件打包并传到服务器的问题。

尽管为此马斯克专门发帖回应,并且表示会删除此前上传的所有代码数据,但此番对 Grok Build 口碑的打击仍然是非常大的。
所以,对于权限极高、且深度介入用户数据资产的 Agent 来说,开源尽管不意味着绝对安全,但至少意味着开发者可以审查它的代码,排查其中是否存在侵犯隐私的问题。
北京配资炒股的开源,这也代表着开发者能够更放心地使用它,即便是普通用户,用起来也会更踏实、安心。
作为深度 Vibe Coding 爱好者,老狐最近半年有一个非常强烈的感受,对于如今大部分轻量编程任务,这个模型的表现已经非常不错了。

在我们关注哪个模型写代码的能力最强的同时,我认为也需要将一部分的注意力转移到 Harness 的选择上,一个出色的 Harness 的确能够「钱半功倍」,花一半的钱,就能得到一样甚至更好的结果。

所以,老狐想说,如今模型决定了 Agent 能力的下限,而 Harness 则决定着模型的上线,所以在未来 Coding Agent 的竞争势必会比眼下的局面更为激烈,老狐也期待能有更多互联网厂商加入进来,毕竟工程优化和 Harness 用户体验的设计,也算是他们的拿手好戏。
撰稿:YX
配资之家开户平台提示:本文来自互联网,不代表本网站观点。