
关于大语言模型的若干讨论
当我在构建BeCode的时候,我其实苦于国内的AI模型不好用,国外模型用起来非常贵。
AI圈发展日新月异,我有必要先说明当时我写BeCode的说明:DeepSeek-v4-flash调用起来非常的便宜,见以下表格
| 类别 | 价格(人民币/每百万词元) |
|---|---|
| 输入(缓存命中) | 0.02元 |
| 输入(缓存未命中) | 1元 |
| 输出 | 2元 |
这个价格跟白送没啥区别了。尽管ds的工具调用能力有限,但是我认为倘若给它的反馈是自动化的,那么它的工作完成度是不是会更高一些?
因此我构建了BeCode。有趣的是,自它的第一次开发完成后,我便可以使用BeCode实现自我迭代开发了。我提供给它的工具仅有文件读写和命令执行,但是它能够在我的要求下为自己编写了网络检索工具,以及优化了UI表现。见知乎文当智能体实现有监督的自我迭代
当时我归纳了几点有意思的结论:
- AI实现自我迭代仅需要命令执行的工具,它可以为自己创造一切其他工具;
- 少即是多。
当时我还相信,既然fable5代表着模型进步,会消解之前所做的所有跟提示词相关的工作,那么反推过来,能否通过编排和提示词控制,让现有模型达到那种高度?
后来多次使用后,我认为模型的智力水平能够借助BeCode得到一定的提升,但是无法打败更好更大的模型,这一点在kimi k3出来后尤为明显。
2026年7月,月之暗面的k3模型发布,国内总算有了gpt和claude的平替模型。我买了一个月的会员,真实感受到了k3模型和国内其他模型的代际差距————我只需要描述需求,k3能为我很好的实现,并且极为细心地做好边界处理,而这一点当时的glm-5.2还做不到。更重要的是k3是多模态的,它的前端实现能力也是非常优雅,而且往往一针见血地分析问题,精妙地实现各种你想要的动画效果。使用k3后,我越发觉得技术平权是进行时。同时k3的大量使用也给我带来了新的思考:当技术不再成为问题,我们到底需要什么?
实际上,我认为我们需要的,是对方向的把控,对问题的细致描述,以及审阅代码的能力。这是后端。回到前端,依赖人的地方就更明显了:AI不知道你想要什么样的用户交互界面。用户用起来感觉界面好看,背后的设计的文字描述可能是迭代了数十版反复调试才得以确定的,粗略的描述所设计的内容往往不够新意和令人乏味。
后来我尝试使用kimi设计产品————深蓝桌宠。做软件原型很快就完成了,但是为了正规上市和出售,我不得不花了更多的精力在非技术层面的事务上,开通域名,进行备案,上架淘宝,设计正版验证链路与后台管理链路,制作宣发视频,直到最后打通所有的逻辑。AI确实能够很好的帮助我编写代码,但是它对复杂的现实世界,资料的填写就显得很慢而且令人不够放心。
宣发视频见:
也许,可以装进deepseek harness中?
不过令人遗憾的是,该项目受到了双重质疑:版权问题与付费意愿。网络的评论令人感到心累,大部分的精力付出打了水漂。
也有一个好消息,我用一个比较简短的时间来验证了这件事的不可行性。之后我同学又为我介绍了steam上的虚拟商品,我反而感觉steam上的机会更大一些。
从另外一个角度来看,随着AI的能力提升与技术平权,年轻一代对于AI编程的商品其实是越来越不认可,想通过AI快速变现简直是天方夜谭。尽管我的商品blue-pet定价6元,他们依然会质问:这东西值6元?我为何不使用AI来做?
我没法很好的回答这个问题,过度的展示会丢失自己花钱用AI生成的美术资产,而介绍技术层面又更让产品进一步的贬值————复现变得更加容易了。6元,在当下的社会还不够买一杯奶茶,但是他们依然不愿意为此付费。
