V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sentinelK  ›  全部回复第 8 页 / 共 85 页
回复总数  1691
1 ... 4  5  6  7  8  9  10  11  12  13 ... 85  
5 月 8 日
回复了 skuuhui 创建的主题 程序员 在 AI coding 上的困境,想做个调研
@skuuhui 这个直觉没错的,但是对应的账应该反过来算。
1 、你降低了你自己的心智负担,你就更有时间、精力来给模型兜底。
2 、目前主流的 Agent 思路是 loop + 审核抽卡,所以误差的积累很大程度上可以靠增多多抽卡次数来抹平。也就是靠烧更多的 token 来换你更少的干预。
3 、目前模型的能力更强了,最优解的统计学优势更明显,即便上下文有一系列错误,也会无视或者自行纠错。
5 月 8 日
回复了 skuuhui 创建的主题 程序员 在 AI coding 上的困境,想做个调研
btw:使用大模型,核心矛盾点,就是你需要投入多少精力来进行控制。这和企业管理的底层逻辑相通。

你给员工更大的自由,他就更能发挥上限,代价就是捅娄子的能力也更强。
你越依赖微操,你的员工的能力就越难以发挥,也就越难以突出你的人力优势。这里要 @蒋委员长
5 月 8 日
回复了 skuuhui 创建的主题 程序员 在 AI coding 上的困境,想做个调研
1 、我会干预其架构设计。不是别的,是因为我要为我的 Agent 兜底,他的技术选型我看不懂我就兜不了……
2 、看心情,所以我目前在尝试可能的情况下,让 hermes 接管我的代码仓库和文档,让他帮我去调用 claudeCode/openCode 。我只提需求和把控设计。
3 、同理,hermes 可以大幅度降低人工提供上下文的心智负担。
5 月 7 日
回复了 AIgogo 创建的主题 随想 AI 大模型的能力边界越发清晰
@ZX16815 但现实就是,因为 LLM 的不透明性,导致普遍的头部供应商都“无良”。

一个商业逻辑不成立的领域,讨论其理想情况如何如何,在我看来是没有实际意义的。
5 月 7 日
回复了 AIgogo 创建的主题 随想 AI 大模型的能力边界越发清晰
“知道了工具怎么用,然后探索把工具用起来和用好。 那么人类本能对未知的神秘感和焦虑感也就自然消除”

不会的。
因为目前 LLM 的模式对于消费者而言是全黑盒模式。消费者唯一只知道,调用了某个公司的一个 API 服务。

数据输入输出是否被污染?不知道。
数据究竟被什么模型加工?不知道。
究竟收费多少钱?不知道。
我的数据会被如何对待?不知道。
未来 LLM 公司是否会因为利益、政策等原因断供、修改条款?不知道。
模型的输出能力是否稳定?不知道。

在以上都完全未知的前提之下,谈“工具属性越来越清晰”,是纯扯淡。

你家的锤子不会今天你凿完三颗钉子,明天管你要 100 美元的。
也不会今天你凿完三颗钉子,明天告诉你你凿的钉子太多,锤子受不了,要么折价退款,要么每天只能凿一颗。
更不会今天凿完钉子,明天变成塑料玩具。
mlx 的 qwen3.6-35B-A3B 试试看
btw:

如果只是想了解 Agent 的理念,我觉得这个视频的信息量已经够了: https://www.bilibili.com/video/BV1dpQTB3EXg?spm_id_from=333.788.videopod.sections&vd_source=0ef6494d0ac82c1df8c1a6cc5e8ef08c
@newtype0092 是的,毕竟 LLM 的本质就是统计学概率续写。各种工程化只是在利用目前 LLM 模型算法的甜点,争取能够提升最终答案落在全局最佳的比例。

而且 Agent 底层理念就在于,我承担返工的风险,烧更多的 token ,但是要一次性(或者说非人工干预下)成功。

高效利用 token 的理念则恰恰相反。
对了,还忘了一点,到了生产力阶段,家庭用显卡就不现实了。

因为生产力显卡的噪音非常大。
@stimw 个人场景最大的优势是不会暴露隐私。而且有去掉拒绝模块的模型可用(可以忽略道德、法律、伦理等因素)。
在显存够用的前提下,显卡的解码能力远大于统一内存方案(不管是 GB10 、AMD MAX+395 ,还是 mac )
反之,统一内存方案更容易达到更大的内存级别(能跑更大参数的模型)


所以,如果你要跑快,只能选显卡。
如果你要选能用,可扩展性,尝试更多模型,只能选统一内存。(为了大参数换显卡,基本上你整台 PC 也都要换)
Trae 的工程化就是有点问题。

可以用 claude code (可以切自定义的 API ,只要支持 anthropic 格式)或者 openCode 再试试。

vscode 还有 Cline 等其他的第三方工程化插件可以实践。
因为 LLM 的工程实践有个自证陷阱。

你没法证明你的 Agent 流程,或者说工程化产品相比裸模型/竞品是更优、更有效的。
所有人都在吹自己对于 LLM 落地的思路有多么高大上。但聊到实际产出又都阳痿了,因为他们没法对实际产出负责。

但是有一些思想还是有一定的启发作用。

比如任务拆分,利用的就是 LLM 对于复杂度 1*N 的任务执行效果比复杂度 N 的效果好的特性。
比如多 Agent 互相监督,利用的是 LLM 注意力机制有限的限制,通过多个 LLM 推理进程左右互搏来实现更好的效果。


剩下的一些纯 marketing 角度的概念,笑笑就好。
@matafu 确实,一边作者强调 memery 只有 2200 字符长度。hermes agent 这边随便什么垃圾信息都 memery update ,直到装满。
看了下这个“自我进化 skill”,这有点太损失稳定性了吧,他会让 hermes 去改自己的代码。
@carrymaniac 如果只是对话任务,openCode 效果理论上讲是优于 hermes agent 的。

他俩是产品设计角度的不同。

openCode 能力聚焦在 Coding 上,hermes agent 是泛用性助手(系统自带 message gateway ,定时任务,有人格的概念等)。

举个不太恰当的例子,ClaudeCode 是一辆布加迪跑车,openCode 像是一个 F1 赛车,hermes agent 是家用 SUV 。
@unnyxi 如果是默认的思考长度的话,是的,但是 27B 目前还打不过 flash 的 max 思考长度
4 月 28 日
回复了 liyafe1997 创建的主题 OpenAI 有没有类似 ChatGPT 这种 Agent 能力的 API
@liyafe1997 想证明这一点很简单,你重新开一个 chatGPT 账户,看还能不能做到你的那个“它”的感觉,如果做不到,那就是上下文的差距导致的。
4 月 28 日
回复了 liyafe1997 创建的主题 OpenAI 有没有类似 ChatGPT 这种 Agent 能力的 API
@liyafe1997 所以你要的其实是你的历史上下文和 memery 导出。你越觉得 chatGPT 好用,你暴露给你本地 Agent 的上下文就越少。

我并不认为是 Agent 工具能力的差距,这是信息密度的区别。
4 月 28 日
回复了 liyafe1997 创建的主题 OpenAI 有没有类似 ChatGPT 这种 Agent 能力的 API
@liyafe1997 首先,“差了不是一点半点”这个评价是如何做出的?你用的其他 agent 工具确定和 chatGPT 是相同的基座模型吗?

如果模型相同,那你这个需求就很奇怪,你继续用 chatGPT 、乃至 codex cli 不就可以做到了么?为何非要 API 呢?

你使用 API 不是反而抛弃了 chatGPT 本身的图形化优势了么?
1 ... 4  5  6  7  8  9  10  11  12  13 ... 85  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3605 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 29ms · UTC 10:19 · PVG 18:19 · LAX 03:19 · JFK 06:19
♥ Do have faith in what you're doing.