|
|
本帖最后由 dishao 于 2026-8-31 21:50 编辑
之前在调试xinclaw的时候遇到了一个问题: LLM能获取到哪个方块在哪、这个横截面的地形大概是什么样的, 但是他不知道前面这个区块到底是房子还是一个塔
于是, 我训练了CLMCP系列模型, 可以判断一个立体的MC地形和你语言描述的相似度
相比视觉多模态方案 这个方案不需要支持视觉的模型, 也不需要一个图片几千tokens的高消耗, 更省去了遮挡造成的模型探索成本
实测, 使用这个模型的agent完成任务更快, 更省token
demo网址: https://clmcp.thisdlit.com/
目前模型还需要进行一段后训练, 暂时不开放API, 后面会发布支持使用该模型的xinclaw新版本
|
|