知识库

常见问题

从技术到待遇,你需要知道的一切

这是一个数据收集网站,我们之后会将所有需要的元素添加到网站上。

现有模型能在短期以内非常正确得去聊天,因为它看过所有人类史上的文案。但聊的时间一长,就会有很多的问题;遗忘现象,情感不对齐现象,无目的聊天现象等等。这些都来自于模型自身的缺失。

利用SFT(大量数据)去让单一模型学会高阶智慧,体现聊天中会出现的情感,及赋予知识(背景,能力)等模型本身应该/不应该知道的复杂事件。

RL是个在已有能力的情况下的分布收拢,前提是模型必须已经有几率自主产生对的问题情况下的反馈。但现有模型的问题是它们在数据中就没见过有着详细背景,详细设定后闲聊的场景。

在训练同一模型时,模型知识的交叉程度普遍偏高。更大的问题是,我们目前并不知道在什么数据量级下模型能学会高阶知识问题。目前预训练中我们的猜测是500万数据集可能能让模型学会所有知识与行为。

网上数据类型包括贴吧聊天、同人文、小说、故事集等,但它们都有各自的问题。番茄网:"编剧说了,不是爽文直接拒接"。老福特:黄文过多,且故事性缺失。

微信数据中没有角色对话的背景。如果想训练模型学会用有背景说话的内容,反推背景过于困难。

理论上来讲小说/长故事里的内容是最符合对话场景的,但书本中记忆与动机对角色的发展同样需要构建。

模型自己本身就不能做好的事情,augment了之后仍然很难做好。

我们现有记忆模块放在了角色设定上:Values(价值观)、E(经验)、J(主观判断)、A(能力)。其中,记忆模块需要每天更新这些内容,从而达到事实的对角色的世界观进行认知改变。

多模块的难度也同样在于数据的研发。我们在未来会引入MCP(Model Context Protocol)能力,让AI能够收集并在聊天中给你发送它觉得有趣的B站视频。同时,我们将引入多模态能力,每天为你生成充满荒诞感的梗图并发送给你。这会让AI主动和你分享乐趣,成为你真正的朋友。

游戏 - 理论上这些能力并不难训练。文案 - 一起写方案这个难题在于对于方案的品味及能力。发邮件 - 现在能干到。做电机设计等 - 非常技术的活,我们实验室可能暂时没那个钱。

我们的数据结构本身就是最洁净的处理过后的数据;直接用就行了。

我们的模型是为了社会公益型而创造出来的。为了那些在新时代受挫,孤立的无用阶级提供出路,走向幸福的AI。我们对沉迷的对策是提供场景让大家走出房门,在焦虑的时候拉你一把。

我们是初创,没钱没人草台班子。但我希望我们的直率,对解决实质问题的意义能吸引你加入我们。

现在的问题其实是我们的产品不够好。好了,赚钱了才有人关心。到时候给他们版权费。况且,角色设定改到最后可能也只有灵魂差不多了。

他们走错了路。做这么个数据集又是个大工程,且不一定能成功。我们的期望是我们的理解能领先几个维度。

赚钱有几方面:和游戏挂钩/做聊天平台订阅,和游戏公司合作,实在不行卖数据。

真想找女朋友/男朋友的人都会去的,没主观能动性的人也都不会去找的。

现在的期望是能在一两个月时间内找到能有资质的人之后通过他们一对一进行聊天。筛选过程通过写的文案进行评判。

脑子一关就行了,想到啥说啥。大家都知道自己只要一两个知己及一个群体去闲逛,那想到啥说啥展现自己才是正确的聊天方式。

很考虑写手能力了,需要写手自己斟酌。

请参考角色背景部分的详细设定。

我们现在需要写文案的编辑/能融入角色的演员。想要上手的话可以参观角色设定集网站及写作内容须知。

其实我们不需要写程序的,但我们需要和人说过话的。只有真正经历过才知道一个实验室能有什么样的氛围。

可能不需要,但你可以看看有多少人能和你有共同背景写一个角色。

暂定待遇是100元1000字,之后有生存问题或数据量问题之后再考虑。