我在研究中会用大语言模型,但日常生活中也会用一些,下面分享一些我在用的方案:
- 整理旅游照片,重现场景
我现在一年拍不了几张照片,但曾经也是到处拍照的选手,只是拍了备份了就基本再也不会看了。现在我会把某一段时间旅游的照片配合当年做的行程攻略直接扔给大语言模型,让其整理成游记。因为我拍的博物馆展品比较多,大语言模型可以帮我总结推测出我当时关注的展品及可能的关注点,也能识别展品下文字,整理出的游记比我的回忆更鲜活生动。现在很多云端相册有类似功能,但真用过会发现单纯照片的上下文不够,配上你当时做的攻略路线效果好很多,当然前提是有路线,可以让大语言模型读你的邮件生成出预定信息。上下文越丰富,游记就越有意思,也会看到大语言模型对你当时心态的推测,虽然很多属于胡编乱造,但记忆本身也会做同样的事。记录与回顾是同等重要的。
- 处理音频视频
虽然文本处理是大语言模型比较擅长的,但端侧模型从音频视频端提取信息也很有用,当前优质文本语料稀缺,很多其实是从音频视频里提取的。这里不是说直接给支持多模态的大语言模型发送音频视频文件,是要配合一些提取音轨与语音识别来简化处理,例如发送一个视频网页地址,让大语言模型提取字幕或自动识别字幕,然后总结这类,用本机资源就够,不需要搞很复杂,也不用去调别人写的skill,当前大语言模型的水平自己要搞不定那也不要用了。只要你入场足够晚,就要相信模型已经足够强,不必路径依赖。另外现在市面上已经有能做全天候音频监控给个人生成待办事件或日记的产品与开源方案了,智能眼镜手环手表胸针吊坠卡片都有,但事实上我日常还是用手机录音机更多,开被动监听还是有点抵触。
- 重新读书
以前读书是一页页翻,后面是听别人的二手解读与看书评,但很容易被人夹带私货。现在主流大语言模型的上下文是足够放一本书的,都不用rag,因此现在读书就是直接扔文本做幻灯片或脑图之类的。我主要尝试的都是之前读过的书,上下文有了全文后就类似直接跟作者对话,会发现自己之前没关注到的点。提示词也可以进行调整让不同价值观的人解读同一本书做一页幻灯片,这就有点上帝视角看罗生门的样子,一千个人眼里有一千个哈姆雷特,让一千个哈姆雷特辩论会出现什么会超越与作者对话转到与读者们对话。这里没有平行宇宙,只有同一宇宙下不同虚拟个体的交互,全是私货不会有共识,不要关注别人关注什么,要关注他不关注什么。
- 翻译
字幕组是我所经历互联网时代的一个奇迹。一群人凭兴趣爱好去翻译外国资源传给本国民众的行为在发达国家里违反了知识产权法律,发展中国家理论上不会有这么闲的人,但这却是历史上存在现在也存在的一个团体。不过,现在翻译这件事已经可以做到本地自动化了,最复杂的图文混排的漫画现在也能实现,原理上先识别图片里存在文字的区域,然后对区域做OCR,识别出文字进行翻译,然后对区域进行文本替换,我尝试用本地模型翻译了漫画,对比人类翻译效果谈不上完美,但能看明白了,完美主义者请绕行,如果你能给够漫画的背景人设,效果会更好。翻译这个活是我非常确定本地0.6b模型就能做的,如果是漫画考虑上下文的话7b模型就够用,理论上手机算力都可以搞,但考虑到知识产权,工具还是交给人工智能造吧。
- 自动化追新
这个其实前AI时代就有,例如cron任务,之前是需要自己写脚本,现在是全部交给大语言模型来做,不用关心实现细节。很多人养龙虾最主要应用场景就是生成日报,但三分钟热度过了就不看的原因也很简单,你不知道大语言模型不知道什么,提示词过于简单。还是前面的道理,当你用的模型越先进,其对你意图的揣测就越准,这形成了普通人对模型好坏的初级判断。但实际上同样的模型,通过修改提示词也能直接提高完成任务的表现,现在管这玩意叫harness。我很反感那些因为自己无能就说模型不行的评论,真想用好大语言模型,就扎扎实实从本地小模型的提示词优化练起来,去理解拆解复杂任务让模型做擅长的事,不要心浮气躁,当然你也可以再等下一代更智能也更贵的模型去适配你。另外要提供持续反馈打磨追新任务,不然还不如网上找现成的用。
- 让渡文件操作权限
我观察很多人用大语言模型还停留在聊天阶段,不给也不会如何让大语言模型使用本机的软件与硬件资源,很多文件操作是不需要你复制粘贴的,大语言模型可以调用相关格式与底层软件直接修改。当然我也不提倡大撒把,对大语言模型生成的东西看都不看就交付。大语言模型生成的东西可以做到逻辑上闭环,但很多时候做不到事实上闭环,因此很多生成的东西会比较空虚,你要是写公文那倒也无所谓,但要是真解决问题,一定得自己读一遍。你要是不理解沙盒、虚拟机、文件夹权限这些东西,直接放权确实有风险,做好备份。对大语言模型让渡权限越多,其自由度越高,得到结果可能越好,但你也会把风险外包。不过不用担心,你买机票的时候也不认识机长,真出现大风险,大概率有一批人陪着你。如果不是本地模型,最好别贪便宜搞中转站,大概率会泄露API key或个人信息,特别是隐私观念比较薄弱的新手,可以让AI利用本地小模型做个简单的隐私过滤或模型路由。
- 回忆权
其实现在很多智能设备在逐渐剥夺个人的回忆权,数字化后你总可以回溯某个时间你在做什么,客观真实。以前回忆还可以选择性生理性加工下,现在考虑工作留痕记录生活后基本就没有二次加工了。当使用智能设备记录自己时,大脑的某个部分就无限期休假了,因为总知道会有提醒,很多数字或日期也就不记了,我现在能记住的电话号码不超过5个,这应该是一种进步,但似乎生理上看更像是个体的退化。因此最后一个方案其实是每周抽出半天远离所有联网的智能设备,训练记忆,否则哪天平行世界串线了你都不知道。