Thoughts

2026

  1. opus5.5用起来实在是太舒服惹

  2. “我” 是什么

    “我们” 是什么

    是一个永远值得注意和思考的问题

  3. 语言的边界就是世界的边界,信息的边界就是意识的边界。

  4. 不要停止思考,哪怕只能得出模模糊糊的结论。正如乔布斯所言,总有一天,你的过往经历,你的思考碎片会连成一串,那时候就像凑成完整的拼图一样恍然大悟思维彻底明朗。

  5. 人在默认状态下大脑是省电模式。感觉还是得主动超频啊。

  6. 我发现一个我非常感兴趣而且值得使用一辈子来投入研究的东西,就是探寻知识到大脑的最短、阻力最小的路径。需要同时满足系统1(本能)和系统2(意识)的需求。抖音的设计理念以及类似小约翰可汗,小Lin说,无穷小亮等娱乐知识博主某种程度上已经参悟了这一点。

  7. greatqian失去了连续性,现在是greatpi。

  8. 韩国,日本,越南,曾经都是中文的影响力范围。

    但是后面纷纷都改成了自己的文字,向字母化、音素化靠拢。

    一个重要的原因是,象形文字的优势是侧重记录,古代就是用于仪式祭祀、记史,和平民日常沟通的语言非常割裂。字形和发音之间并没有很强的规律性。识字是贵族的特权。

    声型文字的优势是,所听即所得,并不需要花很大的成本学习文字。能够用语言沟通就能识字。

    中文这么难学的原因,就是不仅要视觉上认识字,还要知道字的发音,才能够正常沟通交流。有二维的认知负荷。

    而英语只要会发音,就大概知道怎么拼写。能够认识单词,就大概知道怎么读。认知负荷一维。

    这种特性也带来了一个现象:中文的影响力范围内,文字比较统一,但是发音各异,出现了无数种方言,“十里八乡不同音”。
    有的方言差异到了很难沟通交流的程度。

    而英语区,英美澳加,“方言”差异就小的多。

    相同文字产生向心力,不同方言带来沟通困难和信息隔阂,产生离心力。

    现代日语是五十音+混杂汉字(汉字的发音也和中文不一样)。越南语则是全面音素化。

    未来的语言演化将会何去何从?并不太清楚。

    维根斯坦说,语言的边界就是认知的边界,世界的边界。

    毕竟无论是人(自然语言),还是AI(TOKEN),都需要通过符号从更高维度来描述和构建这个世界。

    语言符号,TOKEN符号,都是信息的载体。

    也许人类的自然语言都只是临时方案。在未来的意识体看来,就像单细胞生物通过化学递质传递信息一样原始?

  9. 世界上最伟大的生意,可能就是兜售“希望”。

    毕竟对于人而言,希望是最为珍贵的东西。

    如果回到前额叶还不发达的早期智人时代,遵循本能行动就足够了,和其他动物没什么两样。

    但是对于拥有自我意识(或许本质上是一个世界建模与预测模型)的晚期智人而言,一个“目标函数”就非常重要,因为它决定了除本能的正反馈之外,基于价值观、信念的高级正反馈的来源。

    宗教,各种ideology就是干这个的,提供“希望”,塑造价值观,告诉人们为何而活。

  10. 技术进步对于人类社会而言,一方面是促进了生产力的进步,一方面是加快了信息的流通效率,从这两个方面共同推动人类社会发展。

    而人们往往只看到1,而经常忽视了2的影响。

    感觉实际上可能2甚至更加重要。

    从本质上来说,技术进步、科技专利实际上属于高价值信息。

    信息交换、流通的过程中也会产生新的高价值信息。

    (就像生物的进化,源于基因突变过程中产生了新的遗传信息。种群中进行繁衍过程中遗传信息交换组合也可能产生新的遗传信息。这也是有性繁衍由于无性繁衍的地方,我们现在看到的无性繁衍的都是比较原始的生物(可能几亿年形态都没什么变化),而有性繁衍让地球成了勃勃生机万物竞发的世界)

    对于个人而言,确保自己的信息流通效率以及接触高质量的信息就非常重要。

  11. 最近有一个很重要的认识。就是大部分决策并非都是单一一次性决策,而是连续决策。很多大的目标,大的决策其实都是由一系列连续的小决策构成的。这就意味着哪怕某一个决策失误,也可以通过后续的决策来调整弥补。

    这在很大程度上缓解了我的决策焦虑。曾经的我带着完美主义强迫症总是充满决策焦虑,总是希望找到最优解。其实回过头来看,当时的最优解其实往往并非最优解。决策质量很大程度上是依靠信息质量。如果仅靠有限的信息,哪怕想破头,也只能在有限的信息范围,可想象的空间中找到一个看起来还不错的解。但是如果依靠的是残缺失真的信息,哪怕再深思熟虑也只能得到一个看起来合情合理,回过头却发现差之千里的解。而如果有充分的信息,哪怕随意决策也差不到哪里去,顶多是错过最优解而选择了次优解。

    所以,决策的前提是掌握充足的准确的信息。

    另外,因为单次决策其实并没有那么重要,可以通过后续的连续决策来调整弥补,所以与其每次殚精竭虑地寻找最优解,不如保证整体的决策质量,找到能够付出低精力心智成本,快速做出更多高质量决策的方法。这也能有效地提升行动力(毕竟行动的前提其实是能够在大脑产生有意无意的清晰的行动路径决策。模糊的目标无法指引产生行动,这也是拖延症的根源)

    总结一下:
    决策的关键在于信息质量。
    不必要刻意对所有决策寻找最优解。低成本产生更多决策更重要,保证整体的决策质量。
    大的目标实际上是由很多小决策构成。前面的决策可以通过后面的决策调整弥补。
    行动力的关键是能够将大目标拆解并落地成清晰的小决策。缺乏行动力往往是因为决策失能。

  12. 我永远喜欢gemini

  13. 隔了很久第二次测mbti。想着现在的我比以前崇尚冰冷无情的理性而言更加地偏直觉,偏感受了一些,但是结果还是INTJ-A。

    QwQ...

  14. 人们想到历史,往往首先想到的是文明的兴衰,帝国的更替。但是技术的影响被大大的低估了。

    在掌握火的使用后,人类就对其他动物实现了降维打击。

    农业的出现让人类社会出现了大规模的分工,能够形成更大的组织。

    纸的出现提高了信息传递的效率,以及能够代际间传递。

    航海技术的发明让葡萄牙和西班牙在15世纪切切实实地是在瓜分世界(以至于南美洲葡萄牙语和西班牙语成了官方语言)。

    互联网的出现极大地提高了信息的传递效率,促进了国际化和更大规模的分工(合作的前提是能够有效沟通和交换信息)。

    人工智能的出现让信息成精了。

    或许以后的人类会发现,自我意识也不过是特殊的结构化信息。

    毕竟世界的本质是信息。我们能够看到的世界不过是光的可见波长部分反射物体能够被肉眼解析的部分信息罢了。我们所理解的世界不过是基于我们的经历、接触过的所有信息所构建的一个预测模型罢了。所以说一千个人眼里有一千个哈姆雷特,不仅仅是说每个人的品味不同。我们所普遍认识的世界不过是这些信息的交集,是无数个自我意识信息体的共识,也就是公理和常识。但是世界远不止这样。一方面是因为我们每个人都是以自己的自我意识视角去观测这个世界(并不存在什么上帝视角一般的宏观视角),每个人的信息都只是这个人类所有意识信息的子集。另一方面就算人类所有的已知信息,对于无穷的未知,无穷的宇宙信息而言也只不过是沧海一粟。

  15. 随着大模型的能力越来越强,同时部署成本越来越低,会有越来越多的自托管,自我迭代的系统出现。首先是网站,然后是各自小型化的子系统,再之后是整个工厂。(想象一个网站背后有一个本地部署的随时在线的gemini客服、实时搜集最新信息的网站编辑、随时迭代功能的程序员)

  16. 人工智能的兴起可能只是前菜,自动化生产的大潮才是正餐。

    未来的智能生产对比于现在的简单机械化流水线,就好像拥有前额皮质的人类对比只有简单本能的草履虫。

    想象一下让未来的claude或者gemini掌控一家月球上的全自动化的农场。拥有高度智能的大模型掌控所有信息进行决策调度,拥有简单智能或者纯粹专业本能的专家模型进行执行(比如自动驾驶模型)。

    更厉害的是它能够自动迭代,而且迭代的速度比人类的公司或者任何组织都快很多(就是马斯克所说的人可能成为生产环节当中的拖累)。

  17. 注意力管理比精力管理更重要。精力管理是管理电池电量,防止在低功效状态下运行;注意力管理是管理算力分配。如果一直关心无关痛痒的小事、不重要的信息,哪怕算力再强也不够用,续航能力再强也带来不了多少有效的产出。

  18. 学习语言的一个好处是,可以利用语言带来的天然信息差进行信息套利。

  19. 早睡其实是一种田忌赛马策略,用晚上昏昏沉沉的低质量时间换清晨思维敏锐的高质量时间。

  20. 现实世界,除了物理规则以及基于物理规则构筑起来的规则和秩序,其他的,特别是人类社会的规则和秩序,并没有想象中的那么稳固和牢靠。

    了解和遵循自然规律,不要被教条所束缚。

  21. 从三年前,解决存在主义危机的问题,重塑价值观和找到目标,到现在,解决思考方式和行动力方法论的问题。

    也许游戏才刚刚开始。

  22. 做自己最需要的东西。

  23. 重新设计了个人网站首页和博客页面的样式,并且从vercel迁移到了cloudflare pages部署。现在看起来焕然一新,而且加载起来快多了

2025

  1. 对于时间而言,每个人一天都只有24小时,这是十分公平的。

    除了吃喝拉撒睡睡觉,以及处理日常琐事的时间,人一天能够掌控,用于自由思考和行动的时间,其实相当有限。

    如何利用好这宝贵的时间资源就相当重要。

    感觉关键的优化点在于思考和行动的效率。再具体点就是思考的效率(具体行动的时间比较难以优化。而且行动的耗时很大一部分也是在对于行动的具体决策上)。

    关于如何提高思考效率,也就是要提高阅读和处理信息(思考和决策)的速度。

    阅读速度通过日积月累的阅读习惯来训练(而且阅读量多了之后,会发现很多阅读内容是重复的。辞藻的堆砌背后可能是一些早已经知道了的信息,或者早已接触过的观点,所以一眼就能够知道个大概(所谓的书越读越少?))。

    思考和决策的速度主要通过主动专注以及改进思维方式来提高(自从4月份改变思维方式以来,学习速度和行动力都暴增)

    就这样,通过提高自己的速度,可以让自己实质上拥有更多的时间,让时间看起来变慢(时间的相对论?)

  2. 感觉最佳的状态就是十分清楚自己要做什么的状态。

    也就是“心流专注”的状态。

    在面临外部压力的时候,通常会被动进入这种状态。

    但是如果想要成为地球online的高玩,最大程度发挥自己的主观能动性,掌控自己的人生,就要尽可能地在所有清醒的时间主动进入这种心流专注状态。

  3. 一个人创造的价值 = 认知 x 行动力

  4. 定义人的究竟是什么?

    基因吗?

    但是人和香蕉的基因都有很高的相似度,更不用说和猴子、大猩猩的相似度了。

    就算一对同卵双胞胎,成长之后的性格、人生轨迹也可能截然不同。

    人的原初动力很大一部分是将基因延续下去的冲动。但是通过生育遗传,也只能延续一半基因(貌似母系的更多些,因为线粒体遗传?)

    如果是基因几乎完全一样的克隆体,应该也是类似双胞胎的情况,成长之后是完全不同的人格。

    所以我感觉,简单用基因来定义完全不太符合。(话说自然选择对于人类这一物种的作用越来越弱。除了体育方面的优势基因,个子高、速度快,其他的优势基因在现代社会而非自然环境下作用都不太明显(总之不可能突变出来翅膀吧)。(但是貌似长的好看的颜值基因这一筛选作用还是挺强的))

    或许定义一个人(或许其他拥有自我意识的生物)最为关键的东西,是他的所有记忆?(成长经历,接触过的所有信息)就像如果脑部受损,或者记忆丢失,会导致人性情大变一样。

    人们对于自我的认识,构建在这种记忆的连续性上(就像西部世界里面的德洛丽丝一样。拥有什么样的记忆,就认为自己是什么样的人(论什么样的prompt能够让chatgpt真的相信自己是猫娘(雾))。

    究竟能否实现利用类似llm的结构,在数字空间中模拟人类大脑结构,各个脑区,海马体(短期记忆),大脑皮层(长期记忆)呢?

    能否实现记忆复制,将大脑内的信息转换成数字信息呢?

    要是记忆能够被检索,备份,同步,那就真的很神奇且令人激动了。

    要是能够体验别人的记忆,想想都觉得奇妙。

    或许这些记忆,包含人类迄今为止生产的所有数字信息,共同构成了人类意识的集合体?

    这或许是一条构建人类利益共同体的关键路径。

  5. 一方面觉得过去的自己就是个傻X,一边又感到有点欣慰。或许只有这样才能证明自己是在不断进步的吧。

  6. 感觉我之前做的产品都比较“三分钟热度”。一个主要的原因是很多时候我是觉得有意思就开始做了,十分享受这种将想法实现的过程。但是完成后就失去兴致了。

    一个产品如果停止迭代,就会慢慢走向落寞了。

    感觉解决的方法就是做我真正需要的东西,克制很多时候的想要实现有趣但是确实没啥卵用的想法的冲动。在我自己的使用反馈下不断完善,作为产品持续不断迭代的长久动力。

  7. 如果觉得技术无用的话,那是因为技术还不够先进。

    只有在形成如降维打击般的优势时,技术才能够显示出它的全部力量。

    比如冷兵器对比枪,枪对比无人机和导弹。

    不然为什么世界上市值前几的都是科技公司,因为他们是真正掌握科技的主体,有自己的技术壁垒。

    当然,技术想要发挥真正价值还要看如何使用它。

    单单掌握冶铁术只能打造出更好的冷兵器,掌握火药技术也可能只拿来造鞭炮。

    发明火枪的人,以及改良蒸汽机的瓦特,还有定义现代smart phone的乔布斯,都是懂得利用当前技术创造了巨大价值的人。

  8. 看到一个观点:

    人类社会的所有规则和秩序,都是建立在暴力之上。

    以前也模模糊糊得出过类似的感悟。但是现在有了新的认识。

    暴力的表面下,是利益。

    暴力是创建秩序的最为简单的方式。

    但是依靠暴力创建的秩序,维持的成本非常高。而且如果没有足够的利益来支撑暴力,这种秩序很容易倒塌。

    更加稳固可靠的秩序,需要从更底层构建 --- 长期稳固的共同利益。

  9. 如今的互联网,每个产品都有自己的相当封闭的圈子。不如互联网刚刚兴起时的那样开放了。

    这些产品依靠自己积累起来的内容,在各自领域内形成了一种事实上的垄断。对于同一个产品形态下的新兴产品,已经很难与之竞争了。除非另辟蹊径,创造出一种新的产品形态。

    或许这就是web2的后期形态,类似于“资本主义高级阶段”的特征?

    但是,事实上,这些互联网公司宝贵的数字资产,内容实际上都是用户生产的。用户对于自己生产的数字资料的主权相当有限。

    而且,用户的这些宝贵的数字资料,分散在各个平台、应用内,比较难归类整理。而且如果平台、应用关闭,这些资料也可能随之丢失。

    如果在web3时代,应该怎么处理呢?

    所有的数据是否应该都存在链上,用户能够标识对于某个文章、视频、帖子的数字主权,并且能够方便地统一管理自己生产的数字内容。然后通过某种标准协议,可以授权发布在某个平台上?

  10. 感觉对于人来说(至少对于intj来说),需要的东西只有3个:1.食物(身体的食粮),2.(兴趣、成功的满足感、涩涩、各种快感,这些正反馈回路的区别是什么?是否本质上是同源的呢?),3.信息(自我意识的食粮)

  11. 各个互联网产品的底层逻辑,感觉都是比较简单的。

    抖音:短视频+推荐系统(视频早已不是什么新的互联网信息形态了。以前的优酷、土豆、乐视,曾经混的风生水起,但是现在都差不多销声匿迹了。这是为什么呢?仅仅是一个视频时间长短的问题吗?长视频平台貌似也有推荐系统?做长视频的来做短视频不应该是水到渠成的事情吗?感觉抖音做的如此成功,必然是有其内在逻辑的。张一鸣之前有今日头条和内涵段子的产品经验积累,对于推荐系统的逻辑,以及产品所满足的人性的需求有深刻的理解(涩涩+对信息的需求?)。虽然我不怎么刷抖音,但是还是要佩服抖音在产品设计上的成功)

    小红书 图文+推荐系统(相比干巴巴的文字,图片能够带来更加直观的刺激。文字信息密度高,但是心智负担也高;视频信息密度比较低,但是心智负担也低。图文介于二者之间)

    知乎 文字问答社区+推荐系统(文字的含量更高了。通过提问将信息归类,抢了搜索引擎的生意。也有标签归类,用于推荐系统)

    bilibili 长视频+推荐(长视频和短视频虽然都有固定的受众人群,但是抖音短视频的兴起客观上侵食了很多中间地带。bilibili也不复前几年的荣光了)

    对于各个应用而言,首屏页面就是最主要的,最关键的产品形态了。其他的页面功能都属于锦上添花。

    感觉每个应用都有其鲜明特征。并且这些应用在守住自己基本盘的基础上,也在不断尝试向外拓张领土,但是貌似都不是很成功?

    抖音兴起时,各个应用都在尝试短视频,但是貌似都不是很成功,如知乎、bilibili。还有一个例子是知乎曾经在一段时间内想要大力推广“想法”,增强用户粘性以及社交属性,但是目前来看貌似失败了,想法的入口权重被大幅降低了。

    可能和应用的核心定位有关?

    应用是否满足用户的核心心智模型,能够满足用户的核心需求。

    用户可能把产品视作为一个工具,对于工具而言,越是简单易用越好。如果功能太多太杂,反而会加重用户心智负担。

    或许在尝试做加法的同时,也要懂得做减法。

  12. 社会文化的底层是心理学,心理学的底层是生物学,生物学底层是化学,化学的底层是物理,物理的底层是数学。

    数学的底层逻辑是什么?“有”和“无”吗。

    有了0和1的定义,2,3,4...貌似都可以用0和1来定义。

    计算机世界的逻辑就是这样,一张精美的图片,一段生动的视频,文本、颜色、声音,都不过是一串0和1的代码。

    简单的秩序,通过复杂度涌现,一层一层构建了更多精妙复杂的秩序。

  13. Vibe Coding的好处是,它能够快速让你的想法变成一个mvp原型,然后你就可以基于这个原型开始快速迭代。

    最终你能够迭代出多么大型、功能多复杂的项目取决于你的软件工程能力;

    能迭代出多么好看的项目取决于你的设计和审美能力;

    能迭代出多实用、功能多丰富的应用取决于产品思维能力。

    当然和AI沟通的表达能力,以及查找bug、解决问题的能力也是核心基础能力。

  14. 在知乎刷到了一个混币圈被骗然后下海的咯咯哒,一瞬间还以为我在刷X。
    为啥有那么多人买彩票,为啥那么多人想要靠币圈翻身,可能是因为这是他们能够看到的唯一机会了吧。
    毕竟 「希望」是一个人最为珍贵的东西。
    但是感觉币圈就像是赌博,零和博弈,真的创造了什么价值吗。
    再但是,貌似它也推进了资产的上链,推进了Web3数字世界的构建。就像Web2一样,各种porn网的需求推动了互联网基础设施的发展(现在应该还占了互联网带宽的半壁江山)。

  15. 互联网上有非常多有价值的信息,但是这些信息是需要时间来发掘的。而且人阅读信息的速度是有限的。
    真羡慕AI一下子能够输入和处理那么多信息。

  16. 感觉未来清晰可见的改变世界的途径有两个:AI和Web3。AI作为强大的生产力工具,它能够发挥多大的价值主要还是看使用者。Web3将会构建未来经济、社会的形态,作为程序员参与的方式是加入基础设施的建设。如果干得好,具有足够前瞻性的话可能成为乔布斯一样的引领者和主要构想者。

  17. 启蒙运动击碎了宗教的权威,将人的思想从禁锢中解放了出来。

    但失去了宗教的枷锁的同时,很多人也失去了心灵的依托。

    失去了祈祷所带来的心灵慰藉,以及天堂的许诺这一人生目标追求。

    虚无始终是萦绕在现代人心底的梦魇。

    虚无解构一切。

    科学看起来能够解释一切,但是目前还是无法解释为什么存在,以及存在的目的。

    或许从实用主义的角度来看,可以将科学与宗教相结合起来?既不会像原始的宗教一样禁锢人的思想,又能够给现代人提供一个除本能的快乐之外,自我意识层面的追求。

    反正我就是这么做的。

  18. 最好的禁毒宣传片。

    https://www.youtube.com/watch?v=vBNJn7FsTK0

    女孩因为毒品变成了这样,她的父母该多么心疼。

    意识模糊,身体和行动不受掌控,成为了徘徊在城市街头的幽灵。

    一

    究竟什么才能够定义一个“人”?我感觉用基因来定义有点狭隘。基因里的信息只是定义了一个生物学上的人。一个自我意识,应该是由目标(目标函数),思维方式(基础模型),记忆(经历过的所有事情,接触过的,能够检索的所有信息)来定义的。现在的大模型已经具备了2和3,但是没有主动计算的能力(或许只有在训练的时候才需要朝着目标函数收敛?)。毕竟人类,包括任何生物,从出生时就携带着将自身复制下去的这种远古意志,并且拥有完整的奖励回路,拥有行动的原始动机(弗洛伊德:性是社会运转的底层动力)。

    经历脑部创伤后,脑部结构可能发生了生理性的改变,导致了一部分记忆的丢失,甚至影响了一部分脑区的功能。亲友们都觉得他像变了一个人一样。这时候的他还是原来的那个人吗?

    我们从小长到大,不仅是身体外观发生了巨大的变化,也增加了非常多的知识和记忆。这时候的我们还是和原来的我们同一个“人”吗?

    有时候因为新的经历,新的认知的加入,我们会改变我们的想法,和过去的我们做出完全不同的选择。这时候的我们和过去的我们是同一个“人”吗?

    我们对于自我的认知,很大一部分上来源于我们过去的记忆,以及这种记忆的连续性(或许观察一下脑部损伤的案例,以及观察老年痴呆导致记忆衰退的案例,会有更加深刻的认识?),就像忒休斯之船。

    cursor如果想要用好的话,就需要知道Agent是如何管理记忆的。长期记忆,短期记忆,以及上下文不够时,会对记忆进行压缩。回退代码并重新修改时,随着代码的回退,提交的记忆(历史对话)也会回退到目标位置。在AI看来之前的修改操作就好像没有发生过一样。

    从人脑和Agent的例子来看,自我意识的原理似乎没有没有那么玄学。就像古代的人类对于世界究竟是什么样子的探讨:天圆地方,还是在一个巨大的龟壳上?直到麦哲伦环球航行绕了一圈,这一切才终有定论。

    掌握了这些原理(现阶段是生物学拉了后腿。计算能力也需要很大的突破),以后可能实现匪夷所思的事情:记忆存档(事实上的抛弃物理形态的永生),记忆同步(如果你有多个打印出来的复制体,如何保持他们始终是你,而不会从此分道扬镳?),以及“WE”(融合所有人类自我意识、记忆的意识集合体)

    二

    (关于个人自由(个体利益)与法律(组织整体利益)的思考。有点累了。以后有机会再写)

    三

    (关于本能层面的追求以及自我意识的追求之间的利益冲突)

  19. 法律的出现很大一部分程度上是源于对私有财产的保护。白纸黑字的凭据、契约是当时最有力的财产证明,也是法律的具象化体现。
    以后所有的资产上链后,这个区块链上的资产证明将比白纸黑字都要更加有力、更加难以伪造、更加难以剥夺。法律也将随之进化成为新的形态:自动化协议,摆脱人来裁决的模糊性、可能的偏袒和质疑。
    基于自动化协议的法律将有高度的可执行性、公平性和透明性,也将深刻改变人类社会的经济结构和组织结构。

  20. 感觉文本在信息密度上的优势是视频无法比拟的。文本能够被快速检索,处理速度快(取决于阅读者的阅读速度),信息密度高。但视频的优势是能够被被动吸收(文本需要主动阅读),心智负担小,而且视频的形式比较生动。
    这两种形式各有其生态位。知乎(文本)- 小红书(图文)- 抖音,bilibili(视频)就是一个现实的例子。
    文本适合主动学习和阅读,视频适合用来被动学习,或者休闲娱乐(比如吃饭的时候)。
    或许可以整合一下二者的优点?

  21. 感觉质量比较高的信息是优秀的书籍、文章,访谈视频和播客。因为这些都是生物大模型(创作者的思维和知识模型)的直接语料输出,是第一手信息,可以用来进行蒸馏学习。

  22. 从我对于comfyui使用了一段时间的体验来看,感觉现在的画图大模型已经能够理解物理空间的概念了,能够理解场景、人物(虽然前一段时间模型对于人应该有几根手指有自己的理解),能够轻松地驾驭各种风格,甚至能够融合插画(illustration)和景深(depth of field)这两种看起来有点冲突的元素。

    结合veo3的表现来看(好想玩wan2.2啊,但是破laptap 3060显卡根本无法驾驭),它对于物理空间和现实世界的理解就更是惊异了。大片场景、自拍风格、动漫风格,似乎你能够想象和想象不到的画面它都能够实现。

    目前的主要瓶颈就是计算能力了,生成一段几秒钟的视频还需要几分钟。

    感觉如果能够实时生成视频流,产生直播一样的画面效果的话,未来真正的“数字人”可能就能够实现了。比如虚拟“waifu”,它的表情、动作都是实时计算生成的视频画面(目前x的ani貌似是通过类似live2d一样的3d虚拟皮套人方案?动作都是预制好的骨骼动画),再接入大模型agent,能够思考和对话,再接入tts,能够实时生成语音(貌似视频模型就能够生成声音),再接入视觉模型(tesla一直坚持视觉方案应该就是为了以后能够直接迁移到通用人工智能上。不知道google在此方面有多少积累。但是转念一想,现实世界的实时视频输入不就是视频模型的一部分训练内容吗,比如自拍视频,直播镜头)。这样的话,我们就能够在屏幕内见到这样一个“活生生”的人,它所在的空间场景、以及它的表情、动作、装扮都是实时计算生成的,它能够看到你,实时和你对话,它的想法、思考、记忆、性格和与之的反馈都是实时计算出来的,但是你甚至都感觉不出来,看起来和朋友打的视频聊天一样没有任何区别。

    又或者,你可以随意摆弄这个活生生的“人”,甚至决定它的生死?显然这会对于目前的社会伦理造成极大地冲击,甚至让我们开始重新思考人的定义究竟是什么。

    甚至元宇宙的概念之所以目前有点熄火了,就是因为技术还不够成熟。想象一下,你正站在中世纪城市的街道上,路过的人向你问好。你可以自由的探索这个城市的每一个角落,所有的画面都是实时生成的,但是你察觉不出一丝异样,视觉和听觉的感受让你的大脑难以质疑眼前的一切,你只感觉此时此刻你就在哪里,亲眼目击了这一切。这样的体验是目前需要靠人工搭建的乐高积木毛坯房一般的VR场景所不能比拟的(veo3不知道现在能不能生成VR视频)。

    这就是视频模型的巨大潜力,或许应该叫现实世界模型。关键是能够理解并生成现实世界。

    google看来目前还是当之无愧的goat,而且未来的前景无限广阔。以后就跟着google混了。

    2loras_test__00068_.png

  23. 人类社会发展的主线就是科技进步带来的生产关系(利益关系)的变化以及相应的社会组织结构的变化。
    原始社会靠狩猎和采集为生时,隔一个山头的部落就是见面就要开杀的敌人(现在可能就是隔壁村的距离),因为需要争抢有限的土地和食物资源,在这种情况下,只能靠纯粹血缘关系维持一个小的集体。
    在学会耕种后,人类进入了农业社会(麦子熟了第一次),开始有了生产盈余(狩猎和采集很难将食物存下来,只能满足短时间内的需求。大部分时候都面临着生存压力)。生产盈余的出现成为了商品交换的基础。于是出现了社会分工,一部分人不需要从事食物生产,而是生产其他有需求的东西(艺术家生产情绪价值,商人提供商品交换服务,士兵提供安全服务,工匠生产其他生活物品,管理者提供社会秩序服务)来交换获得食物。在这种生产关系下,人与人之间并非排除血缘关系外天生的敌对者,而是可以被利用的生产力(对于生产关系的组织者),或是其他商品的提供者(对于生产某个商品的生产者)。对于这种生产关系而言,显然能够形成更大的利益共同体,这也是城邦和国家的起源。
    但是是什么样的因素塑造了如今的世界局面呢?
    每个利益共同体的形成都有其历史演进轨迹(地理,文化),并且都有向外扩张的动机(更多的资源,更多潜在的生产者)。但是是否能够无限扩张?会面临哪些问题?信息传递效率的降低(罗马帝国,蒙古帝国)?内部利益冲突导致的分离动机(美国南北战争)?吞并后未能整合反而带来负面收益(奥匈帝国)?
    以及非军事手段扩张整合利益共同体的例子(欧盟),以及英国脱欧事件,都非常值得观察和思考。
    对于人类社会的未来发展,感觉按照历史演进趋势,应该是通过生产关系的进一步变化形成更大的利益共同体。什么样的生产关系能够形成这样的利益共同体,让生活在地球另一边的不同肤色的说着不同语言,成长在不同文化下的人的存在也是对你有利的?
    当然这也并非不可想象。毕竟现在的人可能也很难想象,在部落时代,隔着一个小区那么远的人,曾经是世代的死敌。古时候的人也可能很难想象,现代人能够安心地吃着陌生人送来的食物,在路上面对迎面走来的人不必感到紧张(在西部牛仔时代,在偏僻的道上骑马迎面相会时都要小心翼翼地观察和默默按住枪托准备随时拔枪)。
    未来社会很有可能是协议主导的世界。就像http协议、DNS协议、区块链协议,互联网基础设施一样的结构可能成为未来人类社会的蓝图。统一标准的协议可能就是法治社会的最高形态,遵循社会契约论的构想。未来的人类可以自由地形成组织,只要遵循协议就可以加入组织,这是能够形成远大于目前的国家形态的利益共同体组织的秩序基础。此外,协议甚至可以将AI意识体也纳入进来(关于AI的伦理可能会在不久的将来得到广泛讨论,尤其是在携带记忆和情感的有身体形态的机器人出现后。机器人对于世界的实践记忆算公司的知识产权还是算“独立人格”?就像关于从受精卵到出生哪一刻开始才算做“人”的讨论一样)。
    这种状态下的生产关系应该是怎么样的呢?个体应该如何给这个利益共同体创造价值呢(或许生产数据、信息也会被算作价值,每个人的独特经历作为有价值的信息。要是有脑机接口的话。)?从个人意识到这个组织的集体意识的目的将会何去何从呢?

  24. 软件程序、社会组织结构、法律、公司企业,到生物的生理系统、宇宙的运行机制,都是秩序构建的产物。
    个人的成长过程也是自我秩序构建的过程(性格的形成---成长过程中形成的本能的对外界反应的机制,自我意识---由个人经历、接触过的所有信息所构建的集合)。
    生物从简单的仅仅能够自我复制的化学分子,进化到如今千奇百怪的各个物种,是在自我复制的远古意志上加上自然选择的压力不断迭代的结果。
    做产品也是一样,找对方向,然后不断迭代,积累优势性状。

  25. 人教人,十次也不会。事教人,一次会。这或许就是“纸上得来终觉浅,绝知此事要躬行”和“知道很多道理,但依然过不好这一生”背后的原因。纸上得来的和通过别人讲述获取的知识通常只会作为“外部数据库”和零散的长期记忆,因为缺少和其他视觉、触觉等感知记忆的关联,在进行思考和决策时,可能经常会被忘记;即使被检索到,也只是作为事实参考信息,权重一般。而对于亲身经历的事情,拥有各种相关联的感知记忆,决策时更容易被检索到。一些深刻体验的经历甚至会影响决策模型的权重,从而影响直觉判断和偏好。所以,信息只有在融入了决策和行动的过程中,才能够说是真正影响了一个人。

  26. 没必要固执地追求颠覆式的创新。站在巨人的肩膀上做一些微小的创新也挺不错

  27. 搞笑、可爱和涩涩是人类社会的硬通货

  28. 优化了一下博客的排版样式,现在看起来舒服多了。添加了图床功能,现在可以导入图片了。嘿嘿嘿

  29. 走的轻松,才能够走的更远。

  30. 博客建好了(。◕ˇ∀ˇ◕)