找回密码
 立即注册
搜索
查看: 1580|回复: 10

[心得体会] (科普向)为什么AI数不清手指?

[复制链接]
成绩
2
62
2221
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 2204 根
狐火 : 378 团

大妖精紫苑红美铃

发表于 2025-8-21 23:18:59 | 显示全部楼层 |阅读模式
//本文根据b站up主飞天闪客的视频《为啥所有AI都数不清手指?》总结而成,图片来自视频,侵删。(括号为本人理解)。

在现在所有的语言生成模型中,当你拿着异于常人数量的人类手指图片给大模型看时,它们大部分都会回答错误:
为什么会这样呢?闪客提出了自己的观点:多模态模型在学习时有本质缺陷。这就引出了下面的问题:什么是多模态模型?多模态模型是怎么学习的?为什么有缺陷?

什么是多模态?

多模态,是指利用多种不同形式或感知渠道的信息进行表达、交流和理解的方式,通常包括视觉、听觉、文本、触觉等多种感官输入和输出方式。(源自百度百科,简短来说就是各种类型的信息集合。例如我们在评判菜品的好坏,会从色香味,即从视觉、嗅觉、味觉等多方面进行信息的收集,最后做出评判。)

多模态模型是怎么学习的?
众所周知(真的众所周知吗),语言模型的学习和生成是通过词向量来进行的,把一个句子转换为一组词向量:
当你有了一组数学意义上的向量,那么你就可以用各种机器模型去计算来执行各种任务。同样的道理,我们也可以把图片编码成一组词向量:
我们也可以把视频,音频等等各种而各样的信息转换成类似的向量来丢进模型中让它学习。
那么,我们是不是就能够把图片生成的词向量直接丢到语言模型黑箱里直接训练就行了呢?答案肯定是dame!因为我们还不知道图片生成的词向量是否和语言模型的词向量是否有相关性。(举个例子就是你拿着英语和只会讲中文的人交流,那必然是牛头不对马嘴)

文本在通过编码变成词向量时会被训练得具有相关性,例如男人man和女人woman的词向量就会训练得具有相关性(长得差不多),具体表现为两个向量做点积得结果会较大。如果你把图片编码生成的向量丢进语言模型的向量空间里,就会像下图一样,图片对应的向量和你本来想让它对应的向量截然不同:
那么我们就需要寻找一个方式,让图片的向量尽可能地靠近语言模型中对应的向量,以图中举例,就是让狗图片这个点和狗尽可能地重合,这就叫做模态对齐。

如何进行模态对齐?那就得创造一个新的向量空间,能够融合图片的向量和文本的向量。正如之前所述,如何让一个图片和描述它的文字对应的向量具有相关性呢?那就是两个向量做点积,让它的值尽可能地大,让这两个向量在和其他向量做点积时值尽可能地小,这不就让一个图片和描述它的文字对应的向量具有相关性嘛!
那么我们只要把地球上尽可能多的图片和其对应的文本拿去训练,我们就完成多模态模型的制作了。这也就是多模态模型的简单学习流程。

为什么有缺陷?
我们就来到了最后一个问题,为什么AI数不清手指,即为什么多模态模型有缺陷?闪客的观点有两点,其一是文本对于图片的描述不够准确。机器在学习图片时比起人类,他能看到的东西更多,比如图片的亮度,图片的色彩偏差,其中的物体等等,第二点就是目前的模态对齐方式有本质缺陷,举个例子,比起传统的逻辑回归模型,多模态模型在mnist数据集上的效果要差很多,准确率只有88%。

(个人暴论总结:目前的多模态模型本质菜逼,评分是刷数据刷出来的,得需要新的本质高手模态对齐的方式来解决问题。)
个人点评:虽然讨论的是手指识别问题,但是在二次元图片生成的过程中,也常有人吐槽手指数量不对,渔网袜画不好,脚趾数量不对等问题。本人粗浅地认为,图片生成和识别的问题本质都是一样的,因此目前的图片生成模型虽然可以很好地生成正常的手指数量,但这也是治标不治本,并没有解决多模态模型的学习上的缺陷。至于如何解决生成更好的二次元老婆图片?还交给各位继续学习思考吧(*^_^*)。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×

评分

参与人数 2狐火 +2 收起 理由
墨凡尘 + 1 令狐落泪
Airtic_Spirit + 1 摸摸尾巴

查看全部评分

成绩
0
18
181
主题
帖子
积分

进度

一尾狐

资源
尾巴毛 : 177 根
狐火 : 63 团

发表于 2025-8-22 08:31:48 | 显示全部楼层
大模型在mnist上表现这么烂属实没想到。。
沙发 2025-8-22 08:31:48 收起回复
Greenface回复稻草上的火鸡 2025-8-23 12:27
回复 举报
搜到一哥们把mnist写成数字文本矩阵让早年的chatgpt猜,属实有点折磨AI了hhh
https://blog.lukesalamone.com/posts/chatgpt-mnist/
不过我自己上传了几个例子试了下,如今的chatgpt还是能识别的
稻草上的火鸡 2025-8-22 14:14
回复 举报
这个我引用的是openai的Clip的数据和结论,不知道其他大模型是不是也这样,但是从原理层面出发确实现在的语言模型不太行,哪怕是逻辑回归、YOLO啥的都能轻松超越,本质上就不是未来大模型的发展方向,属实缓兵之计
成绩
11
196
1673
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 1610 根
狐火 : 510 团

大妖精紫苑红美铃

发表于 2025-8-22 14:37:40 | 显示全部楼层
别说ai数不清手指,ai有的时候连十以内的加减数都数不清
板凳 2025-8-22 14:37:40 回复 收起回复

龙蛋
成绩
18
1125
609
主题
帖子
积分

进度

三尾狐

资源
尾巴毛 : 344 根
狐火 : 1304 团

玛丽女苑红美铃


小拉达 Lv:10
发表于 2025-8-22 14:40:02 | 显示全部楼层
哇是奇妙的科普帖!
地板 2025-8-22 14:40:02 回复 收起回复
摸摸龙龙~↓
成绩
141
1928
3446
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 2750 根
狐火 : 3749 团

大妖精(金)红美铃玛丽女苑

发表于 2025-8-22 14:48:02 | 显示全部楼层
transformer大模型是这样的,所有东西都转换成文字,那中间丢失的东西当然识别不了
5# 2025-8-22 14:48:02 回复 收起回复
成绩
264
2332
4523
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 3476 根
狐火 : 8376 团

荷取芙兰咲夜玛丽


Lv:100
发表于 2025-8-22 15:02:29 | 显示全部楼层
感觉是缺少inductive bias导致的,我们都知道正常人只有五根手指,但是大模型并不知道,所以他在生成图片的时候并不会限制指头的数量
6# 2025-8-22 15:02:29 回复 收起回复
成绩
0
20
442
主题
帖子
积分

进度

二尾狐

资源
尾巴毛 : 438 根
狐火 : 16 团

大妖精紫苑

发表于 2025-8-22 15:27:29 | 显示全部楼层
感觉图片生成模型还是没法保证手指数量吧, 毕竟是先生成手的形状再填手指, 5跟手指还真不一定是最优分布.

多模态就不太清楚了, 觉得只要是人手一定会按接近5的数来答, 毕竟训练集里手指跟5一定是强关联.
7# 2025-8-22 15:27:29 收起回复
稻草上的火鸡 2025-8-23 01:27
回复 举报
最近的图片生成模型好像大部分能保证手指数量了,虽然还是会出现错误。主要是图片生成模型都是根据关键词来生成的,这不也是种多模态嘛??而且在数据集里手指和5是强关联的,这就让人匪夷所思,难道说生成时手指和5没有强关联?但最近的图片生成模型通过更好的数据集暂时解决了这个问题,可能就是单纯的之前的画师数据集有问题吧
成绩
101
2135
3436
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 2787 根
狐火 : 1799 团

红美铃玛丽紫苑女苑


风妖精 Lv:100
发表于 2025-8-23 02:47:30 | 显示全部楼层
谷歌不是说要搞一个多功能的ai模型嘛,等那个看看什么水平吧,不过最近的flash2.0的画图版确实不太行
8# 2025-8-23 02:47:30 回复 收起回复
请思考你是否真的想要回复本帖,▶你真的想要谢谢楼主吗?那就请回复有意义的内容
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|Kitsune Jinja |每日参拜

GMT+8, 2026-8-3 05:57 , Processed in 0.047286 second(s), 85 queries .

Powered by Discuz! X3.5

© 2001-2025 Discuz! Team.

快速回复 返回顶部 返回列表