国际站
返回博客列表

Tabbit 大模型流行榜发布|Benchmark 说了不算,用户用了才算!

你是不是看腻了各大模型厂家发布的 Benchmark 分数?

你是不是发现每家都说自己新发的模型是最好的?

你是不是搞不懂这些 Benchmark 到底在测什么?

你是不是更想知道大家每天真正在用的,到底是哪一个模型?

让用户第一时间用上最新、最全的模型,是 Tabbit 从第一天起就在做的事。

团队内部也围绕着问答(Chat)和任务(Agent)设计了完善的 Benchmark 评估体系。

但我们一直在思考一个问题:Benchmark 分高,就一定代表用户偏好吗?

有没有更直接的方式,看到一个模型究竟有多受欢迎?

今天,Tabbit 上有超过 20 种模型可供选择,也有海量用户每天在真实地使用它们——写代码、写文章、做搜索、处理办公文档、翻译、解决生活里的琐事。

这些真实的任务不是为了评测而设计的考题,而是用户在实际工作和生活中自然产生的多种多样的需求。

既然如此,我们能不能抛开所有人为设定的考题,用一种最朴素的方式来排名——看有多少人主动选择了它?

我们不替模型出题,不预设哪项能力更重要,也不根据结果挑选样本。

Tabbit 本身足够规模的用户样本,平滑掉了个人习惯和偶然因素的影响。

Tabbit 用户丰富的问题类型,避免了单一场景对排名的倾斜。

不出题、不加权、不挑样本,让所有模型在同一规则下,由用户的真实选择决定排名。

所以,从本周开始,我们尝试推出 Tabbit 大模型流行榜。

这份榜单只统计一个维度:上周在 Tabbit 内主动选择某个模型,并至少完成一次对话的去重用户数。

我们剔除了默认模型的影响,只有用户主动选择的模型才算数。

我们希望它能呈现当下 Tabbit 的用户究竟在选择和使用哪些模型。

以下是第一期 Tabbit 大模型流行榜,时间周期是 2026 年 8 月 10 日到 8 月 16 日。

Tabbit 大模型流行榜:2026 年 8 月 10 日至 8 月 16 日

未来,这个榜单将每周更新一次,为大家呈现用户真正在使用什么模型,以及这种偏好正在如何变化。

我们也会持续迭代这个榜单,为大家提供更多、更客观公正的模型评估。

如果你还想看到更多维度的榜单或分析,欢迎告诉我们。

当然,我们也知道这份榜单仅仅是衡量模型在 Tabbit 里的流行程度,而不是对模型能力的绝对判断。

Tabbit 用户群有偏差,场景有偏差,这个榜单不是模型能力唯一、绝对的判断。

不同的模型适配不同的场景和用户偏好,用户也会为不同任务切换不同模型。

我们无意挑起争论。我们想做的,是一份站在用户这边的排名——没有黑幕,也无题可刷。

把模型选择权交回给用户,正是 Tabbit 接入多模型的意义所在。

还没有尝试 Tabbit 的朋友,可以访问官网 www.tabbit.com,免费下载试用。

关注 Tabbit 浏览器微信公众号