Embedding 向量的核心作用,是把原本不可计算的语义关系转化为向量空间中的几何关系。模型在训练时持续优化一个目标:让语义相近的样本在空间中彼此靠近,让无关样本彼此远离。训练完成后,每段文本、每张图片都被映射为高维空间中的一个点——坐标数值本身没有意义,点与点之间的相对位置才承载意义。"两句话像不像"这个模糊判断,由此变成"两个点距离多远"这个可计算问题。

坐标可比的前提,是选定合适的度量方式。余弦相似度只关心两个向量的夹角方向,对长度不敏感,适合比较语义取向;欧氏距离同时受方向和模长影响,当向量幅值本身携带信息时更合适。工程上有一个常用处理:先对向量做归一化,此时余弦相似度与内积在数学上等价,计算更稳定,索引构建也更高效。度量方式选错,同一批向量会给出完全不同的近邻名单,这一步不能照搬默认配置。
维度决定了空间的表达容量,也决定了计算成本。低维空间装不下细粒度的语义差异,高维空间则会引入"维度诅咒":随着维度上升,点与点之间的距离趋于接近,最近邻的区分度下降,还容易出现 hub 现象——少数点异常频繁地成为大量其他点的最近邻,污染检索结果。选择维度本质上是在表达力、检索质量与资源消耗之间做权衡,需要用自己的数据实测,而不是直接采用最大维度。
判断一套 Embedding 是否真正"可比",最直接的办法是抽样验证:取若干条真实内容,检查其最近邻是否符合语义直觉。如果近邻名单中频繁出现明显无关的结果,问题通常出在模型与语种、文本长度不匹配,或度量方式与归一化处理不当。坐标系搭对了,检索、推荐、聚类这些上层应用才有可靠的地基;坐标系搭错了,再复杂的下游逻辑也只是在错误的地图上导航。
参与讨论
暂无评论,快来发表你的观点吧!