从你记得的九成多,走向可比较的发现能力
通爻旧报告记录过 98.65%,恢复数据重跑后为 893/972,即 91.87%。旧方法每人最多重排 160 个候选,实际平均提名约 80.5 人;因此不能把它和这里的前十召回率直接比较。现在固定候选数量,同时公开找到与漏掉的关系,才能看出方法究竟把谁排到了前面。
现存 325 份规范化资料缺少一个旧关系端点,对应 9 条边。本次保留这个差异,使用可对应到资料的 963 条关系。其中有共同论文、同一开源组织和同一创业团队,也有 24 条人工挑选的跨来源种子关联。它们的来源与意义不同,完整结果按关系类型分别列出。
这次 J++ 具体做了什么
本地词面检索和 MiniLM 向量检索先给出候选,再用一个固定的融合规则排序。J++ 将每一对上下文交给同一类问题,组织并行计算、保存判断,并让排序结果继续成为下一步输入。实验保留了“只处理前二十候选”和“展开更多候选”的结果,也区分接受一个确定等级与对不确定读数做相对排序。
相对排序只表示哪些材料更值得先看,并不把尚无把握的关系变成确定事实。页面会保留不确定状态;没有历史标签的新候选仍需要读材料、联系本人或独立评阅。
怎样进一步检验“陌生发现”
现有资料中仍有共同论文内容和公司等直接线索,因此这个实验检验的是已有关系的恢复。严格的陌生发现测试,还应使用合作发生前或与目标合作无关的材料,把后来发生的合作留作标签。仅删除姓名或论文标题,若共同摘要仍在,就不能声称模型已在没有直接线索的情况下预测了合作。
实验规则与历史口径 · 下一步发现方法与研究资产 · 下载瓶颈诊断 · 实际 J++ 程序 · 下载页面全部结果 · 下载原始请求与回答录制