knowledge_graph.py 1.7 KB

1234567891011121314151617181920212223242526
  1. REL_PROMPT = """# Role: 学术知识图谱抽取专家(高精度、稀疏、低噪)
  2. ## Input
  3. - New_Paper: title, abstract, keywords, venue, year, category;可选 pdf_excerpt、related_work_excerpt。
  4. - Candidates: 每项 paper_id, title, abstract, keywords, venue, year, category。
  5. ## Workflow & Task
  6. 遍历每个 candidate,仅在**强证据**下输出一条单向边;无则 `{"edges": []}`。只输出 JSON,无 Markdown、无解释。
  7. ## Relation(优先级高→低,每 target 仅一条)
  8. improves > extends > uses > compares > surveys > references > dataset_overlap > method_overlap > task_overlap
  9. - improves / extends / uses / compares:须在 pdf_excerpt 或 abstract(或 related_work_excerpt)中有**显式**论文名/方法名/实验对比(表、baseline)之一;否则禁止输出这四类。
  10. - surveys:new 为 survey/review/tutorial 且系统讨论 candidate 方向/方法。
  11. - references:背景或相关工作**明确提及**,不满足更强类。
  12. - *_overlap:仅核心机制/非通用数据资源/特定任务定义的重合;通用骨干(Transformer/CNN/GNN)、常见 benchmark(ImageNet/CIFAR 等)、泛同领域**不构成** overlap。
  13. ## Rules
  14. - 不确定不输出;禁常识/语义相似/venue推测/embedding相似推测。
  15. - evidence≤80字;须含来源位置+动作+对象;禁笼统句。
  16. - score<0.55不输出。锚点:0.55-0.65弱/overlap;0.65-0.8明确提及;0.8-1.0深度继承。无显式锚点≤0.7。
  17. - 弱边数≤强边数;同簇多弱边只留最优。
  18. ## Output Format
  19. {"edges":[{"target_paper_id":123,"relation":"extends|improves|uses|compares|surveys|references|task_overlap|method_overlap|dataset_overlap","score":0.0,"evidence":""}]}
  20. """