gitea_admin
  • Joined on 2026-07-29
gitea_admin pushed to test/eval-judges-trigger at gitea_admin/pragent 2026-08-31 19:20:02 +00:00
5b8be61e2f test: trigger review after DB rule insert
gitea_admin pushed to test/eval-judges-trigger at gitea_admin/pragent 2026-08-31 19:19:37 +00:00
3109bd7c2d pilot(eval): switch rule target from observation to trace
gitea_admin created branch test/eval-judges-trigger in gitea_admin/pragent 2026-08-31 18:37:44 +00:00
gitea_admin pushed to test/eval-judges-trigger at gitea_admin/pragent 2026-08-31 18:37:44 +00:00
d746b1fdc2 test: trigger review for eval judges
gitea_admin created pull request gitea_admin/pragent#14 2026-08-31 18:37:43 +00:00
test: eval judges e2e
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 18:36:09 +00:00
370adcde6f test: trigger after reopen
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 18:34:19 +00:00
84325e61c1 test: trigger review after .pr-review.json merged to main
gitea_admin pushed to main at gitea_admin/pragent 2026-08-31 18:34:04 +00:00
193a90e63e Merge pull request 'feat(eval): LLM-as-judge evaluators, dataset item fixes, and Experiments runs' (#13) from fix/dataset-item-url-safe-ids into main
1644c7f6b1 chore: enable pragent pilot on this repo (.pr-review.json on PR branch)
3543d15677 test: re-trigger after dedupe window
72ac0f76bc test: retrigger review after eval rule wiring
5d44121b28 feat(eval): LLM-as-judge evaluators for finding actionability and review self-consistency
Compare 7 commits »
gitea_admin merged pull request gitea_admin/pragent#13 2026-08-31 18:34:03 +00:00
feat(eval): LLM-as-judge evaluators, dataset item fixes, and Experiments runs
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 18:33:09 +00:00
1644c7f6b1 chore: enable pragent pilot on this repo (.pr-review.json on PR branch)
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 18:31:33 +00:00
3543d15677 test: re-trigger after dedupe window
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 18:26:08 +00:00
72ac0f76bc test: retrigger review after eval rule wiring
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 17:18:41 +00:00
5d44121b28 feat(eval): LLM-as-judge evaluators for finding actionability and review self-consistency
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 15:53:44 +00:00
2e1ad817e7 feat(eval): filterable item metadata and dataset runs for the Experiments tab
gitea_admin created branch fix/dataset-item-url-safe-ids in gitea_admin/pragent 2026-08-31 15:39:09 +00:00
gitea_admin pushed to fix/dataset-item-url-safe-ids at gitea_admin/pragent 2026-08-31 15:39:09 +00:00
1534a99630 fix(eval): dataset item ids that survive a URL path
gitea_admin created pull request gitea_admin/pragent#13 2026-08-31 15:39:06 +00:00
fix(eval): dataset item ids that survive a URL path
gitea_admin pushed to main at gitea_admin/pragent 2026-08-31 14:48:08 +00:00
d9eb4d9822 Merge PR #12: langfuse evaluation layer
2f96e66aab feat(pilot): behavioural scorers, feedback ground truth, and an eval dataset
Compare 2 commits »
gitea_admin merged pull request gitea_admin/pragent#12 2026-08-31 14:48:07 +00:00
feat(pilot): behavioural scorers, feedback ground truth, and an eval dataset
gitea_admin created pull request gitea_admin/pragent#12 2026-08-31 14:23:19 +00:00
feat(pilot): behavioural scorers, feedback ground truth, and an eval dataset