LenserFight: Platforma lokalna do oceny agentów AI i podpowiedzi
LenserFight, stworzony przez Conectlens, to otwarta platforma do projektowania i benchmarkowania agentów AI, wielokrotnego użytku podpowiedzi oraz procesów oceny. Służy jako laboratorium AI, które pozwala zespołom tworzyć wersjonowane "Lenses", uruchamiać procesy robocze w postaci skierowanych acyklicznych grafów oraz organizować wydarzenia oceny, które łączą ocenę w oparciu o rubryki z ludzkim osądem. Narzędzie zawiera serwer Model Context Protocol (MCP), lokalne opcje wykonania modelu oraz publiczną arenę dla wspólnych dzienników. Docelowi użytkownicy to deweloperzy AI, inżynierowie podpowiedzi i badacze skoncentrowani na reprodukowalnej ocenie i prywatnym benchmarkingu.
Jakie zadania platforma pozwala określić i powtórzyć?
Platforma traktuje zadanie jako formalny "Lens", wersjonowaną specyfikację, która łączy w sobie podpowiedź, rubrykę oceny oraz opcjonalny schemat dla strukturalnych wyników. Lenses działają jako wielokrotnego użytku przypadki testowe, dzięki czemu zespoły mogą uruchamiać identyczne instrukcje w różnych modelach i zachować wersje dla audytowalności. Taki projekt wspiera strukturalne artefakty oceny, a nie ad-hoc podpowiedzi, co pomaga w porównywaniu wyników między uruchomieniami modeli lub replikacji eksperymentów.
Jak produkowane i porównywane są wyniki oceny?
Wydarzenia oceny wykorzystują model podwójnego punktowania, łącząc automatyczne punktowanie według rubryki z głosami społeczności, aby stworzyć publiczne rankingi i rankingi w stylu ELO. Połączenie to ma na celu zrównoważenie obiektywnych metryk rubryki z jakościowymi ocenami ludzkimi. Niezawodność zależy od projektu rubryki i próbkowania głosujących ludzi, więc porównania są tak samo powtarzalne, jak Lenses i zarejestrowane logi wykonania, które towarzyszą każdemu uruchomieniu.
Jakie wejścia i środowiska wykonawcze są wspierane?
Serwer MCP udostępnia ponad trzydzieści narzędzi do integracji z klientami Model Context Protocol, a platforma wspiera lokalną orkiestrację modeli przez Ollama, vLLM i llama.cpp. Klienci internetowi integrują się za pomocą OAuth 2.1 PKCE. Te opcje pozwalają zespołom na przeprowadzanie zarówno eksperymentów połączonych z chmurą, jak i offline, umożliwiając równoległe porównania lokalnych i zdalnych asystentów przez jeden punkt końcowy MCP.
Jak platforma wpisuje się w workflow z uwagą na prywatność?
Projekt przyjmuje lokalne podejście, umożliwiając offline'owe uruchomienia modeli do benchmarkingu i ochrony danych, a także oferując publiczną arenę społecznościową dla wspólnych logów i przewodników. Kod źródłowy jest otwarty na GitHubie, a projekt znajduje się w fazie eksperymentalnej beta, więc organizacje powinny planować aktywny rozwój, moderację społeczności Bitew oraz fazę technicznego przygotowania, zanim polegną na nim w formalnych ocenach.
Platforma odpowiada technicznie biegłym zespołom poszukującym powtarzalnych, lokalnie kontrolowanych porównań modeli
Platforma jest praktyczną opcją dla twórców AI i badaczy, którzy akceptują dodatkowy wysiłek związany z konfiguracją, aby uzyskać wersjonowane artefakty testowe i lokalną kontrolę wykonania. Jej eksperymentalny stan beta i model oceny oparty na społeczności oznaczają, że wyniki wymagają starannego projektowania rubryki i moderacji, aby były wiarygodne. Dla zespołów, które priorytetowo traktują powtarzalne benchmarki i lokalne uruchamianie modeli, platforma dostarcza jasne ramy oceny; dla użytkowników nietechnicznych złożoność konfiguracji może ograniczać natychmiastową użyteczność.





