AI AUDITOR

Информация

AI AUDITOR разбирает проекты, стартапы и питч-деки. Материал прогоняется по выбранной методике четырьмя моделями разных производителей — Claude, GPT, Gemini и Grok — независимо друг от друга, после чего расхождение между ними измеряется и показывается как часть заключения. Здесь описано устройство платформы, научная и математическая основа, все десять методик, все функции и порядок работы.

Принцип

четыре прохода, из которых числа считает код

Обычный AI-разбор устроен так: одна модель читает документ и выдаёт мнение с уверенной интонацией. Проверить это мнение нечем — второе мнение той же модели будет тем же мнением. AI AUDITOR устроен иначе.

1 · Разбор

Каждая модель проходит выбранную методику самостоятельно, не видя ответов остальных. Порядок и формулировки одинаковы для всех.

выполняют модели
2 · Оценка

Каждая модель выставляет собственные числа от 0 до 100 по измерениям методики, опираясь на свой же разбор.

выполняют модели
3 · Расчёт

Средние значения, разброс и индекс согласия считаются формулой в коде. Ни одна модель на эти числа не влияет.

выполняет код
4 · Заключение

Председатель собирает текст поверх готовых чисел: разногласия, флаги, план действий, запросы к компании. Менять числа ему запрещено.

выполняет модель

Почему именно четыре производителя, а не четыре роли одной модели: выигрыш коллективного разбора равен разнообразию мнений. Если участники ошибаются одинаково — а модели одного семейства обучены на пересекающихся данных и ошибаются похоже, — то коллегия из десяти таких участников по точности равна одному. Разные производители дают разные архитектуры, разные обучающие корпуса и разные слепые зоны, поэтому их согласие несёт информацию, а согласие клонов — нет.

Научная и математическая основа

почему это работает, а не «кажется, что работает»

Идея коллективного разбора описана математически задолго до языковых моделей. Платформа переносит четыре классических результата на разбор материала несколькими ИИ и соблюдает их условия в конструкции.

РезультатЧто утверждаетКак соблюдено в AI AUDITOR
Теорема присяжных Кондорсе
1785
Если каждый из N участников независимо отвечает верно с вероятностью выше половины, вероятность верного решения большинства растёт с N.Четыре участника вместо одного; каждый — сильнейшая модель своего производителя.
Разложение ошибки ансамбля
Krogh & Vedelsby, 1995
Ошибка коллектива равна средней ошибке участников минус разнообразие их мнений. Разногласие снижает ошибку коллектива.Разброс оценок показывается, а не усредняется втихую; карта разногласий — часть заключения.
Коррелированные ошибки
Брейман, случайные леса, 2001
При высокой корреляции ошибок между участниками добавление участников почти ничего не даёт. Копии одного эксперта — один эксперт.Участники — разные производители с разными архитектурами и обучающими корпусами, а не роли одной модели.
Требование независимости
Lorenz и соавт., PNAS, 2011
Даже слабое социальное влияние разрушает мудрость толпы: узнав чужие оценки, участники сближают свои.Первый и второй проходы полностью изолированы — модели не видят ответов друг друга; синтез идёт только после расчёта.

Формулы расчёта

Все числа в заключении выводятся детерминированно из независимых оценок. Ниже — точные формулы, реализованные в модуле расчёта.

ВеличинаФормулаПояснение
Оценка агентаsa,d ∈ [0, 100]Число, которое модель a выставила измерению d на основе собственного разбора.
Балл измеренияSd = mean(s·,d)Среднее по всем ответившим моделям.
Разбросσd = stdev(s·,d)Выборочное стандартное отклонение оценок по измерению.
Согласие по измерениюCd = 100 · (1 − min(1, σd / 25))Разброс в 25 пунктов по стопунктовой шкале принят за полное разногласие: C = 0. Совпадение оценок даёт C = 100.
Индекс согласияI = Σd Cd·nd / Σd ndСреднее по измерениям, взвешенное числом ответивших моделей nd.
Общий баллS = Σd wd·Sd / Σd wdВзвешенное среднее баллов измерений; веса wd заданы в методике и опубликованы.
Независимостьvalid = |производителей| ≥ 3При менее чем трёх производителях индекс помечается справочным: согласие участников с общей архитектурой не является независимым подтверждением.
Уровень согласияI ≥ 85 · 70–84 · 50–69 · < 50Согласие · умеренное согласие · раскол · сильное расхождение.
Что это даёт на практике. Балл 72 от одной модели — это мнение. Балл 72 при индексе согласия 90 и четырёх производителях — это измерение: четыре независимые архитектуры прочитали материал одинаково. Балл 72 при индексе 40 — сигнал, что документ допускает разные прочтения, и средний балл сам по себе ничего не значит. Платформа показывает все три числа, а не одно.

Индекс согласия

главная величина заключения

По каждому измерению методики собираются оценки всех моделей. Индекс показывает, насколько они сошлись: 100 — оценки совпали, 0 — разошлись предельно. За полное разногласие принят разброс в 25 пунктов по стопунктовой шкале. Общий индекс — среднее по измерениям, взвешенное числом оценивших.

ЗначениеУровеньКак читать
85–100СогласиеВсе модели видят материал одинаково. Вывод устойчив; сомнения касаются самой методики, а не прочтения.
70–84Умеренное согласиеРасхождения есть, но по частностям. Смотрите карту разногласий — там названы конкретные пункты.
50–69РасколМодели читают материал по-разному. Обычно означает, что документ допускает два прочтения — это дефект документа, а не моделей.
0–49Сильное расхождениеМатериала недостаточно, чтобы прийти к общему выводу. Опираться на средний балл нельзя, работайте по списку запросов.
Правило независимости. Если в разборе участвовали модели менее чем трёх производителей, индекс помечается как справочный и не считается независимым подтверждением. При одном производителе это указывается прямо в заключении. Мы не выдаём согласие клонов за проверку — на этом построена вся платформа.

Десять методик

выбираются одной кнопкой на рабочем экране

Каждая методика — это собственный набор измерений и собственный системный промпт, воспроизводящий логику конкретного подхода. Методики принадлежат их авторам; здесь они реализованы по публичным описаниям и названы, чтобы было видно происхождение подхода.

Sequoia · Business Plan

Sequoia Capital

Десять обязательных элементов инвестиционной истории по публичному руководству фонда «Writing a Business Plan».

Что проверяет
Полноту и связность истории, а не качество бизнеса. Быстрее всех остальных находит структурные дыры.
Измерения
Назначение компании · Проблема · Решение · Почему сейчас · Размер рынка · Конкуренты · Бизнес-модель · Команда · Финансы · Видение
Когда выбирать
Первый прогон любого дека. Перед рассылкой инвесторам.
Как читать
Низкая оценка означает отсутствующий или размытый элемент истории, а не плохой бизнес.
Чего не даёт
Ничего не говорит о честности цифр и об экономике.

a16z · 16 метрик

Andreessen Horowitz

Разбор заявленных цифр по методике «16 Startup Metrics» с её же перечнем типовых подмен.

Что проверяет
Означают ли числа то, что как будто означают. Букинг под видом выручки, оборот площадки под видом дохода, смешанный CAC, LTV по выручке вместо чистой прибыли, накопительные графики, которые растут даже у падающего бизнеса, оси без подписей.
Измерения
Выручка и букинги · Повторяемость выручки · Валовая прибыль · GMV против выручки · CAC и LTV · Отток · Темп роста · Сжигание и запас · Метрики тщеславия · Честность графиков
Когда выбирать
Когда в деке много цифр и они выглядят слишком хорошо.
Как читать
Низкая оценка — это не «мало продаж», а «цифра не значит того, что заявлено».
Чего не даёт
Не оценивает рынок и команду.

Bessemer · Эффективность

Bessemer Venture Partners

Efficiency Score — чистый прирост ARR, делённый на чистое сжигание, плюс сопутствующие метрики.

Что проверяет
Во что компании обходится рост. Шкала Bessemer для компаний до 30 млн долларов ARR: ниже 0,5x — good, от 0,5x до 1,5x — better, выше 1,5x — best.
Измерения
Efficiency Score · Темп роста · Удержание выручки · Окупаемость привлечения · Валовая маржа · Правило 40 · Запас хода · Обоснованность запроса
Когда выбирать
Для компаний с выручкой, особенно подписных. На поздних стадиях — основная методика.
Как читать
Методика количественная: без цифр в материале часть измерений останется неоценённой — и это тоже результат.
Чего не даёт
Бесполезна для проектов до выручки.

YC · Рост и нужность

Y Combinator · Пол Грэм

Стартап — это рост: недельный темп, соответствие основателя рынку и доказательство того, что продукт кому-то по-настоящему нужен.

Что проверяет
Делает ли компания то, чего люди хотят, и чем это доказано. Ориентир Пола Грэма — 5–7% роста в неделю как хороший темп, 10% как исключительный. Слова «интерес», «пилот» и «письмо о намерениях» доказательством не считаются.
Измерения
Нужность продукта · Недельный темп · Выбор главной метрики · Основатель и рынок · Понимание пользователя · Ясность объяснения · Потенциал масштаба
Когда выбирать
Ранние стадии, заявки в акселераторы, проверка продуктовой гипотезы.
Как читать
Методика жёстко смотрит на доказательства спроса и почти не интересуется оформлением.
Чего не даёт
Не проверяет юридические и финансовые риски.

Porter · Пять сил

Майкл Портер · Harvard Business School

Классический разбор отраслевой привлекательности: соперничество, новые игроки, заменители, власть покупателей, власть поставщиков.

Что проверяет
Есть ли в этой отрасли прибыль в принципе и кому она достанется. Для технологических компаний владельцы платформ, моделей, данных и каналов рассматриваются как поставщики.
Измерения
Соперничество внутри отрасли · Угроза новых игроков · Угроза заменителей · Власть покупателей · Власть поставщиков · Защищаемость позиции
Когда выбирать
Когда сомнение вызывает не компания, а сама отрасль.
Как читать
Высокая оценка означает благоприятную для компании силу, низкая — давление на прибыль с этой стороны.
Чего не даёт
Ничего не говорит об исполнении и команде.

Point Nine · Путь к $100M

Point Nine Capital · Кристоф Янц

Пять способов построить бизнес на сто миллионов: слоны, олени, кролики, мыши и мухи.

Что проверяет
Арифметическую сходимость модели: тысяча клиентов по 100 000, десять тысяч по 10 000, сто тысяч по 1 000, миллион по 100 или десять миллионов по 10 — и соответствует ли выбранному пути способ продаж и стоимость привлечения.
Измерения
Выбор пути · Цена и объём · Способ продаж · Стоимость привлечения · Воронка нужного размера · Расширение внутри клиента
Когда выбирать
Когда в деке есть цена и заявлена цель по выручке.
Как читать
Главная находка — несоответствие: продукт для «мышей», продаваемый как «слонам».
Чего не даёт
Не оценивает продукт и технологию.

COSO ERM · Риски

COSO · стандарт 2017 года

Разбор по пяти компонентам международного стандарта управления рисками.

Что проверяет
Управляема ли организация, а не привлекательна ли возможность. Пять компонентов стандарта: управление и культура; стратегия и постановка целей; исполнение; пересмотр; информация, коммуникация и отчётность.
Измерения
Управление и культура · Стратегия и цели · Исполнение · Пересмотр · Информация и отчётность · Ключевые риски · Меры реагирования
Когда выбирать
Перед сделкой, при проверке зрелой компании, при внутреннем аудите проекта.
Как читать
Методика аудиторская, а не венчурная: она ищет отсутствие контроля, а не отсутствие роста.
Чего не даёт
Не оценивает потенциал доходности.

Коммерческий дью-дилидженс

практика стратегического консалтинга и Big Four

Стандартный контур предынвестиционной проверки: рынок, клиенты, конкуренты, прогноз, качество выручки, красные флаги.

Что проверяет
Обоснованность прогноза и устойчивость выручки. Все существенные утверждения делятся на подтверждённые текстом, требующие документов и неподтверждаемые в принципе.
Измерения
Обоснование рынка · Клиентская база · Конкурентная позиция · Качество прогноза · Качество выручки · Операционная модель · Правовая экспозиция · Красные флаги
Когда выбирать
Когда решение о сделке уже близко и нужен список запросов к компании.
Как читать
Результат — перечень красных флагов и до десяти документов, которые нужно запросить.
Чего не даёт
Не заменяет проверку первичных документов человеком.

Команда

Вассерман · Грэм · Диксон · практика дью-дилидженса

Проекты делают люди: соответствие основателей рынку, покрытие функций, подтверждённый опыт, вовлечённость, связка сооснователей. Подробная страница методики →

Что проверяет
Доказательства, а не людей. Источники: исследование Ноама Вассермана «The Founder’s Dilemmas» (почти десять тысяч основателей), пять качеств основателей по Полу Грэму, founder/market fit Криса Диксона, стандартная практика проверки команды перед сделкой. Каждое утверждение о человеке относится к одному из трёх классов: подтверждено, декларировано, непроверяемо.
Измерения
Основатель и рынок · Покрытие функций · Подтверждённый опыт · Вовлечённость · Связка сооснователей · Зависимость от одного · Пробелы и план найма · Качества основателей · Проверяемость заявлений
Когда выбирать
Всегда перед решением: рынок и продукт может исправить команда, команду не исправит ничего.
Как читать
Низкий балл чаще всего означает «не показано», а не «плохая команда». Список запросов в конце — главный результат.
Чего не даёт
Не делает выводов о характере и не учитывает защищённые признаки — это зашито в промпт как запрет.

Инвесткомитет

собственная методика AI AUDITOR

Четыре модели занимают позиции членов инвестиционного комитета и голосуют за сделку или против.

Что проверяет
Не усреднённую оценку, а спор: три сильнейших аргумента за, три против, дилбрейкер и условие, при котором участник изменил бы мнение.
Измерения
Убеждённость · Сила возражений · Наличие дилбрейкера · Достаточность оснований · Условия входа · Путь к выходу
Когда выбирать
Финальный прогон перед решением; подготовка основателя к защите.
Как читать
Ценность не в итоговом балле, а в том, какие возражения прозвучали и что их снимает.
Чего не даёт
Это симуляция позиции, а не решение реального комитета.

Функции

что платформа делает с материалом

Разбор PDF по страницам

Питч-дек загружается файлом; текст извлекается постранично прямо в браузере, с разметкой номеров страниц — модели видят, на каком слайде что сказано. Принимаются также TXT, MD, JSON, CSV и вставленный текст.

Выбор методики одной кнопкой

Девять методик. Смена методики полностью меняет измерения, промпты и форму заключения. Материал при этом не перезагружается.

Четыре независимые модели

Claude, GPT, Gemini и Grok проходят методику параллельно и не видят ответов друг друга. Достаточно одного ключа, но при трёх и более производителях согласие засчитывается как независимое подтверждение.

Живой выбор моделей

Платформа не хранит зашитый список версий: перед разбором она спрашивает у каждого производителя, какие модели доступны по вашему ключу, и берёт сильнейшую. Выход новой версии у производителя подхватывается сам, без правок в коде.

Проверка ключей у производителя

Ключ проверяется через секунду после ввода: зелёный кружок означает «принят», рядом показана модель, которая пойдёт в разбор; красный — причина отказа простыми словами.

Индекс согласия

Считается формулой в коде по независимым оценкам моделей. Ни одна модель не может на него повлиять. По каждому измерению видны средний балл, минимум, максимум и уровень согласия.

Карта разногласий

Где модели разошлись, какие позиции они заняли, что меняется в решении в зависимости от того, кто прав, и какие данные закроют спор.

Флаги

Красный — серьёзный риск или неподтверждённое утверждение, жёлтый — требует уточнения, зелёный — подтверждённый сигнал.

План действий

Пять исправлений по приоритету: что сделать, зачем, каких усилий стоит и какое измерение поднимет.

Запросы к компании

До десяти конкретных документов и цифр, которые нужно запросить, чтобы закрыть пробелы. Формируются в методиках дью-дилидженса и эффективности.

Границы вывода

Отдельный раздел «чего не хватило» и «что заключение не утверждает». Он есть в каждом заключении и не отключается.

Полные разборы каждой модели

В заключении сохраняются исходные тексты всех четырёх разборов — можно прочитать, что именно написала каждая модель, а не только сводку.

Ссылка, PDF и JSON

Заключение живёт по собственному адресу и открывается без входа. Печатается в PDF из браузера, выгружается в JSON для дальнейшей обработки.

Ключи остаются у вас

Ключи хранятся в вашем браузере и уходят напрямую к производителю модели. Материал не сохраняется как отдельный документ и не передаётся третьим лицам.

Инструкция

полный порядок работы
  1. Подготовьте материалПитч-дек в PDF, описание проекта, бизнес-план или выгрузку слайдов. Чем больше конкретики — цифр, названий, сроков, — тем содержательнее заключение. Минимум для запуска — 200 символов, разумный объём — от одной страницы.
  2. Откройте рабочий экран и загрузите файлПеретащите PDF в поле загрузки или нажмите на него и выберите файл. Текст извлечётся автоматически, номера страниц сохранятся. Если PDF собран из картинок без текстового слоя, извлечь не удастся — вставьте текст вручную в поле ниже.
  3. Опишите задачу, если она естьОдна строка вроде «оцениваем для посевного раунда, чек 500 тысяч» или «готовим к защите перед советом директоров» заметно меняет фокус разбора. Поле необязательное.
  4. Выберите методикуНажмите одну из десяти кнопок. Под кнопками появится список измерений выбранной методики и подсказка, как читать её результат. Если не уверены — начните с Sequoia: она показывает структурные дыры, которые всё равно придётся закрывать.
  5. Введите ключи доступаДостаточно одного, но лучше все четыре. Кружок рядом с названием производителя загорается зелёным, когда ключ принят. Ключи сохраняются в браузере — вводить их повторно не нужно. Где их взять, подробно описано ниже.
  6. Нажмите «Провести аудит»Прогон занимает от одной до трёх минут: сначала каждая модель разбирает материал, потом выставляет оценки, потом считается индекс согласия, потом собирается заключение. На экране видно, какой этап идёт.
  7. Прочитайте заключениеОно откроется в новой вкладке. Смотрите в таком порядке: индекс согласия и пометка о независимости — общий балл — измерения с разбросом — карта разногласий — план действий. Если индекс ниже 50, средний балл ничего не значит: работайте по списку запросов.
  8. Сохраните или перешлитеКнопка «Сохранить в PDF» печатает заключение, «Скопировать ссылку» даёт адрес, который открывается без входа, «Выгрузить JSON» отдаёт машиночитаемую версию.
  9. Исправьте и прогоните ещё разПосле правок запустите ту же методику повторно и сравните: балл, индекс согласия и разброс по измерениям покажут, стало ли лучше на самом деле или только на словах.
Совет. Один и тот же дек имеет смысл прогнать двумя методиками: Sequoia покажет дыры в истории, а a16z — подмены в цифрах. Это два разных класса проблем, и находятся они разными инструментами.

Где взять ключи

пошагово, без технических терминов

Ключ доступа — это длинная строка символов, которая говорит производителю модели, что запрос ваш и что оплатить его нужно с вашего счёта. Ключ вводится один раз и хранится в вашем браузере. Оплата почти у всех происходит по факту использования: вы кладёте небольшую сумму на счёт и тратите её по мере работы. Один аудит расходует очень немного — обычно доли доллара, потому что материал небольшой.

  1. Anthropic — модель ClaudeОткройте console.anthropic.com и войдите или зарегистрируйтесь по почте. В левом меню найдите раздел «API Keys» (ключи). Нажмите «Create Key», дайте ключу любое понятное название, например «Аудитор». Ключ покажут один раз — сразу скопируйте его целиком и вставьте в поле «Anthropic · Claude» на рабочем экране. Перед первым запуском в разделе «Billing» (оплата) нужно пополнить счёт — минимальной суммы хватит надолго.
  2. OpenAI — модель GPTОткройте platform.openai.com/api-keys, войдите под своей учётной записью. Нажмите «Create new secret key», назовите ключ и скопируйте его — он тоже показывается только один раз. Вставьте в поле «OpenAI · GPT». Счёт пополняется в разделе «Billing». Обратите внимание: учётная запись ChatGPT и платформенный счёт — разные вещи, подписка на ChatGPT не даёт доступа к ключу.
  3. Google — модель GeminiОткройте aistudio.google.com/app/apikey и войдите обычным аккаунтом Google. Нажмите «Create API key», выберите проект, если его попросят выбрать, — подойдёт любой. Ключ появится сразу, скопируйте его в поле «Google · Gemini». У Google есть бесплатный уровень с ограничением по числу запросов — для начала его обычно достаточно.
  4. xAI — модель GrokОткройте console.x.ai, войдите или зарегистрируйтесь. Найдите раздел «API Keys», нажмите создание нового ключа, скопируйте его в поле «xAI · Grok». Счёт пополняется там же, в разделе оплаты.
Три правила безопасности. Никому не пересылайте ключ — он равнозначен доступу к вашему счёту. Не вводите ключи на чужом компьютере: они сохранятся в его браузере. Если ключ куда-то попал, зайдите в тот же раздел на сайте производителя и удалите его — после удаления он перестаёт работать немедленно, а новый создаётся за минуту.
Как проверяется ключ. Через секунду после ввода платформа спрашивает у производителя список доступных по этому ключу моделей. Если список пришёл — кружок загорается зелёным, а рядом появляется название модели, которая будет использована в разборе (лучшая из доступных). Если производитель ключ отклонил — кружок красный и рядом причина простыми словами: скопирован не полностью, нет средств на счёте, нет прав. Разбор с отклонённым ключом не запускается, остальные производители работают как обычно.

Границы

что AI AUDITOR не утверждает

Источники методик